overview
Qu'est-ce que l'inférence de génération de texte de Hugging Face ?
Hugging Face Text Generation Inference (TGI) est une infrastructure robuste pour les grands modèles de langage (LLMs), conçue pour une performance et une efficacité optimales. Grâce à sa compatibilité avec divers frameworks et accélérateurs, TGI permet aux développeurs de déployer et de faire évoluer les LLMs en toute simplicité dans des environnements de production.
- Optimisé pour vLLM, TensorRT et DeepSpeed.
- Offre une gestion efficace des ressources avec une quantification flexible.
- Soutient une variété de cas d'utilisation, y compris les chatbots, la génération de code, et plus encore.
