overview
¿Qué es la Inferencia de Generación de Texto de Hugging Face?
Hugging Face Text Generation Inference (TGI) es un servidor de vanguardia, listo para producción, diseñado para desplegar de manera eficiente modelos de lenguaje de gran tamaño. Ofrece un rendimiento excepcional tanto en configuraciones locales como en la nube.
- Soporta múltiples marcos: vLLM, TensorRT y DeepSpeed.
- Optimizado para un alto rendimiento con lotes continuos.
- Ideal para aplicaciones en tiempo real a gran escala.
