overview
Что такое Hugging Face Text Generation Inference?
Hugging Face Text Generation Inference (TGI) — это мощный стек обслуживания для крупных языковых моделей (LLM), разработанный для достижения оптимальной производительности и эффективности. Совместимость с различными фреймворками и ускорителями позволяет разработчикам без труда разворачивать и масштабировать LLM в продуктивных средах.
- Оптимизировано для vLLM, TensorRT и DeepSpeed.
- Предлагает эффективное управление ресурсами с гибкой квантизацией.
- Поддерживает множество сценариев использования, включая чат-ботов, генерацию кода и многое другое.
