overview
O que é a Inferência de Geração de Texto da Hugging Face?
Hugging Face Text Generation Inference é um servidor de inferência de ponta projetado para grandes modelos de linguagem (LLMs). Ele permite que desenvolvedores e empresas atendam e escalem suas aplicações de LLM de forma eficiente em um ambiente de produção.
- Suporte para Rust, Python e gRPC em produção.
- Ideal para implantação tanto em nuvem quanto local.
