overview
Qu'est-ce que vLLM Open Runtime ?
vLLM Open Runtime est une plateforme d'inférence open-source conçue pour améliorer le service des modèles d'IA. Grâce à son cache KV innovant et paginé, elle permet un débit optimisé et une latence minimale, ce qui la rend idéale pour des environnements à forte demande.
- Open-source et dirigé par la communauté
- S'intègre parfaitement à votre infrastructure existante.
- Optimisé pour des charges de travail variées en intelligence artificielle
