overview
¿Qué es vLLM?
vLLM Open Runtime es una pila de inferencia de código abierto que ofrece un rendimiento y eficiencia de memoria inigualables para el servicio de grandes modelos de lenguaje. Con su innovador caché KV paginado, garantiza un rendimiento óptimo, convirtiéndose en la solución preferida para desarrolladores en todo el mundo.
- De código abierto y impulsado por la comunidad.
- Diseñado específicamente para el servicio de LLM de alto rendimiento.
- Se integra de manera flexible con los ecosistemas existentes.
