overview
¿Qué es TensorRT-LLM?
TensorRT-LLM es la innovadora herramienta de NVIDIA diseñada para optimizar la inferencia de modelos de lenguaje de gran tamaño (LLM). Al utilizar núcleos de TensorRT e integración con Triton, optimiza las implementaciones para ofrecer un rendimiento y eficiencia excepcionales.
- Optimizado para GPUs NVIDIA Hopper y B200.
- Soporta tanto Windows (beta) como configuraciones de múltiples GPU y múltiples nodos.
- Personalizable con una API modular de Python para facilitar su uso.
