overview
Was ist TensorRT-LLM?
TensorRT-LLM ist eine hochmoderne Lösung, die darauf ausgerichtet ist, die Leistung von Transformer-Modellen durch optimierte Kerne und fortschrittliche Quantisierungstechniken zu verbessern. Egal, ob Sie KI-Anwendungen in Cloud- oder Edge-Umgebungen implementieren, unser Tool sorgt dafür, dass Sie mühelos latenzfreie Inferenz bereitstellen können.
- Unterstützt verschiedene Transformer-Architekturen.
- Für sowohl Trainings- als auch Servierphasen entwickelt.
- Lässt sich problemlos in bestehende NVIDIA-Ökosysteme integrieren.
