overview
Что такое Run:ai Inference?
Run:ai Inference — это мощный оркестратор GPU-нагрузок, разработанный для бесперебойного развертывания загрузок Triton и TensorRT в рамках кластеров. Он позволяет эффективно предоставлять ИИ-модели конечным пользователям, обеспечивая их постоянную работоспособность.
- Сосредоточьтесь на клиентских AI-приложениях.
- Динамическое распределение ресурсов с использованием нативного развертывания Kubernetes
- Интеграция с популярными фреймворками машинного обучения, такими как PyTorch и TensorFlow.
