Skip to content
Outil d'IA

Revue de Modular

Modular est un moteur et une plateforme d'IA unifiés conçus pour rendre l'IA accessible et efficace sur diverses architectures matérielles et frameworks de machine learning.

shipped 30 juil. 2026aifreemium
ai
Modular — product screenshot

Pourquoi c'est important

1Acquis par Qualcomm le 29 juillet 2026, pour renforcer les logiciels d'IA générative et agentique.
2La version Modular 26.4 (18 juin 2026) a introduit la diffusion de mélange d'experts (MoE) de pointe.
3A levé 250 millions de dollars lors de son troisième cycle de financement (24 septembre 2025), valorisant l'entreprise à 1,6 milliard de dollars.
4A atteint les meilleures performances sur les GPU Blackwell B200 de Nvidia et MI355X d'AMD avec la même plateforme logicielle.

À propos de Modular

Modèle économique
Usage-Based (Pay Per Use)
Tarification à l’usage
Pay-per-token per token
Siège social
San Francisco, USA
Taille de l’équipe
100-250
Plateformes
Web, API, Cloud, On-premises
Public cible
AI developers, data scientists, enterprises focusing on AI deployment

Formules tarifaires

Shared Endpoints
Pay-per-token / per-token
  • High-performance inference
  • No infrastructure management
  • Test easily
Dedicated Endpoints
Pay-per-minute / per-minute
  • Reserved NVIDIA and AMD GPUs
  • Flexible pricing
Custom Models
Pay-per-minute / per-minute
  • Deploy custom or fine-tuned models
  • Optimized infrastructure

Exemples de coûts

  • Cost varies based on usage
API DocsGitHubOpen Source

Spécifications

Documentation API

API disponible

Oui, API publique

overview

Qu'est-ce que Modular ?

Modular est une entreprise de plateforme de développement native de l'IA qui permet aux développeurs d'IA, aux développeurs d'applications et aux entreprises de construire une plateforme d'inférence d'IA unifiée, haute performance et portable. Elle vise à abstraire les complexités matérielles, permettant aux développeurs de déployer et de faire évoluer les modèles d'IA efficacement sur divers matériels. Modular fournit une plateforme d'inférence d'IA unifiée conçue pour un calcul portable et haute performance, optimisant les pipelines d'IA des noyaux GPU aux points d'API. Sa mission principale est de permettre aux développeurs d'exécuter des modèles d'IA ouverts populaires avec des performances GPU et CPU de pointe sans nécessiter de modifications de code, abstrayant ainsi la complexité matérielle. La plateforme prend en charge plus de 500 modèles d'IA de Hugging Face via une API REST compatible OpenAI et facilite la mise à l'échelle de services d'inférence GenAI massifs sur des milliers de nœuds GPU.

features

Fonctionnalités clés de Modular

Modular offre un ensemble complet de fonctionnalités conçues pour améliorer l'efficacité du développement et du déploiement de l'IA sur diverses architectures matérielles et frameworks.

  • Pile d'inférence d'IA unifiée pour des performances constantes.
  • Prise en charge de plusieurs plateformes matérielles, y compris NVIDIA, AMD, Intel, ARM et Apple Silicon.
  • Compatibilité avec plus de 30 modèles de pointe de Hugging Face.
  • Options de tarification à l'usage pour une allocation flexible des ressources.
  • Options de déploiement flexibles dans des environnements cloud ou une infrastructure sur site.
  • API REST compatible OpenAI pour la diffusion de modèles.
  • Langage de programmation Mojo pour les opérations personnalisées et le développement de noyaux GPU.
  • Chaîne d'outils Slim pour un développement et une compilation plus rapides en quelques secondes.
  • Routage intelligent des charges de travail pour maximiser le débit et minimiser la latence dans les déploiements GenAI.

use cases

Qui devrait utiliser Modular ?

Modular est principalement conçu pour les développeurs d'IA, les développeurs d'applications et les entreprises cherchant à optimiser et à faire évoluer leurs déploiements d'IA dans divers environnements matériels.

  • Développeurs d'IA : Pour l'inférence et le déploiement d'IA haute performance sur diverses architectures matérielles et environnements cloud, y compris l'écriture d'opérations personnalisées et de noyaux GPU en Mojo.
  • Développeurs d'applications : Pour le développement et le déploiement unifiés d'IA des charges de travail PyTorch et TensorFlow, simplifiant les chaînes d'outils et atteignant la portabilité matérielle.
  • Entreprises : Pour la mise à l'échelle de services d'inférence d'IA générative (GenAI) à grande échelle, l'accélération des innovations GenAI et l'atteinte de l'indépendance vis-à-vis des fournisseurs pour les modèles d'IA.

how to use

Comment utiliser Modular

Pour commencer à utiliser Modular, les développeurs peuvent tirer parti de sa plateforme unifiée pour déployer et optimiser les modèles d'IA. La plateforme prend en charge un déploiement en conteneur Docker unique et offre une API compatible OpenAI pour la diffusion de modèles.

  • 1Accédez à la plateforme Modular via son interface web ou son API.
  • 2Choisissez parmi plus de 500 modèles d'IA pré-optimisés de Hugging Face.
  • 3Déployez des modèles à l'aide d'un seul conteneur Docker (moins de 1 Go) pour une configuration efficace.
  • 4Utilisez l'API REST compatible OpenAI pour la diffusion de modèles et l'intégration dans les applications.
  • 5Développez des modèles personnalisés et optimisez les performances à l'aide du langage de programmation Mojo.
  • 6Surveillez et mettez à l'échelle les services d'inférence GenAI sur divers backends matériels.

pricing

Tarification et plans Modular

Modular fonctionne sur un modèle freemium avec des niveaux de tarification basés sur l'utilisation conçus pour la flexibilité. Il comprend un niveau gratuit pour l'exploration initiale et offre une tarification distincte pour différents besoins de déploiement.

  • Shared Endpoints : Paiement par jeton pour une utilisation générale.
  • Dedicated Endpoints : Paiement par minute pour un accès constant et haute performance.
  • Custom Models : Paiement par minute pour les déploiements de modèles spécialisés.

Pros

  • +Mojo programming language combines Python's ease of use with C++/CUDA performance, addressing the 'two-language problem' in AI.
  • +Modular Platform (MAX) provides a unified AI inference stack, abstracting hardware complexity for portable, high-performance model deployment.
  • +Achieves significant performance gains, with Mojo benchmarks showing up to 35,000 times faster execution than Python in specific scenarios.
  • +Offers broad hardware compatibility, supporting NVIDIA, AMD, Intel, ARM, and Apple Silicon.
  • +Simplified community license allows free non-production commercial use and production use on CPUs and NVIDIA GPUs.
  • +Acquisition by Qualcomm on June 24, 2026, indicates strong industry validation and potential for future integration into edge AI.

Cons

  • Mojo is still in early development (Mojo 1.0 Beta 1 as of May 2026), leading to potential instability or evolving features.
  • Initial concerns existed regarding its closed-source nature and restrictive licensing, though the license has since been simplified.
  • Requires adoption of a new programming language (Mojo), which may present a learning curve for developers accustomed to other languages.
  • Some developers view Mojo as a 'toy for now' due to its early stage, suggesting more established languages like C++ or Rust for critical low-level programming.
  • The platform's full capabilities and long-term roadmap post-Qualcomm acquisition are subject to future announcements.

Politiques

Page des tarifs

Voir les tarifs

Outils similaires

Modular vs Concurrents

Modular se positionne comme une force disruptive face aux piles logicielles d'IA traditionnelles et spécifiques au matériel, défiant particulièrement l'écosystème CUDA de NVIDIA en offrant une véritable portabilité matérielle et une optimisation des performances.

1

It's a deep learning compiler stack that optimizes models for various hardware backends, from CPUs to specialized accelerators, enabling efficient execution.

While Modular aims for a unified platform with a new language (Mojo) for performance, TVM focuses on compiling existing models for optimal performance on diverse hardware. You might need more integration work with TVM compared to Modular's more integrated platform approach.

2

It's a cross-platform inference engine that allows models from various frameworks (converted to ONNX format) to run efficiently on different hardware.

Modular aims to provide a high-performance engine and platform, potentially requiring adoption of Mojo. ONNX Runtime provides a standard format and runtime for existing models, offering broad compatibility and efficiency gains without changing your core ML framework, though you might need to convert your models to ONNX format.

3
NVIDIA Triton Inference Server

It's an open-source inference serving software that simplifies the deployment of AI models from various frameworks, offering features like dynamic batching, concurrent model execution, and GPU utilization.

Modular focuses on optimizing the AI engine itself for performance and development. Triton Inference Server focuses on optimizing the *serving* of those models in production, handling aspects like throughput and latency for deployed models. While Triton helps with efficient deployment, it doesn't offer the same level of low-level model optimization or a new development language like Mojo.

4
OpenVINO Toolkit

It's a comprehensive toolkit from Intel for optimizing and deploying deep learning models on Intel hardware (CPUs, GPUs, VPUs, FPGAs) and also supports other architectures.

Modular aims for hardware-agnostic efficiency with its platform and Mojo language. OpenVINO provides a robust set of tools specifically for optimizing and deploying models, particularly strong on Intel hardware, but requires more manual integration and doesn't offer a unified development language like Mojo.