Skip to content
KI-Werkzeug

Modular Review

Modular ist eine vereinheitlichte KI-Engine und -Plattform, die entwickelt wurde, um KI über verschiedene Hardware- und Machine-Learning-Frameworks hinweg zugänglich und effizient zu machen.

shipped 30. Juli 2026aifreemium
ai
Modular — product screenshot

Warum es wichtig ist

1Am 29. Juli 2026 von Qualcomm übernommen, um generative und agentische KI-Software zu stärken.
2Modular 26.4 Release (18. Juni 2026) führte hochmodernes Mixture-of-Experts (MoE) Serving ein.
3In der dritten Finanzierungsrunde (24. September 2025) wurden 250 Millionen US-Dollar eingesammelt, wodurch das Unternehmen mit 1,6 Milliarden US-Dollar bewertet wurde.
4Erzielte Top-Leistung auf Nvidias Blackwell B200 und AMDs MI355X GPUs mit derselben Softwareplattform.

Über Modular

Geschäftsmodell
Usage-Based (Pay Per Use)
Nutzungsbasierter Preis
Pay-per-token per token
Hauptsitz
San Francisco, USA
Teamgröße
100-250
Plattformen
Web, API, Cloud, On-premises
Zielgruppe
AI developers, data scientists, enterprises focusing on AI deployment

Preispläne

Shared Endpoints
Pay-per-token / per-token
  • High-performance inference
  • No infrastructure management
  • Test easily
Dedicated Endpoints
Pay-per-minute / per-minute
  • Reserved NVIDIA and AMD GPUs
  • Flexible pricing
Custom Models
Pay-per-minute / per-minute
  • Deploy custom or fine-tuned models
  • Optimized infrastructure

Kostenbeispiele

  • Cost varies based on usage
API DocsGitHubOpen Source

Spezifikationen

API-Dokumentation

API verfügbar

Ja, öffentliche API

overview

Was ist Modular?

Modular ist ein AI-natives Entwicklerplattformunternehmen, das KI-Entwicklern, Anwendungsentwicklern und Unternehmen ermöglicht, eine vereinheitlichte, hochleistungsfähige und portable KI-Inferenzplattform zu erstellen. Ziel ist es, Hardware-Komplexitäten zu abstrahieren, sodass Entwickler KI-Modelle effizient über diverse Hardware hinweg bereitstellen und skalieren können. Modular bietet eine vereinheitlichte KI-Inferenzplattform, die für hochleistungsfähiges, portables Computing entwickelt wurde und KI-Pipelines von GPU-Kernels bis zu API-Endpunkten optimiert. Die Kernmission besteht darin, Entwicklern zu ermöglichen, beliebte offene KI-Modelle mit branchenführender GPU- und CPU-Leistung ohne Codeänderungen auszuführen und so die Hardware-Komplexität zu abstrahieren. Die Plattform unterstützt über 500 KI-Modelle von Hugging Face über eine OpenAI-kompatible REST API und erleichtert die Skalierung massiver GenAI-Inferenzdienste über Tausende von GPU-Knoten hinweg.

features

Hauptmerkmale von Modular

Modular bietet eine umfassende Reihe von Funktionen, die darauf ausgelegt sind, die Effizienz der KI-Entwicklung und -Bereitstellung über verschiedene Hardware und Frameworks hinweg zu verbessern.

  • Vereinheitlichter KI-Inferenz-Stack für konsistente Leistung.
  • Unterstützung für mehrere Hardware-Plattformen, einschließlich NVIDIA, AMD, Intel, ARM und Apple Silicon.
  • Kompatibilität mit über 30 hochmodernen Modellen von Hugging Face.
  • Pay-as-you-go-Preismodelle für flexible Ressourcenzuweisung.
  • Flexible Bereitstellungsoptionen in Cloud-Umgebungen oder On-Premises-Infrastruktur.
  • OpenAI-kompatible REST API für das Modell-Serving.
  • Mojo-Programmiersprache für benutzerdefinierte Operationen und GPU-Kernel-Entwicklung.
  • Schlanke Toolchain für schnellere Entwicklung und Kompilierung in Sekunden.
  • Intelligentes Workload-Routing zur Maximierung des Durchsatzes und Minimierung der Latenz bei GenAI-Bereitstellungen.

use cases

Wer sollte Modular verwenden?

Modular wurde primär für KI-Entwickler, Anwendungsentwickler und Unternehmen entwickelt, die ihre KI-Bereitstellungen in verschiedenen Hardware-Umgebungen optimieren und skalieren möchten.

  • KI-Entwickler: Für hochleistungsfähige KI-Inferenz und -Bereitstellung über verschiedene Hardware- und Cloud-Umgebungen, einschließlich des Schreibens benutzerdefinierter Operationen und GPU-Kernels in Mojo.
  • Anwendungsentwickler: Für die vereinheitlichte KI-Entwicklung und Bereitstellung von PyTorch- und TensorFlow-Workloads, die Vereinfachung von Toolchains und die Erzielung von Hardware-Portabilität.
  • Unternehmen: Für die Skalierung großer Generative AI (GenAI)-Inferenzdienste, die Beschleunigung von GenAI-Innovationen und die Erzielung von Herstellerunabhängigkeit für KI-Modelle.

how to use

Wie man Modular verwendet

Um Modular zu nutzen, können Entwickler die vereinheitlichte Plattform verwenden, um KI-Modelle bereitzustellen und zu optimieren. Die Plattform unterstützt die Bereitstellung in einem einzigen Docker-Container und bietet eine OpenAI-kompatible API für das Modell-Serving.

  • 1Zugriff auf die Modular-Plattform über die Weboberfläche oder API.
  • 2Auswahl aus über 500 voroptimierten KI-Modellen von Hugging Face.
  • 3Bereitstellung von Modellen mit einem einzigen Docker-Container (unter 1 GB) für eine effiziente Einrichtung.
  • 4Nutzung der OpenAI-kompatiblen REST API für das Modell-Serving und die Integration in Anwendungen.
  • 5Entwicklung benutzerdefinierter Modelle und Optimierung der Leistung mit der Programmiersprache Mojo.
  • 6Überwachung und Skalierung von GenAI-Inferenzdiensten über verschiedene Hardware-Backends hinweg.

pricing

Modular Preise & Pläne

Modular basiert auf einem Freemium-Modell mit nutzungsbasierten Preisstufen, die auf Flexibilität ausgelegt sind. Es umfasst einen kostenlosen Tarif für die erste Erkundung und bietet unterschiedliche Preise für verschiedene Bereitstellungsanforderungen.

  • Shared Endpoints: Pay-per-token für die allgemeine Nutzung.
  • Dedicated Endpoints: Pay-per-minute für konsistenten, hochleistungsfähigen Zugriff.
  • Custom Models: Pay-per-minute für spezialisierte Modellbereitstellungen.

Pros

  • +Mojo programming language combines Python's ease of use with C++/CUDA performance, addressing the 'two-language problem' in AI.
  • +Modular Platform (MAX) provides a unified AI inference stack, abstracting hardware complexity for portable, high-performance model deployment.
  • +Achieves significant performance gains, with Mojo benchmarks showing up to 35,000 times faster execution than Python in specific scenarios.
  • +Offers broad hardware compatibility, supporting NVIDIA, AMD, Intel, ARM, and Apple Silicon.
  • +Simplified community license allows free non-production commercial use and production use on CPUs and NVIDIA GPUs.
  • +Acquisition by Qualcomm on June 24, 2026, indicates strong industry validation and potential for future integration into edge AI.

Cons

  • Mojo is still in early development (Mojo 1.0 Beta 1 as of May 2026), leading to potential instability or evolving features.
  • Initial concerns existed regarding its closed-source nature and restrictive licensing, though the license has since been simplified.
  • Requires adoption of a new programming language (Mojo), which may present a learning curve for developers accustomed to other languages.
  • Some developers view Mojo as a 'toy for now' due to its early stage, suggesting more established languages like C++ or Rust for critical low-level programming.
  • The platform's full capabilities and long-term roadmap post-Qualcomm acquisition are subject to future announcements.

Richtlinien

Ähnliche Tools

Modular vs. Wettbewerber

Modular positioniert sich als disruptive Kraft gegenüber traditionellen, hardwarespezifischen KI-Software-Stacks und fordert insbesondere NVIDIAs CUDA-Ökosystem heraus, indem es echte Hardware-Portabilität und Leistungsoptimierung bietet.

1

It's a deep learning compiler stack that optimizes models for various hardware backends, from CPUs to specialized accelerators, enabling efficient execution.

While Modular aims for a unified platform with a new language (Mojo) for performance, TVM focuses on compiling existing models for optimal performance on diverse hardware. You might need more integration work with TVM compared to Modular's more integrated platform approach.

2

It's a cross-platform inference engine that allows models from various frameworks (converted to ONNX format) to run efficiently on different hardware.

Modular aims to provide a high-performance engine and platform, potentially requiring adoption of Mojo. ONNX Runtime provides a standard format and runtime for existing models, offering broad compatibility and efficiency gains without changing your core ML framework, though you might need to convert your models to ONNX format.

3
NVIDIA Triton Inference Server

It's an open-source inference serving software that simplifies the deployment of AI models from various frameworks, offering features like dynamic batching, concurrent model execution, and GPU utilization.

Modular focuses on optimizing the AI engine itself for performance and development. Triton Inference Server focuses on optimizing the *serving* of those models in production, handling aspects like throughput and latency for deployed models. While Triton helps with efficient deployment, it doesn't offer the same level of low-level model optimization or a new development language like Mojo.

4
OpenVINO Toolkit

It's a comprehensive toolkit from Intel for optimizing and deploying deep learning models on Intel hardware (CPUs, GPUs, VPUs, FPGAs) and also supports other architectures.

Modular aims for hardware-agnostic efficiency with its platform and Mojo language. OpenVINO provides a robust set of tools specifically for optimizing and deploying models, particularly strong on Intel hardware, but requires more manual integration and doesn't offer a unified development language like Mojo.