Skip to content
Ferramenta de IA

Revisão Modular

Modular é um motor e plataforma de IA unificados, projetados para tornar a IA acessível e eficiente em diversas plataformas de hardware e frameworks de machine learning.

shipped 30 de jul. de 2026aifreemium
ai
Modular — product screenshot

Por que importa

1Adquirida pela Qualcomm em 29 de julho de 2026, para fortalecer o software de IA generativa e agentic.
2A versão Modular 26.4 (18 de junho de 2026) introduziu o serviço de mixture-of-experts (MoE) de última geração.
3Arrecadou US$ 250 milhões em sua terceira rodada de financiamento (24 de setembro de 2025), avaliando a empresa em US$ 1,6 bilhão.
4Alcançou o melhor desempenho nas GPUs Blackwell B200 da Nvidia e MI355X da AMD com a mesma plataforma de software.

Sobre o Modular

Modelo de negócio
Usage-Based (Pay Per Use)
Preço por uso
Pay-per-token per token
Sede
San Francisco, USA
Tamanho da equipe
100-250
Plataformas
Web, API, Cloud, On-premises
Público-alvo
AI developers, data scientists, enterprises focusing on AI deployment

Planos de preços

Shared Endpoints
Pay-per-token / per-token
  • High-performance inference
  • No infrastructure management
  • Test easily
Dedicated Endpoints
Pay-per-minute / per-minute
  • Reserved NVIDIA and AMD GPUs
  • Flexible pricing
Custom Models
Pay-per-minute / per-minute
  • Deploy custom or fine-tuned models
  • Optimized infrastructure

Exemplos de custo

  • Cost varies based on usage
API DocsGitHubOpen Source

Especificações

Documentação API

API disponível

Sim, API pública

overview

O que é Modular?

Modular é uma empresa de plataforma de desenvolvedores nativa de IA que permite que desenvolvedores de IA, desenvolvedores de aplicativos e empresas construam uma plataforma de inferência de IA unificada, de alto desempenho e portátil. Seu objetivo é abstrair as complexidades do hardware, permitindo que os desenvolvedores implementem e escalem modelos de IA de forma eficiente em diversos hardwares. Modular fornece uma plataforma de inferência de IA unificada projetada para computação portátil e de alto desempenho, otimizando pipelines de IA desde os kernels da GPU até os endpoints da API. Sua missão principal é permitir que os desenvolvedores executem modelos populares de IA abertos com desempenho de GPU e CPU líderes do setor, sem exigir alterações de código, abstraindo assim a complexidade do hardware. A plataforma suporta mais de 500 modelos de IA do Hugging Face via uma API REST compatível com OpenAI e facilita o dimensionamento de serviços massivos de inferência GenAI em milhares de nós de GPU.

features

Principais Recursos do Modular

Modular oferece um conjunto abrangente de recursos projetados para aprimorar o desenvolvimento e a eficiência da implantação de IA em diversos hardwares e frameworks.

  • Pilha de inferência de IA unificada para desempenho consistente.
  • Suporte para múltiplas plataformas de hardware, incluindo NVIDIA, AMD, Intel, ARM e Apple Silicon.
  • Compatibilidade com mais de 30 modelos de última geração do Hugging Face.
  • Opções de preços pay-as-you-go para alocação flexível de recursos.
  • Opções de implantação flexíveis em ambientes de nuvem ou infraestrutura on-premises.
  • API REST compatível com OpenAI para serviço de modelos.
  • Linguagem de programação Mojo para operações personalizadas e desenvolvimento de kernel de GPU.
  • Conjunto de ferramentas Slim para desenvolvimento e compilação mais rápidos em segundos.
  • Roteamento inteligente de cargas de trabalho para maximizar o throughput e minimizar a latência em implantações GenAI.

use cases

Quem Deve Usar o Modular?

Modular é projetado principalmente para desenvolvedores de IA, desenvolvedores de aplicativos e empresas que buscam otimizar e escalar suas implantações de IA em diversos ambientes de hardware.

  • Desenvolvedores de IA: Para inferência e implantação de IA de alto desempenho em vários ambientes de hardware e nuvem, incluindo a escrita de operações personalizadas e kernels de GPU em Mojo.
  • Desenvolvedores de Aplicativos: Para desenvolvimento e implantação unificados de IA de cargas de trabalho PyTorch e TensorFlow, simplificando conjuntos de ferramentas e alcançando portabilidade de hardware.
  • Empresas: Para escalar serviços de inferência de IA Generativa (GenAI) em larga escala, acelerar inovações GenAI e alcançar independência de fornecedores para modelos de IA.

how to use

Como Usar o Modular

Para começar a usar o Modular, os desenvolvedores podem aproveitar sua plataforma unificada para implantar e otimizar modelos de IA. A plataforma suporta uma única implantação de contêiner Docker e oferece uma API compatível com OpenAI para serviço de modelos.

  • 1Acesse a plataforma Modular através de sua interface web ou API.
  • 2Selecione entre mais de 500 modelos de IA pré-otimizados do Hugging Face.
  • 3Implante modelos usando um único contêiner Docker (menos de 1GB) para uma configuração eficiente.
  • 4Utilize a API REST compatível com OpenAI para serviço de modelos e integração em aplicativos.
  • 5Desenvolva modelos personalizados e otimize o desempenho usando a linguagem de programação Mojo.
  • 6Monitore e escale serviços de inferência GenAI em vários backends de hardware.

pricing

Preços e Planos do Modular

Modular opera em um modelo freemium com níveis de preços baseados no uso, projetados para flexibilidade. Inclui um nível gratuito para exploração inicial e oferece preços distintos para diferentes necessidades de implantação.

  • Shared Endpoints: Pagamento por token para uso geral.
  • Dedicated Endpoints: Pagamento por minuto para acesso consistente e de alto desempenho.
  • Custom Models: Pagamento por minuto para implantações de modelos especializados.

Pros

  • +Mojo programming language combines Python's ease of use with C++/CUDA performance, addressing the 'two-language problem' in AI.
  • +Modular Platform (MAX) provides a unified AI inference stack, abstracting hardware complexity for portable, high-performance model deployment.
  • +Achieves significant performance gains, with Mojo benchmarks showing up to 35,000 times faster execution than Python in specific scenarios.
  • +Offers broad hardware compatibility, supporting NVIDIA, AMD, Intel, ARM, and Apple Silicon.
  • +Simplified community license allows free non-production commercial use and production use on CPUs and NVIDIA GPUs.
  • +Acquisition by Qualcomm on June 24, 2026, indicates strong industry validation and potential for future integration into edge AI.

Cons

  • Mojo is still in early development (Mojo 1.0 Beta 1 as of May 2026), leading to potential instability or evolving features.
  • Initial concerns existed regarding its closed-source nature and restrictive licensing, though the license has since been simplified.
  • Requires adoption of a new programming language (Mojo), which may present a learning curve for developers accustomed to other languages.
  • Some developers view Mojo as a 'toy for now' due to its early stage, suggesting more established languages like C++ or Rust for critical low-level programming.
  • The platform's full capabilities and long-term roadmap post-Qualcomm acquisition are subject to future announcements.

Políticas

Página de preços

Ver preços

Ferramentas similares

Modular vs Concorrentes

Modular se posiciona como uma força disruptiva contra as pilhas de software de IA tradicionais e específicas de hardware, desafiando particularmente o ecossistema CUDA da NVIDIA ao oferecer verdadeira portabilidade de hardware e otimização de desempenho.

1

It's a deep learning compiler stack that optimizes models for various hardware backends, from CPUs to specialized accelerators, enabling efficient execution.

While Modular aims for a unified platform with a new language (Mojo) for performance, TVM focuses on compiling existing models for optimal performance on diverse hardware. You might need more integration work with TVM compared to Modular's more integrated platform approach.

2

It's a cross-platform inference engine that allows models from various frameworks (converted to ONNX format) to run efficiently on different hardware.

Modular aims to provide a high-performance engine and platform, potentially requiring adoption of Mojo. ONNX Runtime provides a standard format and runtime for existing models, offering broad compatibility and efficiency gains without changing your core ML framework, though you might need to convert your models to ONNX format.

3
NVIDIA Triton Inference Server

It's an open-source inference serving software that simplifies the deployment of AI models from various frameworks, offering features like dynamic batching, concurrent model execution, and GPU utilization.

Modular focuses on optimizing the AI engine itself for performance and development. Triton Inference Server focuses on optimizing the *serving* of those models in production, handling aspects like throughput and latency for deployed models. While Triton helps with efficient deployment, it doesn't offer the same level of low-level model optimization or a new development language like Mojo.

4
OpenVINO Toolkit

It's a comprehensive toolkit from Intel for optimizing and deploying deep learning models on Intel hardware (CPUs, GPUs, VPUs, FPGAs) and also supports other architectures.

Modular aims for hardware-agnostic efficiency with its platform and Mojo language. OpenVINO provides a robust set of tools specifically for optimizing and deploying models, particularly strong on Intel hardware, but requires more manual integration and doesn't offer a unified development language like Mojo.