Skip to content
Ferramenta de IA

Revisão do SubQ

SubQ é um Large Language Model (LLM) construído sobre uma arquitetura de atenção esparsa sub-quadrática, projetado para extrema eficiência e desempenho em tarefas de contexto muito longo.

shipped 18 de jun. de 2026freemium
Domain rating39Monthly visits16K/moAI-readablepartial
SubQ - AI tool for subq. Professional illustration showing core functionality and features.

Por que importa

1Processa até 12 milhões de tokens em um único prompt, abordando as limitações dos LLMs tradicionais.
2Utiliza uma arquitetura Subquadratic Sparse Attention (SSA), alcançando complexidade computacional O(n).
3Demonstra 64.5x menos computação que a atenção densa e é 56x mais rápido que FlashAttention-2 em um contexto de 1M de tokens.
4SubQ 1.1 Small foi lançado em 16 de junho de 2026 pela startup Subquadratic, sediada em Miami, que garantiu US$ 29 milhões em financiamento inicial.

Stork’s verdict on SubQ

SubQ entrega contexto de milhões de tokens eficientemente, embora seus conjuntos de benchmarks publicados sejam limitados.

SubQ reviewed by Stork AI · stork.ai/pt/subq

Especificações

Documentação API

API disponível

Sim, API pública

overview

O que é SubQ?

SubQ é uma ferramenta Large Language Model (LLM) desenvolvida pela Subquadratic que permite a desenvolvedores, equipes empresariais, engenheiros de dados, pesquisadores e agentes de codificação raciocinar em contextos de milhões de tokens. Ele utiliza uma arquitetura de atenção esparsa sub-quadrática para maior eficiência e desempenho em tarefas de contexto muito longo. O SubQ é especificamente projetado para superar as limitações de escalonamento quadrático dos modelos transformer padrão, onde os requisitos de computação aumentam exponencialmente com o comprimento do contexto. Sua arquitetura Subquadratic Sparse Attention (SSA) garante que a computação escale aproximadamente linearmente com o comprimento da entrada, focando nas relações de token mais relevantes. Isso permite que o SubQ processe até 12 milhões de tokens em um único prompt sem degradação significativa da qualidade, tornando-o adequado para tarefas complexas de agentes de IA de longo horizonte e análise de múltiplos documentos.

features

Principais Recursos do SubQ

SubQ incorpora vários recursos técnicos projetados para otimizar o desempenho e a eficiência no processamento de contexto longo em Large Language Models.

  • Arquitetura de atenção esparsa sub-quadrática (SSA) para processamento eficiente de contexto.
  • Raciocínio com milhões de tokens, suportando janelas de contexto de até 12 milhões de tokens.
  • Escalonamento de custo linear para contexto, reduzindo o custo computacional em comparação com modelos quadráticos.
  • Recuperação de contexto longo quase perfeita, mantendo a precisão em entradas extensas.
  • Alcança 64.5x menos computação do que mecanismos de atenção densa.
  • Opera 56x mais rápido que FlashAttention-2 em um comprimento de contexto de 1M de tokens.
  • Suporta capacidades de streaming e uso de ferramentas via sua API.
  • Fornece endpoints de API compatíveis com OpenAI para integração de desenvolvedores.
  • Inclui redirecionamento automático de turnos de modelo caros dentro de seu produto SubQ Code.
  • Oferece um processo de instalação de uma linha para o produto SubQ Code.

use cases

Quem Deve Usar o SubQ?

SubQ é projetado para personas profissionais específicas e aplicações empresariais que exigem processamento de contexto extenso e alta eficiência.

  • Engenheiros de Software: Para analisar bases de código inteiras, realizar raciocínio em nível de arquitetura, refatoração entre arquivos, rastreamento de dependências e identificação de vulnerabilidades de segurança.
  • Analistas Financeiros e Profissionais Jurídicos: Para due diligence, raciocínio em relatórios financeiros, relatórios de lucros, contratos e documentos legais complexos.
  • Pesquisadores e Engenheiros de Dados: Para análise de múltiplos documentos, ingestão de milhares de páginas de documentos regulatórios ou registros médicos para encontrar correlações e apoiar fluxos de trabalho de pesquisa aprofundada.
  • Desenvolvedores e Equipes Empresariais: Para construir tarefas de agentes de longo horizonte, integrar raciocínio avançado de contexto longo em aplicações via API e gerenciar estados de agentes persistentes.

how to use

Como usar o SubQ

O SubQ é acessado principalmente por meio de sua API, que oferece endpoints compatíveis com OpenAI para integração aos fluxos de trabalho de desenvolvimento existentes. Atualmente, o acesso é gerenciado por uma lista de espera.

  • 1Entre na lista de espera para obter acesso antecipado à SubQ API, ao SubQ Code e ao SubQ Search.
  • 2Acesse a SubQ API por meio de endpoints compatíveis com OpenAI para uma integração fluida às aplicações existentes.
  • 3Use a API para processar contextos de vários milhões de tokens, como repositórios de código inteiros, documentos jurídicos ou relatórios financeiros.
  • 4Integre o SubQ a fluxos de trabalho de agentes de IA para viabilizar tarefas de longo horizonte que exigem estado persistente e raciocínio sobre históricos extensos.
  • 5Consulte a model card do SubQ 1.1 Small, disponível na URL da documentação da API, para especificações técnicas detalhadas e diretrizes de uso.

pricing

Preços e Planos do SubQ

SubQ opera em um modelo de negócios freemium. Embora estruturas de preços em camadas específicas e custos de uso detalhados não sejam divulgados publicamente, o modelo freemium geralmente implica um nível gratuito com acesso ou recursos limitados, juntamente com níveis pagos que oferecem capacidades expandidas, limites de uso mais altos ou suporte avançado. A Subquadratic destacou a eficiência de custos como um benefício chave, alegando custos operacionais significativamente mais baixos para tarefas de contexto longo em comparação com alternativas, como aproximadamente 1/20 do custo do Claude Opus para desempenho de codificação comparável.

  • Freemium: Detalhes específicos dos níveis e preços não são divulgados publicamente.

Pros

  • +Atinge uma janela de contexto de 12 milhões de tokens com alta eficiência graças à sua arquitetura Subquadratic Sparse Attention (SSA).
  • +Afirma reduções significativas de custo: uma execução do benchmark RULER 128 custa aproximadamente $8 em comparação com $2.600 do Opus 4.6 da Anthropic.
  • +Relata-se ser 56 vezes mais rápido que o FlashAttention-2 em um contexto de 1M de tokens e usar 64,5 vezes menos computação que a atenção densa.
  • +Demonstra alto desempenho na recuperação de contexto longo, alcançando mais de 90% em tarefas de agulha no palheiro com contexto de 12M em ambientes de pesquisa.
  • +Alcançou forte desempenho em programação, com 89,7% no LiveCodeBench e 81,8% no SWE-Bench Verified.
  • +Oferece endpoints de API compatíveis com OpenAI, simplificando a integração para os desenvolvedores.

Cons

  • O acesso está atualmente limitado ao acesso antecipado por lista de espera, o que restringe uma ampla verificação independente das alegações.
  • Os conjuntos de benchmarks publicados são considerados relativamente restritos, possivelmente focados em áreas nas quais se espera que o SubQ se destaque.
  • O modelo base usa pesos de modelos open-source existentes (provavelmente a família DeepSeek V4) como ponto de partida, em vez de ser treinado do zero.
  • Existe uma lacuna notável entre as pontuações de pesquisa (83%) e de produção (65,9%) no benchmark de recuperação multi-agulha MRCR v2.
  • No lançamento, não havia imediatamente disponível um artigo completo revisado por pares nem uma model card abrangente, gerando pedidos por mais transparência.
  • Detalhes específicos de preço além do modelo 'freemium' não são divulgados publicamente.

Ferramentas similares

SubQ vs Concorrentes

SubQ se posiciona contra Large Language Models de ponta, enfatizando sua arquitetura sub-quadrática e capacidades de janela de contexto significativamente maiores.

1
Natively Sparse Attention (NSA)

NSA enhances long-context modeling in LLMs by seamlessly incorporating sparsity into both training and inference, utilizing hierarchical token modeling and a hardware-aligned design for real-world speedups.

Like SubQ, NSA focuses on sparse attention for long contexts and efficiency. NSA emphasizes hierarchical token modeling and hardware alignment for real-world speedups in both training and inference, aiming to maintain accuracy and contextual relevance.

2
Dynamic Hierarchical Sparse Attention (DHSA)

DHSA is a data-driven framework that dynamically predicts attention sparsity online without retraining the base LLM, achieving significant prefill speedups and preserving near-dense accuracy.

DHSA directly competes with SubQ by offering a dynamic approach to sparse attention for long contexts, focusing on adaptability and significant prefill speedups on existing LLMs, even on resource-constrained devices. It aims to overcome limitations of static sparse methods by adapting to task or input variations.

3
SALE (Low-bit Estimation for Efficient Sparse Attention)

SALE is a fine-grained sparse attention method that accelerates long-context LLM prefilling using 4-bit quantized query-key products and block-sparse attention, requiring no parameter training.

SALE offers a fine-grained sparse attention method specifically for accelerating the prefilling stage of long-context LLMs, similar to SubQ's efficiency goal, but with a focus on low-bit quantization and seamless integration into existing systems without retraining.

4
SparDA (Sparse Decoupled Attention)

SparDA is a decoupled sparse attention architecture that introduces a 'Forecast' projection to predict and prefetch KV blocks, enabling lookahead selection and improving both prefill and decode speed.

SparDA provides a novel decoupled sparse attention architecture that aims for efficiency in both prefill and decode, directly addressing the same performance and long-context challenges as SubQ, but with a unique lookahead selection mechanism and minimal parameter overhead.

Mais no Stork

Ferramentas IA relacionadas

Outras ferramentas desta categoria, associadas por tags em comum