Skip to content
Outil d'IA

SubQ Review

SubQ est un Large Language Model (LLM) basé sur une architecture d'attention creuse sous-quadratique conçue pour une efficacité et des performances extrêmes sur des tâches à très long contexte.

shipped 18 juin 2026freemium
Domain rating39Monthly visits16K/moAI-readablepartial
SubQ - AI tool for subq. Professional illustration showing core functionality and features.

Pourquoi c'est important

1Traite jusqu'à 12 millions de tokens en une seule invite, répondant aux limitations des LLM traditionnels.
2Utilise une architecture Subquadratic Sparse Attention (SSA), atteignant une complexité de calcul O(n).
3Démontre 64,5 fois moins de calcul que l'attention dense et est 56 fois plus rapide que FlashAttention-2 pour un contexte de 1 million de tokens.
4SubQ 1.1 Small a été lancé le 16 juin 2026 par la startup Subquadratic, basée à Miami, qui a obtenu 29 millions de dollars en financement d'amorçage.

Stork’s verdict on SubQ

SubQ fournit un contexte de plusieurs millions de tokens efficacement, bien que ses jeux de benchmarks publiés soient limités.

SubQ reviewed by Stork AI · stork.ai/fr/subq

Spécifications

Documentation API

API disponible

Oui, API publique

overview

Qu'est-ce que SubQ ?

SubQ est un outil Large Language Model (LLM) développé par Subquadratic qui permet aux développeurs, aux équipes d'entreprise, aux ingénieurs de données, aux chercheurs et aux agents de codage de raisonner sur des contextes de plusieurs millions de tokens. Il utilise une architecture d'attention creuse sous-quadratique pour une efficacité et des performances améliorées sur des tâches à très long contexte. SubQ est spécifiquement conçu pour surmonter les limitations de mise à l'échelle quadratique des modèles de transformateurs standard, où les exigences de calcul augmentent de manière exponentielle avec la longueur du contexte. Son architecture Subquadratic Sparse Attention (SSA) garantit que le calcul évolue de manière approximativement linéaire avec la longueur de l'entrée, en se concentrant sur les relations de tokens les plus pertinentes. Cela permet à SubQ de traiter jusqu'à 12 millions de tokens en une seule invite sans dégradation significative de la qualité, ce qui le rend adapté aux tâches agentiques d'IA complexes à long terme et à l'analyse multi-documents.

features

Fonctionnalités clés de SubQ

SubQ intègre plusieurs fonctionnalités techniques conçues pour optimiser les performances et l'efficacité du traitement de longs contextes dans les Large Language Models.

  • Architecture d'attention creuse sous-quadratique (SSA) pour un traitement efficace du contexte.
  • Raisonnement sur plusieurs millions de tokens, prenant en charge des fenêtres de contexte allant jusqu'à 12 millions de tokens.
  • Mise à l'échelle linéaire des coûts pour le contexte, réduisant les dépenses de calcul par rapport aux modèles quadratiques.
  • Récupération de contexte long quasi parfaite, maintenant la précision sur des entrées étendues.
  • Atteint 64,5 fois moins de calcul que les mécanismes d'attention dense.
  • Fonctionne 56 fois plus vite que FlashAttention-2 pour une longueur de contexte de 1 million de tokens.
  • Prend en charge les capacités de streaming et d'utilisation d'outils via son API.
  • Fournit des points d'accès API compatibles OpenAI pour l'intégration des développeurs.
  • Comprend la redirection automatique des tours de modèle coûteux au sein de son produit SubQ Code.
  • Offre un processus d'installation en une seule ligne pour le produit SubQ Code.

use cases

Qui devrait utiliser SubQ ?

SubQ est conçu pour des profils professionnels spécifiques et des applications d'entreprise nécessitant un traitement étendu du contexte et une grande efficacité.

  • Ingénieurs logiciels : Pour l'analyse de bases de code entières, le raisonnement au niveau de l'architecture, le refactoring inter-fichiers, le traçage des dépendances et l'identification des vulnérabilités de sécurité.
  • Analystes financiers et professionnels du droit : Pour la diligence raisonnable, le raisonnement sur les déclarations financières, les rapports de résultats, les contrats et les documents juridiques complexes.
  • Chercheurs et ingénieurs de données : Pour l'analyse multi-documents, l'ingestion de milliers de pages de documents réglementaires ou de dossiers médicaux pour trouver des corrélations, et le soutien des flux de travail de recherche approfondie.
  • Développeurs et équipes d'entreprise : Pour la création de tâches agentiques à long terme, l'intégration d'un raisonnement avancé à long contexte dans les applications via l'API, et la gestion des états d'agent persistants.

how to use

Comment utiliser SubQ

SubQ s'utilise principalement via son API, qui propose des endpoints compatibles OpenAI pour l'intégration dans les flux de travail de développement existants. L'accès est actuellement géré par une liste d'attente.

  • 1Inscrivez-vous sur la liste d'attente pour obtenir un accès anticipé à la SubQ API, à SubQ Code et à SubQ Search.
  • 2Accédez à la SubQ API via des endpoints compatibles OpenAI pour une intégration fluide dans les applications existantes.
  • 3Utilisez l'API pour traiter des contextes de plusieurs millions de tokens, tels que des dépôts de code entiers, des documents juridiques ou des documents financiers.
  • 4Intégrez SubQ aux flux de travail d'agents d'IA pour permettre des tâches à long horizon nécessitant un état persistant et un raisonnement sur des historiques étendus.
  • 5Consultez la model card de SubQ 1.1 Small, disponible à l'URL de la documentation de l'API, pour les spécifications techniques détaillées et les consignes d'utilisation.

pricing

Tarification et plans SubQ

SubQ fonctionne sur un modèle économique freemium. Bien que les structures tarifaires spécifiques par niveau et les coûts d'utilisation détaillés ne soient pas divulgués publiquement, le modèle freemium implique généralement un niveau gratuit avec un accès ou des fonctionnalités limités, ainsi que des niveaux payants offrant des capacités étendues, des limites d'utilisation plus élevées ou un support avancé. Subquadratic a souligné la rentabilité comme un avantage clé, affirmant des coûts opérationnels significativement inférieurs pour les tâches à long contexte par rapport aux alternatives, tels qu'environ 1/20e du coût de Claude Opus pour des performances de codage comparables.

  • Freemium : Les détails spécifiques des niveaux et la tarification ne sont pas divulgués publiquement.

Pros

  • +Atteint une fenêtre de contexte de 12 millions de tokens avec une grande efficacité grâce à son architecture Subquadratic Sparse Attention (SSA).
  • +Revendique des réductions de coûts importantes : une exécution du benchmark RULER 128 coûte environ 8 $ contre 2 600 $ pour l'Opus 4.6 d'Anthropic.
  • +Serait 56 fois plus rapide que FlashAttention-2 sur un contexte de 1M de tokens et utiliserait 64,5 fois moins de calcul que l'attention dense.
  • +Démontre de hautes performances en récupération de contexte long, avec plus de 90 % sur des tâches d'aiguille dans une botte de foin à 12M de contexte en environnement de recherche.
  • +A obtenu de solides performances en programmation, avec 89,7 % sur LiveCodeBench et 81,8 % sur SWE-Bench Verified.
  • +Propose des endpoints d'API compatibles OpenAI, simplifiant l'intégration pour les développeurs.

Cons

  • L'accès est actuellement limité à un accès anticipé via une liste d'attente, ce qui restreint une vérification indépendante à grande échelle des affirmations.
  • Les jeux de benchmarks publiés sont jugés relativement étroits, se concentrant potentiellement sur les domaines où SubQ est censé exceller.
  • Le modèle de base utilise les poids de modèles open-source existants (probablement la famille DeepSeek V4) comme point de départ, plutôt que d'être entraîné à partir de zéro.
  • Un écart notable existe entre les scores de recherche (83 %) et de production (65,9 %) sur le benchmark de récupération multi-aiguilles MRCR v2.
  • Au lancement, aucun article complet évalué par des pairs ni model card exhaustive n'était immédiatement disponible, suscitant des appels à plus de transparence.
  • Aucun détail précis de tarification au-delà du modèle « freemium » n'est divulgué publiquement.

Outils similaires

SubQ vs Concurrents

SubQ se positionne face aux Large Language Models de pointe en mettant l'accent sur son architecture sous-quadratique et ses capacités de fenêtre de contexte significativement plus grandes.

1
Natively Sparse Attention (NSA)

NSA enhances long-context modeling in LLMs by seamlessly incorporating sparsity into both training and inference, utilizing hierarchical token modeling and a hardware-aligned design for real-world speedups.

Like SubQ, NSA focuses on sparse attention for long contexts and efficiency. NSA emphasizes hierarchical token modeling and hardware alignment for real-world speedups in both training and inference, aiming to maintain accuracy and contextual relevance.

2
Dynamic Hierarchical Sparse Attention (DHSA)

DHSA is a data-driven framework that dynamically predicts attention sparsity online without retraining the base LLM, achieving significant prefill speedups and preserving near-dense accuracy.

DHSA directly competes with SubQ by offering a dynamic approach to sparse attention for long contexts, focusing on adaptability and significant prefill speedups on existing LLMs, even on resource-constrained devices. It aims to overcome limitations of static sparse methods by adapting to task or input variations.

3
SALE (Low-bit Estimation for Efficient Sparse Attention)

SALE is a fine-grained sparse attention method that accelerates long-context LLM prefilling using 4-bit quantized query-key products and block-sparse attention, requiring no parameter training.

SALE offers a fine-grained sparse attention method specifically for accelerating the prefilling stage of long-context LLMs, similar to SubQ's efficiency goal, but with a focus on low-bit quantization and seamless integration into existing systems without retraining.

4
SparDA (Sparse Decoupled Attention)

SparDA is a decoupled sparse attention architecture that introduces a 'Forecast' projection to predict and prefetch KV blocks, enabling lookahead selection and improving both prefill and decode speed.

SparDA provides a novel decoupled sparse attention architecture that aims for efficiency in both prefill and decode, directly addressing the same performance and long-context challenges as SubQ, but with a unique lookahead selection mechanism and minimal parameter overhead.

Plus sur Stork

Outils IA connexes

Autres outils de cette catégorie, rapprochés par tags communs