Skip to content
KI-Werkzeug

SubQ Review

SubQ ist ein Large Language Model (LLM), das auf einer subquadratischen Sparse-Attention-Architektur basiert und für extreme Effizienz und Leistung bei Aufgaben mit sehr langem Kontext entwickelt wurde.

shipped 18. Juni 2026freemium
Domain rating39Monthly visits16K/moAI-readablepartial
SubQ - AI tool for subq. Professional illustration showing core functionality and features.

Warum es wichtig ist

1Verarbeitet bis zu 12 Millionen Tokens in einem einzigen Prompt und behebt damit die Einschränkungen traditioneller LLMs.
2Nutzt eine Subquadratic Sparse Attention (SSA)-Architektur und erreicht eine O(n)-Berechnungskomplexität.
3Zeigt 64,5-mal weniger Rechenleistung als Dense Attention und ist 56-mal schneller als FlashAttention-2 bei einem 1M-Token-Kontext.
4SubQ 1.1 Small wurde am 16. Juni 2026 von dem in Miami ansässigen Startup Subquadratic veröffentlicht, das 29 Millionen US-Dollar an Seed-Finanzierung erhalten hat.

Stork’s verdict on SubQ

SubQ liefert Kontext von mehreren Millionen Tokens effizient, obwohl seine veröffentlichten Benchmark-Sets eng sind.

SubQ reviewed by Stork AI · stork.ai/de/subq

Spezifikationen

API-Dokumentation

API verfügbar

Ja, öffentliche API

overview

Was ist SubQ?

SubQ ist ein Large Language Model (LLM)-Tool, das von Subquadratic entwickelt wurde und es Entwicklern, Unternehmensteams, Dateningenieuren, Forschern und Coding Agents ermöglicht, über Kontexte von mehreren Millionen Tokens hinweg zu argumentieren. Es nutzt eine subquadratische Sparse-Attention-Architektur für verbesserte Effizienz und Leistung bei Aufgaben mit sehr langem Kontext. SubQ wurde speziell entwickelt, um die quadratischen Skalierungsbeschränkungen von Standard-Transformer-Modellen zu überwinden, bei denen die Rechenanforderungen exponentiell mit der Kontextlänge steigen. Seine Subquadratic Sparse Attention (SSA)-Architektur stellt sicher, dass die Rechenleistung annähernd linear mit der Eingabelänge skaliert, wobei der Fokus auf den relevantesten Token-Beziehungen liegt. Dies ermöglicht SubQ, bis zu 12 Millionen Tokens in einem einzigen Prompt ohne signifikanten Qualitätsverlust zu verarbeiten, wodurch es für komplexe, langfristige AI-Agentenaufgaben und die Analyse mehrerer Dokumente geeignet ist.

features

Hauptmerkmale von SubQ

SubQ integriert mehrere technische Merkmale, die darauf ausgelegt sind, Leistung und Effizienz für die Langkontextverarbeitung in Large Language Models zu optimieren.

  • Subquadratische Sparse-Attention-Architektur (SSA) für effiziente Kontextverarbeitung.
  • Argumentation über mehrere Millionen Tokens hinweg, unterstützt Kontextfenster von bis zu 12 Millionen Tokens.
  • Lineare Kostenskalierung für den Kontext, reduziert den Rechenaufwand im Vergleich zu quadratischen Modellen.
  • Nahezu perfekte Langkontext-Retrieval, bewahrt die Genauigkeit über umfangreiche Eingaben hinweg.
  • Erreicht 64,5-mal weniger Rechenleistung als Dense-Attention-Mechanismen.
  • Arbeitet 56-mal schneller als FlashAttention-2 bei einer 1M-Token-Kontextlänge.
  • Unterstützt Streaming- und Tool-Nutzungsfunktionen über seine API.
  • Bietet OpenAI-kompatible API-Endpunkte für die Entwicklerintegration.
  • Beinhaltet die automatische Umleitung teurer Modell-Turns innerhalb seines SubQ Code-Produkts.
  • Bietet einen Ein-Zeilen-Installationsprozess für das SubQ Code-Produkt.

use cases

Wer sollte SubQ nutzen?

SubQ wurde für spezifische berufliche Personas und Unternehmensanwendungen entwickelt, die eine umfangreiche Kontextverarbeitung und hohe Effizienz erfordern.

  • Software-Ingenieure: Für die Analyse ganzer Codebasen, die Durchführung von Argumentationen auf Architekturebene, dateiübergreifendes Refactoring, Abhängigkeitsverfolgung und die Identifizierung von Sicherheitslücken.
  • Finanzanalysten & Juristen: Für Due Diligence, Argumentationen über Finanzberichte, Gewinnberichte, Verträge und komplexe Rechtsdokumente.
  • Forscher & Dateningenieure: Für die Analyse mehrerer Dokumente, das Einlesen tausender Seiten von behördlichen Einreichungen oder Krankenakten zur Korrelationsfindung und zur Unterstützung tiefer Forschungs-Workflows.
  • Entwickler & Unternehmensteams: Für den Aufbau langfristiger Agentenaufgaben, die Integration fortschrittlicher Langkontext-Argumentation in Anwendungen über API und die Verwaltung persistenter Agentenzustände.

how to use

So verwendest du SubQ

Auf SubQ wird hauptsächlich über seine API zugegriffen, die OpenAI-kompatible Endpunkte für die Integration in bestehende Entwicklungs-Workflows bietet. Der Zugang wird derzeit über eine Warteliste geregelt.

  • 1Trage dich in die Warteliste ein, um frühen Zugang zur SubQ API, zu SubQ Code und zu SubQ Search zu erhalten.
  • 2Greife über OpenAI-kompatible Endpunkte auf die SubQ API zu, um eine nahtlose Integration in bestehende Anwendungen zu ermöglichen.
  • 3Nutze die API, um Kontexte von mehreren Millionen Tokens zu verarbeiten, etwa ganze Code-Repositories, juristische Dokumente oder Finanzunterlagen.
  • 4Integriere SubQ in KI-Agenten-Workflows, um langfristige Aufgaben zu ermöglichen, die persistenten Zustand und Schlussfolgern über umfangreiche Verläufe erfordern.
  • 5Konsultiere die Model Card von SubQ 1.1 Small, verfügbar über die URL der API-Dokumentation, für detaillierte technische Spezifikationen und Nutzungshinweise.

pricing

SubQ Preise & Pläne

SubQ basiert auf einem Freemium-Geschäftsmodell. Obwohl spezifische gestaffelte Preisstrukturen und detaillierte Nutzungskosten nicht öffentlich bekannt gegeben werden, impliziert das Freemium-Modell typischerweise eine kostenlose Stufe mit begrenztem Zugang oder Funktionen, zusammen mit kostenpflichtigen Stufen, die erweiterte Funktionen, höhere Nutzungslimits oder erweiterten Support bieten. Subquadratic hat die Kosteneffizienz als Hauptvorteil hervorgehoben und behauptet, dass die Betriebskosten für Langkontextaufgaben im Vergleich zu Alternativen deutlich niedriger sind, wie zum Beispiel etwa 1/20 der Kosten von Claude Opus für vergleichbare Codierungsleistung.

  • Freemium: Spezifische Stufendetails und Preise werden nicht öffentlich bekannt gegeben.

Pros

  • +Erreicht dank seiner Subquadratic-Sparse-Attention-Architektur (SSA) ein Kontextfenster von 12 Millionen Tokens mit hoher Effizienz.
  • +Verspricht erhebliche Kosteneinsparungen: Ein Durchlauf des RULER-128-Benchmarks kostet rund 8 $ gegenüber 2.600 $ bei Anthropics Opus 4.6.
  • +Soll bei einem Kontext von 1M Tokens 56-mal schneller sein als FlashAttention-2 und 64,5-mal weniger Rechenleistung benötigen als dichte Attention.
  • +Zeigt hohe Leistung beim Abruf langer Kontexte und erzielt in Forschungsumgebungen über 90 % bei Needle-in-a-Haystack-Aufgaben mit 12M Kontext.
  • +Erzielte starke Coding-Leistung mit 89,7 % auf LiveCodeBench und 81,8 % auf SWE-Bench Verified.
  • +Bietet OpenAI-kompatible API-Endpunkte und vereinfacht so die Integration für Entwickler.

Cons

  • Der Zugang ist derzeit auf frühen Zugang über eine Warteliste beschränkt, was eine breite unabhängige Überprüfung der Angaben erschwert.
  • Die veröffentlichten Benchmark-Sets gelten als relativ eng und konzentrieren sich möglicherweise auf Bereiche, in denen SubQ voraussichtlich glänzt.
  • Das Basismodell nutzt als Ausgangspunkt Gewichte bestehender Open-Source-Modelle (wahrscheinlich der DeepSeek-V4-Familie), statt von Grund auf trainiert zu werden.
  • Es besteht eine deutliche Lücke zwischen den Werten in der Forschung (83 %) und in der Produktion (65,9 %) beim Multi-Needle-Retrieval-Benchmark MRCR v2.
  • Zum Launch waren weder ein vollständiges, von Fachleuten geprüftes Paper noch eine umfassende Model Card sofort verfügbar, was Rufe nach mehr Transparenz auslöste.
  • Konkrete Preisangaben über das „Freemium"-Modell hinaus werden nicht öffentlich offengelegt.

Ähnliche Tools

SubQ vs. Wettbewerber

SubQ positioniert sich gegenüber führenden Large Language Models, indem es seine subquadratische Architektur und deutlich größere Kontextfenster-Fähigkeiten hervorhebt.

1
Natively Sparse Attention (NSA)

NSA enhances long-context modeling in LLMs by seamlessly incorporating sparsity into both training and inference, utilizing hierarchical token modeling and a hardware-aligned design for real-world speedups.

Like SubQ, NSA focuses on sparse attention for long contexts and efficiency. NSA emphasizes hierarchical token modeling and hardware alignment for real-world speedups in both training and inference, aiming to maintain accuracy and contextual relevance.

2
Dynamic Hierarchical Sparse Attention (DHSA)

DHSA is a data-driven framework that dynamically predicts attention sparsity online without retraining the base LLM, achieving significant prefill speedups and preserving near-dense accuracy.

DHSA directly competes with SubQ by offering a dynamic approach to sparse attention for long contexts, focusing on adaptability and significant prefill speedups on existing LLMs, even on resource-constrained devices. It aims to overcome limitations of static sparse methods by adapting to task or input variations.

3
SALE (Low-bit Estimation for Efficient Sparse Attention)

SALE is a fine-grained sparse attention method that accelerates long-context LLM prefilling using 4-bit quantized query-key products and block-sparse attention, requiring no parameter training.

SALE offers a fine-grained sparse attention method specifically for accelerating the prefilling stage of long-context LLMs, similar to SubQ's efficiency goal, but with a focus on low-bit quantization and seamless integration into existing systems without retraining.

4
SparDA (Sparse Decoupled Attention)

SparDA is a decoupled sparse attention architecture that introduces a 'Forecast' projection to predict and prefetch KV blocks, enabling lookahead selection and improving both prefill and decode speed.

SparDA provides a novel decoupled sparse attention architecture that aims for efficiency in both prefill and decode, directly addressing the same performance and long-context challenges as SubQ, but with a unique lookahead selection mechanism and minimal parameter overhead.

Mehr auf Stork

Verwandte KI-Tools

Weitere Tools dieser Kategorie, über gemeinsame Tags zugeordnet