Skip to content
AIツール

SubQ レビュー

SubQは、非常に長いコンテキストタスクにおいて極限の効率とパフォーマンスを実現するために設計された、劣二次疎注意アーキテクチャに基づいて構築された大規模言語モデル(LLM)です。

shipped 2026年6月18日freemium
Domain rating39Monthly visits16K/moAI-readablepartial
SubQ - AI tool for subq. Professional illustration showing core functionality and features.

注目ポイント

1単一のプロンプトで最大1,200万トークンを処理し、従来のLLMの制限に対処します。
2劣二次疎注意(SSA)アーキテクチャを利用し、O(n)の計算複雑性を実現します。
3高密度注意よりも64.5倍少ない計算量で、100万トークンのコンテキストではFlashAttention-2よりも56倍高速です。
4SubQ 1.1 Smallは、2026年6月16日にマイアミを拠点とするスタートアップSubquadraticによってリリースされました。同社は2,900万ドルのシード資金を確保しています。

Stork’s verdict on SubQ

SubQは数百万トークンのコンテキストを効率的に提供しますが、公開されているベンチマークセットは狭いです。

SubQ reviewed by Stork AI · stork.ai/ja/subq

仕様

APIドキュメント

API提供状況

はい、公開API

overview

SubQとは?

SubQは、Subquadraticが開発した大規模言語モデル(LLM)ツールであり、開発者、エンタープライズチーム、データエンジニア、研究者、およびコーディングエージェントが数百万トークンのコンテキスト全体で推論することを可能にします。非常に長いコンテキストタスクにおいて、強化された効率とパフォーマンスのために劣二次疎注意アーキテクチャを利用しています。SubQは、コンテキスト長とともに計算要件が指数関数的に増加する標準的なtransformerモデルの二次スケーリングの制限を克服するために特別に設計されています。その劣二次疎注意(SSA)アーキテクチャは、計算が入力長に対してほぼ線形にスケーリングされ、最も関連性の高いトークン関係に焦点を当てることを保証します。これにより、SubQは単一のプロンプトで最大1,200万トークンを品質を大幅に低下させることなく処理でき、複雑な長期的AIエージェントタスクや複数文書分析に適しています。

features

SubQの主な機能

SubQは、大規模言語モデルにおける長文コンテキスト処理のパフォーマンスと効率を最適化するために設計された、いくつかの技術的機能を組み込んでいます。

  • 効率的なコンテキスト処理のための劣二次疎注意アーキテクチャ(SSA)。
  • 数百万トークンの推論、最大1,200万トークンのコンテキストウィンドウをサポート。
  • コンテキストの線形コストスケーリングにより、二次モデルと比較して計算コストを削減。
  • ほぼ完璧な長文コンテキスト検索により、広範な入力全体で精度を維持。
  • 高密度注意メカニズムよりも64.5倍少ない計算量を実現。
  • 100万トークンのコンテキスト長でFlashAttention-2よりも56倍高速に動作。
  • APIを介したストリーミングおよびツール利用機能をサポート。
  • 開発者統合のためのOpenAI互換APIエンドポイントを提供。
  • SubQ Code製品内で高価なモデルターンの自動リダイレクト機能を含む。
  • SubQ Code製品のワンラインインストールプロセスを提供。

use cases

SubQは誰が使うべきか?

SubQは、広範なコンテキスト処理と高い効率を必要とする特定の専門職のペルソナおよびエンタープライズアプリケーション向けに設計されています。

  • ソフトウェアエンジニア: コードベース全体の分析、アーキテクチャレベルの推論、ファイル間リファクタリング、依存関係の追跡、セキュリティ脆弱性の特定に。
  • 金融アナリストおよび法務専門家: デューデリジェンス、財務書類、決算報告書、契約書、複雑な法的文書全体での推論に。
  • 研究者およびデータエンジニア: 複数文書分析、数千ページにわたる規制当局への提出書類や医療記録を取り込んで相関関係を見つけ、深い研究ワークフローをサポートするために。
  • 開発者およびエンタープライズチーム: 長期的なエージェントタスクの構築、APIを介した高度な長文コンテキスト推論のアプリケーションへの統合、永続的なエージェント状態の管理に。

how to use

SubQ の使い方

SubQ は主に API を通じて利用し、既存の開発ワークフローに統合できる OpenAI 互換のエンドポイントを提供します。現在、アクセスはウェイトリストで管理されています。

  • 1SubQ API、SubQ Code、SubQ Search への早期アクセスを得るためにウェイトリストに参加します。
  • 2OpenAI 互換のエンドポイントを通じて SubQ API にアクセスし、既存アプリケーションへシームレスに統合します。
  • 3API を利用して、コードリポジトリ全体、法的文書、財務報告書など、数百万トークン規模のコンテキストを処理します。
  • 4SubQ を AI エージェントのワークフローに統合し、永続的な状態と膨大な履歴にわたる推論を必要とする長期的タスクを可能にします。
  • 5API ドキュメントの URL から入手できる SubQ 1.1 Small のモデルカードを参照し、詳細な技術仕様と利用ガイドラインを確認します。

pricing

SubQの価格とプラン

SubQはFreemiumビジネスモデルで運営されています。具体的な段階的価格設定構造や詳細な使用コストは公開されていませんが、Freemiumモデルは通常、限られたアクセスまたは機能を備えた無料ティアと、拡張された機能、より高い使用制限、または高度なサポートを提供する有料ティアを意味します。Subquadraticは、コスト効率を主要な利点として強調しており、同等のコーディングパフォーマンスを持つClaude Opusの約20分の1のコストなど、代替品と比較して長文コンテキストタスクの運用コストが大幅に低いと主張しています。

  • Freemium:具体的なティアの詳細と価格は公開されていません。

Pros

  • +Subquadratic Sparse Attention(SSA)アーキテクチャにより、12,000,000トークンのコンテキストウィンドウを高い効率で実現します。
  • +大幅なコスト削減を謳っており、RULER 128 ベンチマークの実行コストは Anthropic の Opus 4.6 の $2,600 に対し約 $8 です。
  • +1M トークンのコンテキストで FlashAttention-2 より 56 倍高速で、密なアテンションより 64.5 倍少ない計算量で済むと報告されています。
  • +長文コンテキスト検索で高い性能を示し、研究環境では 12M コンテキストの needle-in-a-haystack タスクで 90% 超のスコアを達成しています。
  • +コーディング性能も高く、LiveCodeBench で 89.7%、SWE-Bench Verified で 81.8% を記録しました。
  • +OpenAI 互換の API エンドポイントを提供し、開発者にとっての統合を簡素化します。

Cons

  • 現在、アクセスはウェイトリストによる早期アクセスに限られており、主張内容を第三者が広く検証しにくくなっています。
  • 公開されているベンチマークセットは比較的狭く、SubQ が優位とされる領域に偏っている可能性が指摘されています。
  • ベースモデルはゼロから学習されたものではなく、既存のオープンソースモデル(おそらく DeepSeek V4 ファミリー)の重みを出発点として使用しています。
  • MRCR v2 のマルチニードル検索ベンチマークにおいて、研究時(83%)と本番環境(65.9%)のスコアに顕著な差があります。
  • ローンチ時には査読済みの完全な論文や包括的なモデルカードがすぐには提供されず、より高い透明性を求める声が上がりました。
  • 'freemium' モデル以外の具体的な価格詳細は公開されていません。

類似ツール

SubQと競合他社

SubQは、その劣二次アーキテクチャと大幅に大きなコンテキストウィンドウ機能を強調することで、フロンティア大規模言語モデルに対して自らを位置づけています。

1
Natively Sparse Attention (NSA)

NSA enhances long-context modeling in LLMs by seamlessly incorporating sparsity into both training and inference, utilizing hierarchical token modeling and a hardware-aligned design for real-world speedups.

Like SubQ, NSA focuses on sparse attention for long contexts and efficiency. NSA emphasizes hierarchical token modeling and hardware alignment for real-world speedups in both training and inference, aiming to maintain accuracy and contextual relevance.

2
Dynamic Hierarchical Sparse Attention (DHSA)

DHSA is a data-driven framework that dynamically predicts attention sparsity online without retraining the base LLM, achieving significant prefill speedups and preserving near-dense accuracy.

DHSA directly competes with SubQ by offering a dynamic approach to sparse attention for long contexts, focusing on adaptability and significant prefill speedups on existing LLMs, even on resource-constrained devices. It aims to overcome limitations of static sparse methods by adapting to task or input variations.

3
SALE (Low-bit Estimation for Efficient Sparse Attention)

SALE is a fine-grained sparse attention method that accelerates long-context LLM prefilling using 4-bit quantized query-key products and block-sparse attention, requiring no parameter training.

SALE offers a fine-grained sparse attention method specifically for accelerating the prefilling stage of long-context LLMs, similar to SubQ's efficiency goal, but with a focus on low-bit quantization and seamless integration into existing systems without retraining.

4
SparDA (Sparse Decoupled Attention)

SparDA is a decoupled sparse attention architecture that introduces a 'Forecast' projection to predict and prefetch KV blocks, enabling lookahead selection and improving both prefill and decode speed.

SparDA provides a novel decoupled sparse attention architecture that aims for efficiency in both prefill and decode, directly addressing the same performance and long-context challenges as SubQ, but with a unique lookahead selection mechanism and minimal parameter overhead.

Storkでもっと

関連AIツール

同じカテゴリの他のツール(共通タグで関連付け)