Skip to content
AI Инструмент

Обзор SubQ

SubQ — это большая языковая модель (LLM), построенная на субквадратичной разреженной архитектуре внимания, разработанной для экстремальной эффективности и производительности в задачах с очень длинным контекстом.

shipped 18 июн. 2026 г.freemium
Domain rating39Monthly visits16K/moAI-readablepartial
SubQ - AI tool for subq. Professional illustration showing core functionality and features.

Почему это важно

1Обрабатывает до 12 миллионов токенов в одном запросе, устраняя ограничения традиционных LLM.
2Использует архитектуру субквадратичного разреженного внимания (SSA), достигая вычислительной сложности O(n).
3Демонстрирует в 64,5 раза меньше вычислений, чем плотное внимание, и в 56 раз быстрее, чем FlashAttention-2 при контексте в 1 миллион токенов.
4SubQ 1.1 Small был выпущен 16 июня 2026 года стартапом Subquadratic из Майами, который привлек 29 миллионов долларов начального финансирования.

Stork’s verdict on SubQ

SubQ эффективно предоставляет контекст в несколько миллионов токенов, хотя его опубликованные наборы бенчмарков узки.

SubQ reviewed by Stork AI · stork.ai/ru/subq

Характеристики

Доступность API

Да, публичный API

overview

Что такое SubQ?

SubQ — это инструмент большой языковой модели (LLM), разработанный Subquadratic, который позволяет разработчикам, корпоративным командам, инженерам данных, исследователям и кодирующим агентам рассуждать в контекстах, содержащих миллионы токенов. Он использует субквадратичную разреженную архитектуру внимания для повышения эффективности и производительности в задачах с очень длинным контекстом. SubQ специально разработан для преодоления ограничений квадратичного масштабирования стандартных моделей-трансформеров, где вычислительные требования экспоненциально возрастают с длиной контекста. Его архитектура субквадратичного разреженного внимания (SSA) гарантирует, что вычисления масштабируются примерно линейно с длиной входных данных, фокусируясь на наиболее релевантных связях токенов. Это позволяет SubQ обрабатывать до 12 миллионов токенов в одном запросе без значительного ухудшения качества, что делает его подходящим для сложных, долгосрочных агентских задач ИИ и анализа нескольких документов.

features

Ключевые особенности SubQ

SubQ включает в себя несколько технических особенностей, разработанных для оптимизации производительности и эффективности обработки длинного контекста в больших языковых моделях.

  • Субквадратичная разреженная архитектура внимания (SSA) для эффективной обработки контекста.
  • Рассуждения с миллионами токенов, поддерживающие контекстные окна до 12 миллионов токенов.
  • Линейное масштабирование затрат для контекста, снижающее вычислительные расходы по сравнению с квадратичными моделями.
  • Почти идеальное извлечение длинного контекста, сохраняющее точность при обширных входных данных.
  • Достигает в 64,5 раза меньших вычислений, чем механизмы плотного внимания.
  • Работает в 56 раз быстрее, чем FlashAttention-2 при длине контекста в 1 миллион токенов.
  • Поддерживает возможности потоковой передачи и использования инструментов через свой API.
  • Предоставляет API-конечные точки, совместимые с OpenAI, для интеграции разработчиками.
  • Включает автоматическое перенаправление дорогостоящих модельных циклов в рамках своего продукта SubQ Code.
  • Предлагает процесс установки продукта SubQ Code в одну строку.

use cases

Кому следует использовать SubQ?

SubQ разработан для конкретных профессиональных ролей и корпоративных приложений, требующих обширной обработки контекста и высокой эффективности.

  • Инженеры-программисты: Для анализа целых кодовых баз, выполнения рассуждений на уровне архитектуры, рефакторинга между файлами, отслеживания зависимостей и выявления уязвимостей безопасности.
  • Финансовые аналитики и юристы: Для комплексной проверки, рассуждений по финансовой отчетности, отчетам о прибылях, контрактам и сложным юридическим документам.
  • Исследователи и инженеры данных: Для анализа нескольких документов, обработки тысяч страниц нормативных документов или медицинских записей для поиска корреляций и поддержки глубоких исследовательских рабочих процессов.
  • Разработчики и корпоративные команды: Для создания долгосрочных агентских задач, интеграции расширенных рассуждений с длинным контекстом в приложения через API и управления постоянными состояниями агентов.

how to use

Как использовать SubQ

Доступ к SubQ осуществляется в основном через его API, который предоставляет совместимые с OpenAI эндпоинты для интеграции в существующие процессы разработки. В настоящее время доступ управляется через список ожидания.

  • 1Присоединитесь к списку ожидания, чтобы получить ранний доступ к SubQ API, SubQ Code и SubQ Search.
  • 2Обращайтесь к SubQ API через совместимые с OpenAI эндпоинты для бесшовной интеграции в существующие приложения.
  • 3Используйте API для обработки контекстов размером в несколько миллионов токенов, таких как целые репозитории кода, юридические документы или финансовая отчётность.
  • 4Интегрируйте SubQ в рабочие процессы ИИ-агентов, чтобы обеспечить долгосрочные задачи, требующие постоянного состояния и рассуждений над обширной историей.
  • 5Обратитесь к model card SubQ 1.1 Small, доступной по URL документации API, для подробных технических характеристик и рекомендаций по использованию.

pricing

Цены и планы SubQ

SubQ работает по бизнес-модели freemium. Хотя конкретные многоуровневые структуры ценообразования и подробные затраты на использование не раскрываются публично, модель freemium обычно подразумевает бесплатный уровень с ограниченным доступом или функциями, а также платные уровни, предлагающие расширенные возможности, более высокие лимиты использования или расширенную поддержку. Subquadratic подчеркнула экономическую эффективность как ключевое преимущество, заявляя о значительно более низких эксплуатационных расходах для задач с длинным контекстом по сравнению с альтернативами, например, примерно в 20 раз меньшей стоимости, чем Claude Opus, для сопоставимой производительности кодирования.

  • Freemium: Подробности конкретных уровней и цены публично не раскрываются.

Pros

  • +Достигает контекстного окна в 12 000 000 токенов с высокой эффективностью благодаря архитектуре Subquadratic Sparse Attention (SSA).
  • +Заявляет о значительном снижении затрат: запуск бенчмарка RULER 128 стоит примерно $8 по сравнению с $2 600 у Opus 4.6 от Anthropic.
  • +По сообщениям, в 56 раз быстрее FlashAttention-2 при контексте в 1M токенов и использует в 64,5 раза меньше вычислений, чем плотное внимание.
  • +Демонстрирует высокую производительность при извлечении из длинного контекста, набирая более 90% в задачах «иголка в стоге сена» при контексте 12M в исследовательских условиях.
  • +Достиг высоких результатов в программировании: 89,7% на LiveCodeBench и 81,8% на SWE-Bench Verified.
  • +Предлагает совместимые с OpenAI эндпоинты API, упрощая интеграцию для разработчиков.

Cons

  • Доступ в настоящее время ограничен ранним доступом через список ожидания, что затрудняет широкую независимую проверку заявлений.
  • Опубликованные наборы бенчмарков считаются относительно узкими и, возможно, сосредоточены на областях, где SubQ должен показывать преимущество.
  • Базовая модель использует в качестве отправной точки веса существующих open-source моделей (вероятно, семейства DeepSeek V4), а не обучается с нуля.
  • Существует заметный разрыв между показателями в исследованиях (83%) и в продакшене (65,9%) на бенчмарке многоигольного извлечения MRCR v2.
  • На момент запуска не было сразу доступно ни полноценной рецензируемой статьи, ни исчерпывающей model card, что вызвало призывы к большей прозрачности.
  • Конкретные детали цен помимо модели «freemium» публично не раскрываются.

Похожие инструменты

SubQ против конкурентов

SubQ позиционирует себя против передовых больших языковых моделей, подчеркивая свою субквадратичную архитектуру и значительно большие возможности контекстного окна.

1
Natively Sparse Attention (NSA)

NSA enhances long-context modeling in LLMs by seamlessly incorporating sparsity into both training and inference, utilizing hierarchical token modeling and a hardware-aligned design for real-world speedups.

Like SubQ, NSA focuses on sparse attention for long contexts and efficiency. NSA emphasizes hierarchical token modeling and hardware alignment for real-world speedups in both training and inference, aiming to maintain accuracy and contextual relevance.

2
Dynamic Hierarchical Sparse Attention (DHSA)

DHSA is a data-driven framework that dynamically predicts attention sparsity online without retraining the base LLM, achieving significant prefill speedups and preserving near-dense accuracy.

DHSA directly competes with SubQ by offering a dynamic approach to sparse attention for long contexts, focusing on adaptability and significant prefill speedups on existing LLMs, even on resource-constrained devices. It aims to overcome limitations of static sparse methods by adapting to task or input variations.

3
SALE (Low-bit Estimation for Efficient Sparse Attention)

SALE is a fine-grained sparse attention method that accelerates long-context LLM prefilling using 4-bit quantized query-key products and block-sparse attention, requiring no parameter training.

SALE offers a fine-grained sparse attention method specifically for accelerating the prefilling stage of long-context LLMs, similar to SubQ's efficiency goal, but with a focus on low-bit quantization and seamless integration into existing systems without retraining.

4
SparDA (Sparse Decoupled Attention)

SparDA is a decoupled sparse attention architecture that introduces a 'Forecast' projection to predict and prefetch KV blocks, enabling lookahead selection and improving both prefill and decode speed.

SparDA provides a novel decoupled sparse attention architecture that aims for efficiency in both prefill and decode, directly addressing the same performance and long-context challenges as SubQ, but with a unique lookahead selection mechanism and minimal parameter overhead.

Ещё на Stork

Похожие ИИ-инструменты

Другие инструменты этой категории, подобранные по общим тегам