Skip to content
AI 도구

SubQ 리뷰

SubQ는 매우 긴 컨텍스트 작업에서 극도의 효율성과 성능을 위해 설계된 하위 2차 희소 어텐션 아키텍처를 기반으로 구축된 대규모 언어 모델(LLM)입니다.

shipped 2026년 6월 18일freemium
Domain rating39Monthly visits16K/moAI-readablepartial
SubQ - AI tool for subq. Professional illustration showing core functionality and features.

핵심 포인트

1단일 프롬프트에서 최대 1,200만 토큰을 처리하여 기존 LLM의 한계를 해결합니다.
2Subquadratic Sparse Attention (SSA) 아키텍처를 활용하여 O(n) 계산 복잡성을 달성합니다.
3밀집 어텐션보다 64.5배 적은 컴퓨팅을 보여주며, 1M 토큰 컨텍스트에서 FlashAttention-2보다 56배 빠릅니다.
4SubQ 1.1 Small은 2026년 6월 16일 마이애미 기반 스타트업 Subquadratic에 의해 출시되었으며, 2,900만 달러의 시드 펀딩을 확보했습니다.

Stork’s verdict on SubQ

SubQ는 수백만 토큰 컨텍스트를 효율적으로 제공하지만, 공개된 벤치마크 세트는 협소합니다.

SubQ reviewed by Stork AI · stork.ai/ko/subq

사양

API 제공 여부

예, 공개 API

overview

SubQ란 무엇인가요?

SubQ는 Subquadratic이 개발한 대규모 언어 모델(LLM) 도구로, 개발자, 엔터프라이즈 팀, 데이터 엔지니어, 연구원 및 코딩 에이전트가 수백만 토큰 컨텍스트에서 추론할 수 있도록 합니다. 이는 매우 긴 컨텍스트 작업에서 향상된 효율성과 성능을 위해 하위 2차 희소 어텐션 아키텍처를 활용합니다. SubQ는 컨텍스트 길이가 길어질수록 컴퓨팅 요구 사항이 기하급수적으로 증가하는 표준 트랜스포머 모델의 2차 스케일링 한계를 극복하기 위해 특별히 설계되었습니다. Subquadratic Sparse Attention (SSA) 아키텍처는 컴퓨팅이 입력 길이에 거의 선형적으로 스케일링되도록 보장하며, 가장 관련성이 높은 토큰 관계에 집중합니다. 이를 통해 SubQ는 상당한 품질 저하 없이 단일 프롬프트에서 최대 1,200만 토큰을 처리할 수 있어 복잡하고 장기적인 AI 에이전트 작업 및 다중 문서 분석에 적합합니다.

features

SubQ의 주요 기능

SubQ는 대규모 언어 모델에서 긴 컨텍스트 처리를 위한 성능과 효율성을 최적화하도록 설계된 여러 기술적 기능을 통합합니다.

  • 효율적인 컨텍스트 처리를 위한 하위 2차 희소 어텐션 아키텍처 (SSA).
  • 최대 1,200만 토큰의 컨텍스트 창을 지원하는 수백만 토큰 추론.
  • 컨텍스트에 대한 선형 비용 스케일링으로, 2차 모델에 비해 계산 비용을 절감합니다.
  • 광범위한 입력 전반에 걸쳐 정확도를 유지하는 거의 완벽한 긴 컨텍스트 검색.
  • 밀집 어텐션 메커니즘보다 64.5배 적은 컴퓨팅을 달성합니다.
  • 1M 토큰 컨텍스트 길이에서 FlashAttention-2보다 56배 빠르게 작동합니다.
  • API를 통해 스트리밍 및 도구 사용 기능을 지원합니다.
  • 개발자 통합을 위한 OpenAI 호환 API 엔드포인트를 제공합니다.
  • SubQ Code 제품 내에서 비용이 많이 드는 모델 턴의 자동 리디렉션을 포함합니다.
  • SubQ Code 제품에 대한 한 줄 설치 프로세스를 제공합니다.

use cases

누가 SubQ를 사용해야 할까요?

SubQ는 광범위한 컨텍스트 처리와 높은 효율성을 요구하는 특정 전문 직업군 및 엔터프라이즈 애플리케이션을 위해 설계되었습니다.

  • 소프트웨어 엔지니어: 전체 코드베이스 분석, 아키텍처 수준 추론 수행, 교차 파일 리팩토링, 종속성 추적 및 보안 취약점 식별을 위해.
  • 재무 분석가 및 법률 전문가: 실사, 재무 서류, 수익 보고서, 계약서 및 복잡한 법률 문서 전반에 걸친 추론을 위해.
  • 연구원 및 데이터 엔지니어: 다중 문서 분석, 수천 페이지의 규제 서류 또는 의료 기록을 수집하여 상관관계를 찾고, 심층 연구 워크플로우를 지원하기 위해.
  • 개발자 및 엔터프라이즈 팀: 장기적인 에이전트 작업 구축, API를 통한 고급 장기 컨텍스트 추론을 애플리케이션에 통합, 영구 에이전트 상태 관리를 위해.

how to use

SubQ 사용 방법

SubQ는 주로 API를 통해 사용하며, 기존 개발 워크플로에 통합할 수 있는 OpenAI 호환 엔드포인트를 제공합니다. 현재 접근은 대기자 명단으로 관리됩니다.

  • 1SubQ API, SubQ Code, SubQ Search에 대한 조기 접근을 위해 대기자 명단에 등록합니다.
  • 2OpenAI 호환 엔드포인트를 통해 SubQ API에 접근하여 기존 애플리케이션에 원활하게 통합합니다.
  • 3API를 사용하여 전체 코드 저장소, 법률 문서, 재무 보고서 등 수백만 토큰 규모의 컨텍스트를 처리합니다.
  • 4SubQ를 AI 에이전트 워크플로에 통합하여 지속적인 상태와 방대한 이력에 대한 추론이 필요한 장기 과제를 수행할 수 있게 합니다.
  • 5API 문서 URL에서 제공되는 SubQ 1.1 Small 모델 카드를 참조하여 상세한 기술 사양과 사용 지침을 확인합니다.

pricing

SubQ 가격 및 요금제

SubQ는 프리미엄 비즈니스 모델로 운영됩니다. 특정 계층별 가격 구조 및 상세 사용 비용은 공개되지 않았지만, 프리미엄 모델은 일반적으로 제한된 액세스 또는 기능을 제공하는 무료 계층과 확장된 기능, 더 높은 사용 한도 또는 고급 지원을 제공하는 유료 계층을 의미합니다. Subquadratic은 비용 효율성을 주요 이점으로 강조하며, 유사한 코딩 성능을 위해 Claude Opus 비용의 약 1/20에 불과하는 등 대안에 비해 장기 컨텍스트 작업에 대한 운영 비용이 훨씬 낮다고 주장합니다.

  • 프리미엄: 특정 계층 세부 정보 및 가격은 공개되지 않습니다.

Pros

  • +Subquadratic Sparse Attention(SSA) 아키텍처 덕분에 12,000,000 토큰의 컨텍스트 윈도우를 높은 효율로 구현합니다.
  • +상당한 비용 절감을 주장하며, RULER 128 벤치마크 실행 비용은 Anthropic의 Opus 4.6의 $2,600에 비해 약 $8입니다.
  • +1M 토큰 컨텍스트에서 FlashAttention-2보다 56배 빠르고, 밀집 어텐션보다 64.5배 적은 연산을 사용한다고 보고됩니다.
  • +긴 컨텍스트 검색에서 높은 성능을 보여, 연구 환경에서 12M 컨텍스트의 needle-in-a-haystack 작업에서 90% 이상의 점수를 기록했습니다.
  • +강력한 코딩 성능을 달성하여 LiveCodeBench에서 89.7%, SWE-Bench Verified에서 81.8%를 기록했습니다.
  • +OpenAI 호환 API 엔드포인트를 제공하여 개발자의 통합을 간소화합니다.

Cons

  • 현재 접근이 대기자 명단을 통한 조기 접근으로 제한되어 있어 주장에 대한 폭넓은 독립적 검증이 어렵습니다.
  • 공개된 벤치마크 세트가 비교적 좁아 SubQ가 우수하리라 예상되는 영역에 치우쳐 있을 수 있다는 지적이 있습니다.
  • 기본 모델은 처음부터 학습된 것이 아니라 기존 오픈소스 모델(아마도 DeepSeek V4 계열)의 가중치를 출발점으로 사용합니다.
  • MRCR v2 멀티 니들 검색 벤치마크에서 연구(83%)와 프로덕션(65.9%) 점수 사이에 뚜렷한 격차가 존재합니다.
  • 출시 시점에 동료 심사를 거친 완전한 논문이나 포괄적인 모델 카드가 즉시 제공되지 않아 더 높은 투명성을 요구하는 목소리가 있었습니다.
  • 'freemium' 모델 외의 구체적인 가격 정보는 공개되지 않았습니다.

유사한 도구

SubQ 대 경쟁사

SubQ는 하위 2차 아키텍처와 훨씬 더 큰 컨텍스트 창 기능을 강조함으로써 최첨단 대규모 언어 모델에 맞서 자체적인 입지를 구축합니다.

1
Natively Sparse Attention (NSA)

NSA enhances long-context modeling in LLMs by seamlessly incorporating sparsity into both training and inference, utilizing hierarchical token modeling and a hardware-aligned design for real-world speedups.

Like SubQ, NSA focuses on sparse attention for long contexts and efficiency. NSA emphasizes hierarchical token modeling and hardware alignment for real-world speedups in both training and inference, aiming to maintain accuracy and contextual relevance.

2
Dynamic Hierarchical Sparse Attention (DHSA)

DHSA is a data-driven framework that dynamically predicts attention sparsity online without retraining the base LLM, achieving significant prefill speedups and preserving near-dense accuracy.

DHSA directly competes with SubQ by offering a dynamic approach to sparse attention for long contexts, focusing on adaptability and significant prefill speedups on existing LLMs, even on resource-constrained devices. It aims to overcome limitations of static sparse methods by adapting to task or input variations.

3
SALE (Low-bit Estimation for Efficient Sparse Attention)

SALE is a fine-grained sparse attention method that accelerates long-context LLM prefilling using 4-bit quantized query-key products and block-sparse attention, requiring no parameter training.

SALE offers a fine-grained sparse attention method specifically for accelerating the prefilling stage of long-context LLMs, similar to SubQ's efficiency goal, but with a focus on low-bit quantization and seamless integration into existing systems without retraining.

4
SparDA (Sparse Decoupled Attention)

SparDA is a decoupled sparse attention architecture that introduces a 'Forecast' projection to predict and prefetch KV blocks, enabling lookahead selection and improving both prefill and decode speed.

SparDA provides a novel decoupled sparse attention architecture that aims for efficiency in both prefill and decode, directly addressing the same performance and long-context challenges as SubQ, but with a unique lookahead selection mechanism and minimal parameter overhead.

Stork에서 더 보기

관련 AI 도구

같은 카테고리의 다른 도구 — 공통 태그로 연결