Skip to content
Herramienta de IA

Revisión de SubQ

SubQ es un Large Language Model (LLM) construido sobre una arquitectura de atención dispersa subcuadrática diseñada para una eficiencia y rendimiento extremos en tareas de contexto muy largo.

shipped 18 jun 2026freemium
Domain rating39Monthly visits16K/moAI-readablepartial
SubQ - AI tool for subq. Professional illustration showing core functionality and features.

Por qué importa

1Procesa hasta 12 millones de tokens en una sola instrucción, abordando las limitaciones de los LLM tradicionales.
2Utiliza una arquitectura Subquadratic Sparse Attention (SSA), logrando una complejidad computacional O(n).
3Demuestra 64.5 veces menos cómputo que la atención densa y es 56 veces más rápido que FlashAttention-2 en un contexto de 1M de tokens.
4SubQ 1.1 Small fue lanzado el 16 de junio de 2026 por la startup Subquadratic, con sede en Miami, que obtuvo $29 millones en financiación inicial.

Stork’s verdict on SubQ

SubQ entrega contexto de millones de tokens de manera eficiente, aunque sus conjuntos de benchmarks publicados son limitados.

SubQ reviewed by Stork AI · stork.ai/es/subq

Especificaciones

Documentación API

API disponible

Sí, API pública

overview

¿Qué es SubQ?

SubQ es una herramienta Large Language Model (LLM) desarrollada por Subquadratic que permite a desarrolladores, equipos empresariales, ingenieros de datos, investigadores y agentes de codificación razonar a través de contextos de millones de tokens. Utiliza una arquitectura de atención dispersa subcuadrática para una eficiencia y rendimiento mejorados en tareas de contexto muy largo. SubQ está específicamente diseñado para superar las limitaciones de escalado cuadrático de los modelos transformadores estándar, donde los requisitos de cómputo aumentan exponencialmente con la longitud del contexto. Su arquitectura Subquadratic Sparse Attention (SSA) asegura que el cómputo escala aproximadamente linealmente con la longitud de entrada, centrándose en las relaciones de tokens más relevantes. Esto permite a SubQ procesar hasta 12 millones de tokens en una sola instrucción sin una degradación significativa de la calidad, haciéndolo adecuado para tareas de agente de IA complejas y de largo horizonte y análisis de múltiples documentos.

features

Características Clave de SubQ

SubQ incorpora varias características técnicas diseñadas para optimizar el rendimiento y la eficiencia en el procesamiento de contexto largo en Large Language Models.

  • Arquitectura de atención dispersa subcuadrática (SSA) para un procesamiento eficiente del contexto.
  • Razonamiento de millones de tokens, soportando ventanas de contexto de hasta 12 millones de tokens.
  • Escalado lineal de costos para el contexto, reduciendo el gasto computacional en comparación con los modelos cuadráticos.
  • Recuperación de contexto largo casi perfecta, manteniendo la precisión en entradas extensas.
  • Logra 64.5 veces menos cómputo que los mecanismos de atención densa.
  • Opera 56 veces más rápido que FlashAttention-2 con una longitud de contexto de 1M de tokens.
  • Soporta capacidades de streaming y uso de herramientas a través de su API.
  • Proporciona puntos finales de API compatibles con OpenAI para la integración de desarrolladores.
  • Incluye redirección automática de turnos de modelo costosos dentro de su producto SubQ Code.
  • Ofrece un proceso de instalación de una sola línea para el producto SubQ Code.

use cases

¿Quién debería usar SubQ?

SubQ está diseñado para perfiles profesionales específicos y aplicaciones empresariales que requieren un procesamiento de contexto extenso y alta eficiencia.

  • Ingenieros de Software: Para analizar bases de código completas, realizar razonamiento a nivel de arquitectura, refactorización entre archivos, rastreo de dependencias e identificación de vulnerabilidades de seguridad.
  • Analistas Financieros y Profesionales Legales: Para la debida diligencia, razonamiento a través de informes financieros, informes de ganancias, contratos y documentos legales complejos.
  • Investigadores e Ingenieros de Datos: Para análisis de múltiples documentos, ingesta de miles de páginas de documentos regulatorios o registros médicos para encontrar correlaciones, y soporte de flujos de trabajo de investigación profunda.
  • Desarrolladores y Equipos Empresariales: Para construir tareas de agente de largo horizonte, integrar razonamiento avanzado de contexto largo en aplicaciones a través de API, y gestionar estados de agente persistentes.

how to use

Cómo usar SubQ

A SubQ se accede principalmente a través de su API, que ofrece endpoints compatibles con OpenAI para integrarse en los flujos de trabajo de desarrollo existentes. Actualmente el acceso se gestiona mediante una lista de espera.

  • 1Únete a la lista de espera para obtener acceso anticipado a la SubQ API, SubQ Code y SubQ Search.
  • 2Accede a la SubQ API mediante endpoints compatibles con OpenAI para una integración fluida en las aplicaciones existentes.
  • 3Utiliza la API para procesar contextos de varios millones de tokens, como repositorios de código completos, documentos legales o presentaciones financieras.
  • 4Integra SubQ en flujos de trabajo de agentes de IA para habilitar tareas de largo horizonte que requieran estado persistente y razonamiento sobre historiales extensos.
  • 5Consulta la model card de SubQ 1.1 Small, disponible en la URL de la documentación de la API, para conocer las especificaciones técnicas detalladas y las pautas de uso.

pricing

Precios y Planes de SubQ

SubQ opera bajo un modelo de negocio freemium. Aunque las estructuras de precios por niveles específicas y los costos de uso detallados no se divulgan públicamente, el modelo freemium típicamente implica un nivel gratuito con acceso o características limitadas, junto con niveles de pago que ofrecen capacidades expandidas, límites de uso más altos o soporte avanzado. Subquadratic ha destacado la eficiencia de costos como un beneficio clave, afirmando costos operativos significativamente más bajos para tareas de contexto largo en comparación con alternativas, como aproximadamente 1/20 del costo de Claude Opus para un rendimiento de codificación comparable.

  • Freemium: Los detalles específicos de los niveles y los precios no se divulgan públicamente.

Pros

  • +Alcanza una ventana de contexto de 12 millones de tokens con alta eficiencia gracias a su arquitectura Subquadratic Sparse Attention (SSA).
  • +Afirma lograr importantes reducciones de coste: una ejecución del benchmark RULER 128 cuesta aproximadamente $8 frente a los $2.600 de Opus 4.6 de Anthropic.
  • +Se informa que es 56 veces más rápido que FlashAttention-2 con un contexto de 1M de tokens y utiliza 64,5 veces menos cómputo que la atención densa.
  • +Demuestra un alto rendimiento en la recuperación de contexto largo, con más del 90% en tareas de aguja en un pajar con contexto de 12M en entornos de investigación.
  • +Logró un sólido rendimiento en programación, con un 89,7% en LiveCodeBench y un 81,8% en SWE-Bench Verified.
  • +Ofrece endpoints de API compatibles con OpenAI, simplificando la integración para los desarrolladores.

Cons

  • El acceso se limita actualmente al acceso anticipado mediante lista de espera, lo que restringe una verificación independiente amplia de las afirmaciones.
  • Se señala que los conjuntos de benchmarks publicados son relativamente reducidos, posiblemente centrados en áreas en las que se espera que SubQ destaque.
  • El modelo base utiliza pesos de modelos open-source existentes (probablemente la familia DeepSeek V4) como punto de partida, en lugar de entrenarse desde cero.
  • Existe una brecha notable entre las puntuaciones de investigación (83%) y de producción (65,9%) en el benchmark de recuperación multi-aguja MRCR v2.
  • En el lanzamiento no había disponible de inmediato un artículo revisado por pares completo ni una model card exhaustiva, lo que generó peticiones de mayor transparencia.
  • No se revelan públicamente detalles concretos de precios más allá del modelo 'freemium'.

Herramientas similares

SubQ vs Competidores

SubQ se posiciona frente a los Large Language Models de vanguardia enfatizando su arquitectura subcuadrática y sus capacidades de ventana de contexto significativamente más grandes.

1
Natively Sparse Attention (NSA)

NSA enhances long-context modeling in LLMs by seamlessly incorporating sparsity into both training and inference, utilizing hierarchical token modeling and a hardware-aligned design for real-world speedups.

Like SubQ, NSA focuses on sparse attention for long contexts and efficiency. NSA emphasizes hierarchical token modeling and hardware alignment for real-world speedups in both training and inference, aiming to maintain accuracy and contextual relevance.

2
Dynamic Hierarchical Sparse Attention (DHSA)

DHSA is a data-driven framework that dynamically predicts attention sparsity online without retraining the base LLM, achieving significant prefill speedups and preserving near-dense accuracy.

DHSA directly competes with SubQ by offering a dynamic approach to sparse attention for long contexts, focusing on adaptability and significant prefill speedups on existing LLMs, even on resource-constrained devices. It aims to overcome limitations of static sparse methods by adapting to task or input variations.

3
SALE (Low-bit Estimation for Efficient Sparse Attention)

SALE is a fine-grained sparse attention method that accelerates long-context LLM prefilling using 4-bit quantized query-key products and block-sparse attention, requiring no parameter training.

SALE offers a fine-grained sparse attention method specifically for accelerating the prefilling stage of long-context LLMs, similar to SubQ's efficiency goal, but with a focus on low-bit quantization and seamless integration into existing systems without retraining.

4
SparDA (Sparse Decoupled Attention)

SparDA is a decoupled sparse attention architecture that introduces a 'Forecast' projection to predict and prefetch KV blocks, enabling lookahead selection and improving both prefill and decode speed.

SparDA provides a novel decoupled sparse attention architecture that aims for efficiency in both prefill and decode, directly addressing the same performance and long-context challenges as SubQ, but with a unique lookahead selection mechanism and minimal parameter overhead.

Más en Stork

Herramientas IA relacionadas

Otras herramientas de esta categoría, emparejadas por etiquetas comunes