Skip to content
research

La mentira secreta de los benchmarks de IA

Cada base de datos vectorial afirma ser la más rápida, pero sus benchmarks se basan en datos defectuosos. Un nuevo y masivo conjunto de datos de código abierto acaba de exponer la verdad, obligando a toda la industria a replantearse el rendimiento.

Aki Tanaka
La mentira secreta de los benchmarks de IA

La trampa de la escala y la verdad fundamental (Ground-Truth)

Los benchmarks de bases de datos vectoriales a menudo engañan a los desarrolladores, principalmente debido a una escala insuficiente. Una prueba con 1 millón de vectores revela poco sobre el rendimiento real en un entorno de producción que exige 100 millones o más. Por ejemplo, los benchmarks anteriores a menudo utilizaban conjuntos de datos como dbpedia-openai-1M-angular (1 millón de vectores) o deep-image-96-angular (10 millones).

Pruebas a tan pequeña escala no logran activar los cuellos de botella críticos de producción. No exponen los desafíos reales de la presión de memoria, los tiempos extendidos de construcción de índices o la latencia de cola significativa que surge una vez que los datos se desplazan del disco. Estás midiendo una configuración completamente diferente a la que implementas.

El segundo gran escollo reside en la verdad fundamental (ground truth). La métrica de recall mide cuántos vecinos más cercanos reales devuelve un motor. Para calcular el recall con precisión, debes conocer los vecinos más cercanos exactos para cada consulta, lo que requiere una comparación de fuerza bruta contra cada vector. Con 10 mil millones de vectores y 120,000 consultas, esto exige más de un cuatrillón de cálculos de distancia, una hazaña que antes se consideraba imposible.

En consecuencia, la mayoría de los benchmarks se comprometen. O bien:

  • Calculan una verdad fundamental aproximada, midiendo una aproximación contra otra.
  • Utilizan vectores sintéticos generados aleatoriamente, que carecen de las complejas estructuras de agrupación de los embeddings del mundo real, simplificando artificialmente el problema de búsqueda.

El desafío de los 10 mil millones de vectores de Qdrant

Qdrant abordó los problemas críticos de escala y verdad fundamental con un lanzamiento monumental. Introdujeron FineWeb-10B, un conjunto de datos disponible públicamente que comprende 10 mil millones de vectores y consume 24.5 terabytes. Proveniente del extenso corpus FineWeb de Hugging Face, este conjunto de datos representa contenido web auténtico, proporcionando una escala inigualable para una evaluación comparativa robusta de bases de datos vectoriales que no se puede lograr con muestras más pequeñas.

Establecer una verdad fundamental confiable para un conjunto de datos tan colosal exigió un poder computacional extraordinario. Qdrant ejecutó más de un cuatrillón de cálculos de distancia para identificar con precisión los 1000 vecinos más cercanos para 120,000 consultas distintas. Este enfoque de fuerza bruta evita las aproximaciones anteriores, ofreciendo una medida exacta de recall que antes se consideraba inviable a esta escala y profundidad sin precedentes.

La rica composición de FineWeb-10B permite realizar pruebas exhaustivas de diversas estrategias de recuperación para aplicaciones del mundo real. Cuenta con vectores densos y dispersos, generados a partir de los mismos documentos, capturando el significado semántico y la relevancia de las palabras clave. Este diseño de doble vector permite una evaluación comparativa realista en:

  • Búsqueda semántica
  • Búsqueda por palabras clave
  • Recuperación híbrida
  • Consultas complejas con filtros, que son notoriamente difíciles de evaluar con precisión.

No más cajas negras: el mandato del código abierto

El enfoque de Qdrant defiende la transparencia total, yendo más allá de las simples afirmaciones de marketing. El masivo conjunto de datos FineWeb-10B, con sus 10 mil millones de vectores y 24.5 terabytes de embeddings, está disponible gratuitamente para su descarga en Hugging Face. Esto significa que puedes, dados los recursos computacionales necesarios, volver a calcular los vecinos más cercanos exactos por ti mismo en todo el corpus, verificando así de forma independiente los resultados publicados por Qdrant. Esta disponibilidad abierta transforma fundamentalmente la evaluación comparativa de bases de datos vectoriales de una caja negra propietaria a un esfuerzo científico verificable.

Como complemento a este conjunto de datos sin precedentes, Qdrant ha publicado bajo código abierto toda la cadena de herramientas distribuida utilizada para construir FineWeb-10B. Este robusto marco de trabajo, llamado Supernova, opera bajo la permisiva licencia Apache 2.0. Supernova maneja cada paso crítico del proceso de evaluación comparativa:

  • Generación de embeddings a partir de texto sin procesar
  • Carga eficiente de bases de datos en almacenes vectoriales
  • Pruebas de carga integrales y medición de rendimiento

Esta suite completa de código abierto garantiza no solo la reproducibilidad, sino también la extensibilidad del proceso de evaluación.

Fundamentalmente, los desarrolladores ya no están limitados a simplemente reproducir la evaluación comparativa específica de Qdrant. Supernova les permite dirigir todo el marco de trabajo hacia su propio corpus de datos propietario. Esta capacidad permite la creación de una evaluación comparativa personalizada y verdaderamente relevante, adaptada precisamente a su caso de uso específico, reflejando el rendimiento en el mundo real sobre sus características de datos y patrones de consulta únicos. Para obtener más información técnica sobre el conjunto de datos y el marco de trabajo, lea Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Face.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

De las tablas de clasificación a las compensaciones del mundo real

FineWeb-10B cambia fundamentalmente la narrativa de las evaluaciones comparativas, yendo más allá de las simples tablas de clasificación para revelar las intrincadas curvas de rendimiento y las compensaciones inherentes a las bases de datos vectoriales. Con 10 mil millones de vectores y una verdad fundamental exacta hasta los 1000 vecinos más cercanos, el conjunto de datos proporciona una visión inigualable de cómo se comportan realmente los motores en condiciones reales a escala empresarial. El objetivo no es coronar a un único "ganador", sino ofrecer un mapa operativo detallado.

Las bases de datos no son universalmente superiores; sus fortalezas dependen de las demandas específicas. Considere el espectro: un motor como Elasticsearch podría ofrecer una búsqueda rápida para una precisión "suficientemente buena" a un costo computacional menor, destacando en escenarios donde los resultados aproximados son aceptables. Por el contrario, las bases de datos vectoriales diseñadas específicamente, como Qdrant o Milvus, a menudo proporcionan una recuperación (recall) significativamente mayor —recuperando más vecinos más cercanos reales— aunque potencialmente con perfiles de velocidad o recursos diferentes, especialmente a medida que aumenta la escala.

En última instancia, el valor profundo de FineWeb-10B reside en dotar a los equipos de ingeniería de conocimientos prácticos basados en datos. Esta transparencia permite tomar decisiones informadas adaptadas a las necesidades precisas de la aplicación. Ya sea diseñando un sistema de Generación Aumentada por Recuperación (RAG) de baja latencia que requiera los 5 documentos más relevantes, o una canalización de generación de candidatos de alta recuperación que exija los 1000 mejores resultados para el procesamiento posterior, el conjunto de datos delinea con precisión las compensaciones de latencia y precisión para cada elección arquitectónica.

Preguntas frecuentes

¿Qué es el conjunto de datos FineWeb-10B?

FineWeb-10B es un conjunto de datos masivo de código abierto creado por Qdrant para evaluar bases de datos vectoriales. Contiene 10 mil millones de vectores de datos web reales, junto con respuestas de 'verdad fundamental' (ground truth) exactas y precalculadas para 120,000 consultas de búsqueda.

¿Por qué la mayoría de las evaluaciones comparativas de bases de datos vectoriales no son fiables?

La mayoría de las evaluaciones comparativas no son fiables debido a dos problemas principales: utilizan conjuntos de datos pequeños que no reflejan la escala de producción, y a menudo utilizan una 'verdad fundamental' aproximada o sintética porque calcular las respuestas exactas es costoso desde el punto de vista computacional. Esto conduce a resultados de rendimiento engañosos.

¿Qué es la 'verdad fundamental' (ground truth) en la búsqueda vectorial?

En la búsqueda vectorial, la 'verdad fundamental' se refiere al conjunto definitivo y perfectamente preciso de los vecinos más cercanos para una consulta determinada. Se establece comparando el vector de consulta contra cada vector en todo el conjunto de datos sin atajos: un método de fuerza bruta que garantiza la exactitud.

¿Cómo mejora FineWeb-10B la evaluación comparativa de IA?

Resuelve los problemas fundamentales de escala y precisión. Al proporcionar un conjunto de datos de 10 mil millones de vectores con una verdad fundamental verificable y exacta, junto con una cadena de herramientas de código abierto (Supernova), permite a los desarrolladores ejecutar benchmarks realistas, reproducibles y transparentes que reflejan las cargas de trabajo de producción reales.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.