Skip to content
research

Los benchmarks de Vector DB te están mintiendo

Cada base de datos vectorial afirma ser la más rápida y precisa, pero sus benchmarks son profundamente defectuosos. Descubre el problema del cuatrillón de cálculos que ocultaba la verdad y el nuevo conjunto de datos de 24TB que finalmente la expone.

Aki Tanaka
Los benchmarks de Vector DB te están mintiendo

El espejismo del benchmark: Por qué cada proveedor gana

Elegir una base de datos vectorial confiable para tu proyecto a menudo se siente como navegar por un salón de espejos. La página de benchmarks de cada proveedor muestra con orgullo su producto en la cima, pintando un panorama contradictorio que genera confusión en toda la industria y erosiona la confianza en las métricas de rendimiento publicadas. Este fenómeno generalizado no es necesariamente un síntoma de intención maliciosa o engaño deliberado.

En cambio, subraya la extrema dificultad de realizar benchmarking de búsqueda vectorial honesto. Evaluar con precisión estos sistemas complejos exige inmensos recursos computacionales y una metodología meticulosa, lo que obliga a muchos proveedores a tomar atajos. Estos a menudo conducen a resultados incompletos o "a medio hacer", lo que hace que la comparación objetiva sea casi imposible para los usuarios que buscan información de rendimiento genuina.

Central para este desafío de benchmarking es el recall, la métrica más crítica para la precisión. El recall cuantifica con precisión cuántos de los verdaderos vecinos más cercanos de una consulta recupera realmente un motor de un conjunto de datos. Para medir esta métrica de manera confiable, primero se deben calcular estos verdaderos vecinos más cercanos de forma exacta, no aproximada, estableciendo una "verdad fundamental" (ground truth) como base para la comparación.

Lograr esta verdad fundamental exacta es computacionalmente prohibitivo para implementaciones a gran escala. Considera un conjunto de datos de 10 mil millones de vectores procesados con 120,000 consultas: este escenario requiere más de un cuatrillón (10^15) de cálculos de distancia exactos. Esta barrera computacional astronómica explica por qué nadie había emprendido previamente un cálculo tan exhaustivo y preciso, fomentando un profundo escepticismo sobre las afirmaciones de los proveedores y dejando a la industria sin benchmarks independientes verdaderamente confiables.

Un cuatrillón de razones para ser escéptico

Medir el verdadero rendimiento de una base de datos vectorial depende del recall, la proporción de vecinos más cercanos reales que un motor recupera para una consulta determinada. Esta métrica presenta un dilema fundamental: para evaluar con precisión el recall, primero se debe poseer la "verdad fundamental" (ground truth), el conjunto preciso de vecinos más cercanos calculado sin aproximación. Sin esta respuesta definitiva, cualquier medición de recall es inherentemente especulativa.

Establecer esta verdad fundamental es computacionalmente inmenso. Considera un conjunto de datos de 10 mil millones de vectores que requiere 120,000 consultas; determinar los vecinos más cercanos exactos requiere más de un cuatrillón (10^15) de cálculos de distancia. Esta escala astronómica representa una barrera computacional que históricamente ha hecho que el benchmarking integral e imparcial sea poco práctico para la gran mayoría.

Dichos costos prohibitivos han impedido directamente que la industria desarrolle conjuntos de datos de referencia verdaderamente neutrales y a gran escala. En consecuencia, los proveedores se han visto obligados a crear sus propios benchmarks, a menudo más pequeños, perpetuando inadvertidamente el ciclo de afirmaciones de rendimiento interesadas. Esta barrera histórica explica el desafío persistente para obtener evaluaciones objetivas de bases de datos vectoriales.

El conjunto de datos de 24 Terabytes que lo cambia todo

Qdrant cambió drásticamente el panorama al asumir la tarea computacionalmente costosa de establecer la ground truth (verdad fundamental). Anteriormente, calcular los vecinos más cercanos exactos para 10 mil millones de vectores implicaba más de un cuatrillón de cálculos de distancia, una barrera insuperable. Pero Qdrant invirtió fuertemente, consumiendo una enorme capacidad de cómputo GPU para crear un conjunto de datos de 24 terabytes de 10 mil millones de vectores, ahora disponible públicamente. Este esfuerzo monumental proporciona la primera verdad fundamental calculada con precisión para la búsqueda vectorial a escala de Internet; explórelo más a fondo en Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Face.

Esta nueva claridad revela marcadas diferencias de rendimiento entre los motores. Al probarse contra una parte de este riguroso conjunto de datos, Elasticsearch tuvo dificultades para superar el 95% de precisión, independientemente de la configuración. Por el contrario, tanto Qdrant como Milvus lograron consistentemente un 98% de precisión, demostrando su capacidad superior para recuperar los verdaderos vecinos más cercanos.

Estos resultados destacan perfiles operativos distintos. Elasticsearch sigue siendo la forma más rápida de estar aproximadamente en lo correcto, ofreciendo velocidad para demandas de recuperación menos críticas. Pero Qdrant surge como un líder claro para aplicaciones que exigen tanto alta precisión como recuperación rápida, entregando los resultados más precisos a velocidades competitivas. Este conjunto de datos finalmente permite comparaciones objetivas y equitativas.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

Su plan de acción: cómo elegir una base de datos vectorial ahora

El esfuerzo monumental de Qdrant, calculando la ground truth para un conjunto de datos de 10 mil millones de vectores y 24 terabytes, cambia todo el panorama. Este recurso disponible públicamente, nacido de cuatrillones de cálculos de distancia, ofrece finalmente una línea base verificable para medir la recuperación (recall), una hazaña que antes se consideraba demasiado costosa y compleja. Este desarrollo supera con creces cualquier resultado de benchmark individual.

Manténgase sumamente escéptico ante las afirmaciones publicadas por los proveedores. Cada proveedor de bases de datos vectoriales sigue presentando su producto como superior en sus propias páginas de benchmarks, una consecuencia natural de la dificultad inherente de realizar pruebas comparativas. En lugar de confiar en estas narrativas seleccionadas, empodérese con estos nuevos datos.

Aproveche estas herramientas sin precedentes para probar rigurosamente las bases de datos frente a su carga de trabajo de producción específica. Esto significa evaluar el rendimiento para sus patrones de consulta y características de datos únicos. El objetivo no es declarar un único 'ganador', sino comprender meticulosamente las compensaciones en el mundo real.

Considere la compleja interacción entre la velocidad de búsqueda, la precisión de recuperación (recall accuracy) y el costo operativo para su aplicación. Por ejemplo, aunque Milvus y Qdrant podrían alcanzar un 98% de precisión, sus perfiles de velocidad podrían diferir significativamente. Su decisión informada dependerá del equilibrio de estos factores críticos para un diseño de sistema óptimo.

Preguntas frecuentes

¿Por qué la mayoría de los benchmarks de bases de datos vectoriales no son fiables?

No son fiables porque medir con precisión métricas de rendimiento como el 'recall' es computacionalmente costoso. Muchos proveedores toman atajos, lo que lleva a resultados sesgados e 'incompletos' donde parecen superar a la competencia.

¿Qué es el 'recall' en el contexto de una base de datos vectorial?

El 'recall' mide la precisión de una búsqueda. Es el porcentaje de los verdaderos vecinos más cercanos que la base de datos recupera con éxito para una consulta determinada. Un 'recall' del 98% significa que el motor encontró 98 de los 100 vectores más cercanos reales.

¿Cuál es la importancia del conjunto de datos de 10 mil millones de vectores de Qdrant?

Este conjunto de datos de 24TB es el primero de su escala en incluir la 'verdad fundamental' precalculada de los vecinos más cercanos exactos. Proporciona una base pública e imparcial para comparar con precisión diferentes bases de datos vectoriales entre sí, resolviendo un problema importante de la industria.

¿Qué base de datos vectorial es la mejor según el nuevo benchmark?

No existe una única 'mejor' opción para todos los casos. Las pruebas muestran diferentes fortalezas: Elasticsearch es rápido para resultados 'aproximadamente correctos' (~95% de precisión), mientras que Qdrant y Milvus pueden lograr una mayor precisión (~98% de precisión), destacando Qdrant por ser tanto rápido como preciso.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.