Skip to content
research

Les benchmarks de Vector DB vous mentent

Chaque base de données vectorielle prétend être la plus rapide et la plus précise, mais leurs benchmarks sont profondément biaisés. Découvrez le problème du quadrillion de calculs qui cachait la vérité, et le nouveau jeu de données de 24 To qui l'expose enfin.

Aki Tanaka
Les benchmarks de Vector DB vous mentent

Le mirage des benchmarks : pourquoi chaque fournisseur gagne

Choisir une base de données vectorielle fiable pour votre projet ressemble souvent à une traversée dans un palais des glaces. La page de benchmark de chaque fournisseur affiche fièrement son produit en tête, dressant un tableau contradictoire qui crée une confusion à l'échelle de l'industrie et érode la confiance dans les mesures de performance publiées. Ce phénomène généralisé n'est pas nécessairement le symptôme d'une intention malveillante ou d'une tromperie délibérée.

Au contraire, il souligne l'extrême difficulté du benchmarking de recherche vectorielle honnête. Évaluer précisément ces systèmes complexes exige d'immenses ressources informatiques et une méthodologie méticuleuse, poussant de nombreux fournisseurs à prendre des raccourcis. Ceux-ci mènent souvent à des résultats incomplets ou « bâclés », rendant la comparaison objective presque impossible pour les utilisateurs en quête d'informations réelles sur les performances.

Au cœur de ce défi de benchmarking se trouve le recall, la mesure la plus critique pour la précision. Le recall quantifie précisément combien des véritables plus proches voisins d'une requête un moteur récupère réellement à partir d'un jeu de données. Pour mesurer cette métrique de manière fiable, il faut d'abord calculer ces véritables plus proches voisins exactement — et non approximativement — en établissant une « vérité terrain » (ground truth) fondamentale pour la comparaison.

Atteindre cette vérité terrain exacte est prohibitif sur le plan informatique pour les déploiements à grande échelle. Considérez un jeu de données de 10 milliards de vecteurs traités avec 120 000 requêtes : ce scénario nécessite plus d'un quadrillion (10^15) de calculs de distance exacts. Cette barrière informatique astronomique explique pourquoi personne n'avait auparavant entrepris un calcul aussi exhaustif et précis, alimentant un profond scepticisme autour des affirmations des fournisseurs et laissant l'industrie sans benchmarks indépendants réellement fiables.

Un quadrillion de raisons d'être sceptique

Mesurer la performance réelle d'une base de données vectorielle repose sur le recall, la proportion de plus proches voisins réels qu'un moteur récupère pour une requête donnée. Cette mesure présente un dilemme fondamental : pour évaluer précisément le recall, il faut d'abord posséder la « ground truth » — l'ensemble précis des plus proches voisins calculé sans approximation. Sans cette réponse définitive, toute mesure de recall est intrinsèquement spéculative.

Établir cette ground truth est un défi informatique immense. Considérez un jeu de données de 10 milliards de vecteurs nécessitant 120 000 requêtes ; déterminer les plus proches voisins exacts nécessite plus d'un quadrillion (10^15) de calculs de distance. Cette échelle astronomique représente une barrière informatique qui a historiquement rendu le benchmarking complet et impartial impraticable pour la grande majorité.

De tels coûts prohibitifs ont directement empêché l'industrie de développer des jeux de données de benchmark neutres et à grande échelle. Par conséquent, les fournisseurs ont été contraints de créer leurs propres benchmarks, souvent plus petits, perpétuant involontairement le cycle des affirmations de performance intéressées. Cette barrière historique explique le défi persistant pour obtenir des évaluations objectives des bases de données vectorielles.

Le jeu de données de 24 téraoctets qui change tout

Qdrant a radicalement changé le paysage en entreprenant la tâche coûteuse en calcul consistant à établir une ground truth (vérité terrain). Auparavant, le calcul des plus proches voisins exacts pour 10 milliards de vecteurs impliquait plus d'un quadrillion de calculs de distance, un obstacle insurmontable. Mais Qdrant a investi massivement, utilisant une puissance de calcul GPU considérable pour créer un jeu de données de 24 téraoctets composé de 10 milliards de vecteurs, désormais disponible publiquement. Cet effort monumental fournit la première vérité terrain calculée avec précision pour la recherche vectorielle à l'échelle d'Internet ; explorez-la plus en détail sur Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Face.

Cette nouvelle clarté révèle des différences de performance marquées entre les moteurs. Lorsqu'il est testé sur une partie de ce jeu de données rigoureux, Elasticsearch a eu du mal à dépasser 95 % de précision, quelle que soit la configuration. En revanche, Qdrant et Milvus ont tous deux atteint systématiquement 98 % de précision, démontrant leur capacité supérieure à récupérer les véritables plus proches voisins.

Ces résultats mettent en évidence des profils opérationnels distincts. Elasticsearch reste le moyen le plus rapide d'obtenir un résultat approximativement correct, offrant de la vitesse pour des exigences de rappel moins critiques. Mais Qdrant s'impose comme un leader clair pour les applications exigeant à la fois une haute précision et une récupération rapide, fournissant les résultats les plus précis à des vitesses compétitives. Ce jeu de données permet enfin des comparaisons objectives et équitables.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

Votre plan d'action : comment choisir une base de données vectorielle maintenant

L'effort monumental de Qdrant, calculant la ground truth pour un jeu de données de 10 milliards de vecteurs et 24 téraoctets, modifie tout le paysage. Cette ressource disponible publiquement, née de quadrillions de calculs de distance, offre enfin une base de référence vérifiable pour mesurer le rappel — un exploit auparavant jugé trop coûteux et complexe. Ce développement surpasse largement tout résultat de benchmark individuel.

Restez extrêmement sceptique vis-à-vis des affirmations publiées par les fournisseurs. Chaque fournisseur de base de données vectorielle présente toujours son produit comme supérieur sur ses propres pages de benchmark, une conséquence naturelle de la difficulté inhérente à l'évaluation comparative. Au lieu de vous fier à ces récits sélectionnés, appropriez-vous ces nouvelles données.

Tirez parti de ces outils sans précédent pour tester rigoureusement les bases de données par rapport à votre charge de travail de production spécifique. Cela signifie évaluer les performances pour vos modèles de requêtes et caractéristiques de données uniques. L'objectif n'est pas de déclarer un seul « gagnant », mais de comprendre méticuleusement les compromis dans le monde réel.

Considérez l'interaction complexe entre la vitesse de recherche, la précision du rappel et le coût opérationnel pour votre application. Par exemple, bien que Milvus et Qdrant puissent tous deux atteindre 98 % de précision, leurs profils de vitesse pourraient différer considérablement. Votre décision éclairée dépendra de l'équilibre entre ces facteurs critiques pour une conception système optimale.

Questions fréquemment posées

Pourquoi la plupart des benchmarks de bases de données vectorielles ne sont-ils pas fiables ?

Ils ne sont pas fiables car mesurer avec précision des indicateurs de performance comme le « rappel » est coûteux en calcul. De nombreux fournisseurs prennent des raccourcis, ce qui conduit à des résultats biaisés et « incomplets » où ils semblent surpasser leurs concurrents.

Qu'est-ce que le « rappel » dans le contexte d'une base de données vectorielle ?

Le rappel mesure la précision d'une recherche. C'est le pourcentage des vrais plus proches voisins que la base de données récupère avec succès pour une requête donnée. Un rappel de 98 % signifie que le moteur a trouvé 98 des 100 vecteurs les plus proches réels.

Quelle est la signification du jeu de données de 10 milliards de vecteurs de Qdrant ?

Ce jeu de données de 24 To est le premier de cette envergure à inclure la « vérité terrain » pré-calculée des voisins les plus proches exacts. Il fournit une base publique et impartiale pour comparer avec précision différentes bases de données vectorielles, résolvant ainsi un problème majeur du secteur.

Quelle base de données vectorielle est la meilleure selon le nouveau benchmark ?

Il n'y a pas de « meilleure » solution unique pour tous les cas. Les tests montrent des forces différentes : Elasticsearch est rapide pour des résultats « approximativement corrects » (précision d'environ 95 %), tandis que Qdrant et Milvus peuvent atteindre une précision supérieure (environ 98 %), Qdrant étant reconnu pour être à la fois rapide et précis.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Pour les builders

Cette page travaille pour l’outil de quelqu’un d’autre.

Les agents IA la lisent. Des acheteurs y arrivent. Elle répond en huit langues et via MCP. Votre outil peut avoir la sienne — en ligne en 24 heures.