Skip to content
research

Le mensonge secret des benchmarks d'IA

Chaque base de données vectorielle prétend être la plus rapide, mais leurs benchmarks reposent sur des données biaisées. Un nouveau jeu de données open-source massif vient de révéler la vérité, forçant toute l'industrie à repenser la performance.

Aki Tanaka
Le mensonge secret des benchmarks d'IA

Le piège de l'échelle et de la vérité terrain (ground-truth)

Les benchmarks de bases de données vectorielles induisent souvent les développeurs en erreur, principalement en raison d'une échelle insuffisante. Un test sur 1 million de vecteurs révèle peu de choses sur les performances réelles dans un environnement de production exigeant 100 millions de vecteurs ou plus. Par exemple, les benchmarks précédents utilisaient souvent des jeux de données comme dbpedia-openai-1M-angular (1 million de vecteurs) ou deep-image-96-angular (10 millions).

De tels tests à petite échelle ne parviennent pas à déclencher les goulots d'étranglement critiques de la production. Ils ne révèlent pas les véritables défis liés à la pression mémoire, aux temps de construction d'index prolongés, ou à la latence de queue significative qui survient lorsque les données sont déchargées sur le disque. Vous mesurez une configuration totalement différente de celle que vous déployez.

Le deuxième écueil majeur réside dans la vérité terrain (ground truth). La mesure de rappel (recall) indique combien de véritables plus proches voisins un moteur renvoie. Pour calculer le rappel avec précision, vous devez connaître les exacts plus proches voisins pour chaque requête, ce qui nécessite une comparaison par force brute avec chaque vecteur. À 10 milliards de vecteurs avec 120 000 requêtes, cela exige plus d'un quadrillion de calculs de distance — un exploit auparavant jugé impossible.

Par conséquent, la plupart des benchmarks font des compromis. Ils soit :

  • Calculent une vérité terrain approximative, mesurant une approximation par rapport à une autre.
  • Utilisent des vecteurs synthétiques générés aléatoirement, qui manquent des structures de regroupement complexes des embeddings du monde réel, simplifiant artificiellement le problème de recherche.

Le défi des 10 milliards de vecteurs de Qdrant

Qdrant a résolu les problèmes critiques d'échelle et de vérité terrain avec une sortie monumentale. Ils ont introduit FineWeb-10B, un jeu de données disponible publiquement comprenant 10 milliards de vecteurs et occupant 24,5 téraoctets. Issu du vaste corpus FineWeb de Hugging Face, ce jeu de données représente un contenu web authentique, offrant une échelle inégalée pour un benchmarking robuste des bases de données vectorielles, impossible à atteindre avec des échantillons plus petits.

Établir une vérité terrain fiable pour un jeu de données aussi colossal a exigé une puissance de calcul extraordinaire. Qdrant a exécuté plus d'un quadrillion de calculs de distance pour identifier précisément les 1000 plus proches voisins pour 120 000 requêtes distinctes. Cette approche par force brute contourne les approximations précédentes, offrant une mesure exacte du rappel auparavant jugée irréalisable à cette échelle et cette profondeur sans précédent.

La composition riche de FineWeb-10B permet des tests complets de diverses stratégies de récupération pour des applications réelles. Il propose à la fois des vecteurs denses et clairsemés, générés à partir des mêmes documents, capturant la signification sémantique et la pertinence des mots-clés. Cette conception à double vecteur permet un benchmarking réaliste pour :

  • La recherche sémantique
  • La recherche par mots-clés
  • La récupération hybride
  • Les requêtes filtrées complexes, notoirement difficiles à benchmarker avec précision.

Fini les boîtes noires : l'impératif de l'open-source

L'approche de Qdrant défend une transparence totale, allant au-delà des simples arguments marketing. Le jeu de données massif FineWeb-10B, avec ses 10 milliards de vecteurs et ses 24,5 téraoctets d'embeddings, est disponible gratuitement en téléchargement sur Hugging Face. Cela signifie que vous pouvez, avec les ressources de calcul nécessaires, recalculer vous-même les plus proches voisins exacts sur l'ensemble du corpus, vérifiant ainsi indépendamment les résultats publiés par Qdrant. Cette disponibilité ouverte transforme fondamentalement le benchmarking des bases de données vectorielles, passant d'une boîte noire propriétaire à une démarche scientifique vérifiable.

En complément de cet ensemble de données sans précédent, Qdrant a mis en open-source l'intégralité de la chaîne d'outils distribuée utilisée pour construire FineWeb-10B. Ce framework robuste, nommé Supernova, fonctionne sous la licence permissive Apache 2.0. Supernova gère chaque étape critique du processus de benchmarking :

  • Génération d'embeddings à partir de texte brut
  • Chargement efficace de bases de données dans des vector stores
  • Tests de charge complets et mesure des performances

Cette suite complète et open-source garantit non seulement la reproductibilité, mais aussi l'extensibilité du processus de benchmark.

Il est crucial de noter que les développeurs ne sont plus limités à la simple reproduction du benchmark spécifique de Qdrant. Supernova leur permet d'orienter l'ensemble du framework vers leur propre corpus de données propriétaires. Cette capacité permet la création d'un benchmark personnalisé et réellement pertinent, adapté précisément à leur cas d'usage spécifique, reflétant les performances réelles sur leurs caractéristiques de données et leurs modèles de requêtes uniques. Pour plus d'informations techniques sur l'ensemble de données et le framework, lisez Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Face.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

Des classements aux compromis du monde réel

FineWeb-10B modifie fondamentalement le récit du benchmarking, allant au-delà des classements simplistes pour révéler les courbes de performance complexes et les compromis inhérents aux bases de données vectorielles. Avec 10 milliards de vecteurs et une vérité terrain exacte jusqu'aux 1000 plus proches voisins, l'ensemble de données offre une vue inégalée sur le comportement réel des moteurs dans des conditions d'échelle d'entreprise. L'objectif n'est pas de couronner un seul "gagnant", mais d'offrir une carte opérationnelle détaillée.

Les bases de données ne sont pas universellement supérieures ; leurs forces dépendent des exigences spécifiques. Considérez le spectre : un moteur comme Elasticsearch peut offrir une recherche rapide pour une précision "suffisante" à un coût computationnel moindre, excellant dans les scénarios où des résultats approximatifs sont acceptables. À l'inverse, les bases de données vectorielles spécialisées telles que Qdrant ou Milvus offrent souvent un rappel significativement plus élevé — récupérant davantage de vrais plus proches voisins — bien que potentiellement avec des profils de vitesse ou de ressources différents, surtout à mesure que l'échelle augmente.

En fin de compte, la valeur profonde de FineWeb-10B réside dans sa capacité à fournir aux équipes d'ingénierie des informations exploitables et basées sur des données. Cette transparence permet de prendre des décisions éclairées adaptées aux besoins précis de l'application. Qu'il s'agisse de concevoir un système de Retrieval-Augmented Generation (RAG) à faible latence nécessitant les 5 documents les plus pertinents, ou un pipeline de génération de candidats à haut rappel exigeant les 1000 meilleurs résultats pour un traitement ultérieur, l'ensemble de données délimite précisément les compromis entre latence et précision pour chaque choix architectural.

Foire aux questions

Qu'est-ce que l'ensemble de données FineWeb-10B ?

FineWeb-10B est un ensemble de données massif et open-source créé par Qdrant pour le benchmarking des bases de données vectorielles. Il contient 10 milliards de vecteurs issus de données web réelles, accompagnés de réponses de 'vérité terrain' exactes et pré-calculées pour 120 000 requêtes de recherche.

Pourquoi la plupart des benchmarks de bases de données vectorielles ne sont-ils pas fiables ?

La plupart des benchmarks ne sont pas fiables en raison de deux problèmes principaux : ils utilisent de petits ensembles de données qui ne reflètent pas l'échelle de production, et ils utilisent souvent une 'vérité terrain' approximative ou synthétique car le calcul des réponses exactes est coûteux en termes de calcul. Cela conduit à des résultats de performance trompeurs.

Qu'est-ce que la 'vérité terrain' (ground truth) dans la recherche vectorielle ?

Dans la recherche vectorielle, la 'vérité terrain' fait référence à l'ensemble définitif et parfaitement précis des plus proches voisins pour une requête donnée. Elle est établie en comparant le vecteur de requête à chaque vecteur de l'ensemble de données complet sans aucun raccourci — une méthode de force brute qui garantit l'exactitude.

Comment FineWeb-10B améliore-t-il l'évaluation comparative (benchmarking) de l'IA ?

Il résout les problèmes fondamentaux d'échelle et de précision. En fournissant un jeu de données de 10 milliards de vecteurs avec une vérité terrain (ground truth) vérifiable et exacte, ainsi qu'une chaîne d'outils open-source (Supernova), il permet aux développeurs d'exécuter des benchmarks réalistes, reproductibles et transparents qui reflètent les véritables charges de travail en production.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Pour les builders

Cette page travaille pour l’outil de quelqu’un d’autre.

Les agents IA la lisent. Des acheteurs y arrivent. Elle répond en huit langues et via MCP. Votre outil peut avoir la sienne — en ligne en 24 heures.