Skip to content
research

Die geheime Lüge der KI-Benchmarks

Jede Vektordatenbank behauptet, die schnellste zu sein, doch ihre Benchmarks basieren auf fehlerhaften Daten. Ein neuer, massiver Open-Source-Datensatz hat nun die Wahrheit enthüllt und zwingt die gesamte Branche dazu, ihre Leistungskennzahlen zu überdenken.

Aki Tanaka
Die geheime Lüge der KI-Benchmarks

Die Falle von Skalierung und Ground-Truth

Benchmarks für Vektordatenbanken führen Entwickler oft in die Irre, vor allem aufgrund unzureichender Skalierung. Ein Test mit 1 Million Vektoren sagt wenig über die tatsächliche Leistung in einer Produktionsumgebung aus, die 100 Millionen oder mehr erfordert. Frühere Benchmarks nutzten beispielsweise oft Datensätze wie dbpedia-openai-1M-angular (1 Million Vektoren) oder deep-image-96-angular (10 Millionen).

Solche kleinskaligen Tests lösen keine kritischen Produktionsengpässe aus. Sie decken nicht die echten Herausforderungen von Speicherdruck, verlängerten Index-Erstellungszeiten oder die signifikante Tail-Latency auf, die auftritt, sobald Daten vom Festplattenspeicher ausgelagert werden. Sie messen ein völlig anderes Setup als das, das Sie tatsächlich einsetzen.

Die zweite große Falle liegt in der Ground-Truth. Der Recall misst, wie viele der tatsächlichen nächsten Nachbarn (Nearest Neighbors) eine Engine zurückgibt. Um den Recall präzise zu berechnen, muss man die exakten nächsten Nachbarn für jede Abfrage kennen, was einen Brute-Force-Vergleich mit jedem Vektor erfordert. Bei 10 Milliarden Vektoren und 120.000 Abfragen erfordert dies über eine Billiarde Distanzberechnungen – eine Leistung, die bisher als unmöglich galt.

Folglich gehen die meisten Benchmarks Kompromisse ein. Sie tun entweder eines der folgenden:

  • Sie berechnen eine approximative Ground-Truth und messen eine Annäherung gegen eine andere.
  • Sie verwenden synthetische, zufällig generierte Vektoren, denen die komplexen Clusterstrukturen realer Embeddings fehlen, was das Suchproblem künstlich vereinfacht.

Qdrants 10-Milliarden-Vektor-Herausforderung

Qdrant hat die kritischen Probleme von Skalierung und Ground-Truth mit einer monumentalen Veröffentlichung adressiert. Sie stellten FineWeb-10B vor, einen öffentlich zugänglichen Datensatz, der 10 Milliarden Vektoren umfasst und 24,5 Terabyte groß ist. Dieser Datensatz stammt aus dem umfangreichen FineWeb-Korpus von Hugging Face und repräsentiert authentische Webinhalte, was eine beispiellose Skalierung für robuste Vektordatenbank-Benchmarks ermöglicht, die mit kleineren Stichproben nicht erreichbar wäre.

Die Etablierung einer verlässlichen Ground-Truth für einen solch kolossalen Datensatz erforderte außergewöhnliche Rechenleistung. Qdrant führte über eine Billiarde Distanzberechnungen durch, um präzise die Top-1000 nächsten Nachbarn für 120.000 verschiedene Abfragen zu identifizieren. Dieser Brute-Force-Ansatz umgeht frühere Approximationen und liefert ein exaktes Maß für den Recall, das bei dieser beispiellosen Skalierung und Tiefe bisher als undurchführbar galt.

Die reichhaltige Zusammensetzung von FineWeb-10B ermöglicht umfassende Tests verschiedener Abrufstrategien für reale Anwendungen. Er enthält sowohl dichte als auch dünn besetzte Vektoren, die aus identischen Dokumenten generiert wurden und sowohl semantische Bedeutung als auch Schlüsselwortrelevanz erfassen. Dieses Dual-Vektor-Design ermöglicht realistische Benchmarks für:

  • Semantische Suche
  • Schlüsselwortsuche
  • Hybriden Abruf
  • Komplexe gefilterte Abfragen, die bekanntermaßen schwer präzise zu benchen sind.

Keine Blackboxen mehr: Das Open-Source-Mandat

Qdrants Ansatz steht für vollständige Transparenz und geht über bloße Marketingversprechen hinaus. Der massive FineWeb-10B-Datensatz mit seinen 10 Milliarden Vektoren und 24,5 Terabyte an Embeddings steht auf Hugging Face zum kostenlosen Download bereit. Das bedeutet, dass Sie bei entsprechenden Rechenressourcen die exakten nächsten Nachbarn selbst über den gesamten Korpus hinweg neu berechnen und somit Qdrants veröffentlichte Ergebnisse unabhängig verifizieren können. Diese offene Verfügbarkeit verwandelt das Benchmarking von Vektordatenbanken grundlegend von einer proprietären Blackbox in ein verifizierbares wissenschaftliches Unterfangen.

Als Ergänzung zu diesem beispiellosen Datensatz hat Qdrant die gesamte verteilte Toolchain, die für den Aufbau von FineWeb-10B verwendet wurde, als Open Source veröffentlicht. Dieses robuste Framework mit dem Namen Supernova arbeitet unter der permissiven Apache 2.0-Lizenz. Supernova übernimmt jeden kritischen Schritt des Benchmarking-Prozesses:

  • Embedding-Generierung aus Rohtext
  • Effizientes Laden von Datenbanken in Vektorspeicher
  • Umfassende Lasttests und Leistungsmessung

Diese umfassende Open-Source-Suite gewährleistet nicht nur die Reproduzierbarkeit, sondern auch die Erweiterbarkeit des Benchmark-Prozesses.

Entscheidend ist, dass Entwickler nicht mehr darauf beschränkt sind, lediglich den spezifischen Benchmark von Qdrant zu reproduzieren. Supernova ermöglicht es ihnen, das gesamte Framework auf ihren eigenen proprietären Datenkorpus anzuwenden. Diese Fähigkeit ermöglicht die Erstellung eines wirklich relevanten, benutzerdefinierten Benchmarks, der präzise auf ihren spezifischen Anwendungsfall zugeschnitten ist und die reale Leistung bei ihren einzigartigen Datenmerkmalen und Abfragemustern widerspiegelt. Für weitere technische Einblicke in den Datensatz und das Framework lesen Sie Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Face.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Von Leaderboards zu realen Kompromissen

FineWeb-10B verändert grundlegend das Benchmarking-Narrativ und geht über simplistische Leaderboards hinaus, um die komplexen Leistungskurven und Kompromisse aufzuzeigen, die Vektordatenbanken innewohnen. Mit 10 Milliarden Vektoren und exakter Ground Truth bis zu den Top-1000 nächsten Nachbarn bietet der Datensatz einen beispiellosen Einblick in das tatsächliche Verhalten von Engines unter realen Bedingungen im Unternehmensmaßstab. Das Ziel ist es nicht, einen einzigen „Gewinner“ zu küren, sondern eine detaillierte operative Karte anzubieten.

Datenbanken sind nicht universell überlegen; ihre Stärken hängen von den spezifischen Anforderungen ab. Betrachten Sie das Spektrum: Eine Engine wie Elasticsearch liefert möglicherweise eine schnelle Suche für „ausreichende“ Genauigkeit bei geringeren Rechenkosten und zeichnet sich in Szenarien aus, in denen ungefähre Ergebnisse akzeptabel sind. Umgekehrt bieten speziell entwickelte Vektordatenbanken wie Qdrant oder Milvus oft einen deutlich höheren Recall – das Abrufen von mehr echten nächsten Nachbarn –, wenn auch möglicherweise bei anderen Geschwindigkeits- oder Ressourcenprofilen, insbesondere wenn der Maßstab zunimmt.

Letztendlich liegt der tiefgreifende Wert von FineWeb-10B darin, Engineering-Teams mit umsetzbaren, datengesteuerten Erkenntnissen auszustatten. Diese Transparenz ermöglicht fundierte Entscheidungen, die auf präzise Anwendungsanforderungen zugeschnitten sind. Ob beim Entwurf eines Retrieval-Augmented Generation (RAG)-Systems mit niedriger Latenz, das die 5 relevantesten Dokumente erfordert, oder einer Candidate-Generation-Pipeline mit hohem Recall, die die Top-1000-Ergebnisse für die nachgelagerte Verarbeitung benötigt, der Datensatz grenzt die Latenz- und Genauigkeits-Kompromisse für jede architektonische Wahl präzise ab.

Häufig gestellte Fragen

Was ist der FineWeb-10B-Datensatz?

FineWeb-10B ist ein massiver Open-Source-Datensatz, der von Qdrant für das Benchmarking von Vektordatenbanken erstellt wurde. Er enthält 10 Milliarden Vektoren aus realen Webdaten sowie exakte, vorab berechnete 'Ground Truth'-Antworten für 120.000 Suchanfragen.

Warum sind die meisten Vektordatenbank-Benchmarks unzuverlässig?

Die meisten Benchmarks sind aufgrund zweier Hauptprobleme unzuverlässig: Sie verwenden kleine Datensätze, die nicht den Produktionsmaßstab widerspiegeln, und sie verwenden oft ungefähre oder synthetische 'Ground Truth', da die Berechnung der exakten Antworten rechenintensiv ist. Dies führt zu irreführenden Leistungsergebnissen.

Was ist 'Ground Truth' bei der Vektorsuche?

Bei der Vektorsuche bezieht sich 'Ground Truth' auf die definitive, perfekt genaue Menge der nächsten Nachbarn für eine bestimmte Abfrage. Sie wird ermittelt, indem der Abfragevektor mit jedem einzelnen Vektor im gesamten Datensatz ohne Abkürzungen verglichen wird – eine Brute-Force-Methode, die Korrektheit garantiert.

Wie verbessert FineWeb-10B das KI-Benchmarking?

Es löst die Kernprobleme von Skalierung und Genauigkeit. Durch die Bereitstellung eines Datensatzes mit 10 Milliarden Vektoren, verifizierbarer und exakter Ground Truth sowie einer Open-Source-Toolchain (Supernova) ermöglicht es Entwicklern, realistische, reproduzierbare und transparente Benchmarks durchzuführen, die echte Produktions-Workloads widerspiegeln.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.