規模と正解データ(Ground-Truth)の罠
ベクトルデータベースのベンチマークは、主に規模不足が原因で開発者を誤解させることがよくあります。100万個のベクトルを用いたテストでは、1億個以上を要求する本番環境での真のパフォーマンスはほとんど分かりません。例えば、従来のベンチマークでは dbpedia-openai-1M-angular(100万ベクトル)や deep-image-96-angular(1000万ベクトル)のようなデータセットが頻繁に使用されてきました。
このような小規模なテストでは、本番環境で発生する重大なボトルネックを再現できません。メモリ負荷、長大なインデックス構築時間、あるいはデータがディスクから溢れた際に発生する顕著なテールレイテンシといった真の課題を浮き彫りにできないのです。つまり、実際にデプロイする環境とは全く異なる設定で測定を行っていることになります。
2つ目の大きな落とし穴は正解データ(Ground Truth)です。Recall(再現率)は、エンジンがどれだけ正確に最近傍点を返せるかを測定します。Recallを正確に計算するには、すべてのクエリに対して「正確な」最近傍点を知る必要があり、すべてのベクトルとの総当たり比較(Brute-force)が求められます。100億個のベクトルと12万個のクエリの場合、1000兆回以上の距離計算が必要となり、これは以前は不可能と考えられていました。
その結果、ほとんどのベンチマークは妥協しています。具体的には以下の通りです:
- 近似的な正解データを計算し、近似値を別の近似値と比較している。
- 合成されたランダム生成ベクトルを使用している。これらは実世界の埋め込みデータが持つ複雑なクラスタ構造を欠いており、検索問題を人工的に単純化している。
Qdrantによる100億ベクトルへの挑戦
Qdrantは、規模と正解データという重大な問題に対し、記念碑的なリリースで応えました。彼らは、100億個のベクトルを含み、24.5テラバイトに及ぶ公開データセット FineWeb-10B を導入しました。Hugging Faceの広大なFineWebコーパスから抽出されたこのデータセットは、本物のWebコンテンツを表現しており、小規模なサンプルでは達成できなかった、堅牢なベクトルデータベースベンチマークのための比類なき規模を提供します。
これほど巨大なデータセットに対して信頼できる正解データを確立するには、並外れた計算能力が必要でした。Qdrantは12万個の異なるクエリに対して、トップ1000の最近傍点を正確に特定するために、1000兆回を超える距離計算を実行しました。この総当たりアプローチは従来の近似手法を回避し、この前例のない規模と深さにおいて、以前は不可能と思われていた正確なRecallの測定を実現しました。
FineWeb-10Bの豊富な構成は、実世界のアプリケーションにおける多様な検索戦略の包括的なテストを可能にします。同一ドキュメントから生成された密ベクトル(Dense)と疎ベクトル(Sparse)の両方を備えており、意味的な意味とキーワードの関連性の両方を捉えています。このデュアルベクトル設計により、以下のような現実的なベンチマークが可能になります:
- セマンティック検索
- キーワード検索
- ハイブリッド検索
- 正確なベンチマークが非常に困難な、複雑なフィルタリングクエリ
ブラックボックスの終焉:オープンソースの義務
Qdrantのアプローチは、単なるマーケティング上の主張を超えた、完全な透明性を推進するものです。100億個のベクトルと24.5テラバイトの埋め込みデータを持つ巨大なFineWeb-10Bデータセットは、Hugging Faceから自由にダウンロード可能です。つまり、必要な計算リソースさえあれば、あなた自身が全コーパスに対して正確な最近傍点を再計算し、Qdrantが公開した結果を独自に検証できるということです。このオープンな可用性は、ベクトルデータベースのベンチマークを、独自のブラックボックスから検証可能な科学的取り組みへと根本的に変革します。
この前例のないデータセットを補完するものとして、QdrantはFineWeb-10Bの構築に使用された分散ツールチェーン全体をオープンソース化しました。Supernovaと名付けられたこの堅牢なフレームワークは、寛容なApache 2.0ライセンスの下で動作します。Supernovaは、ベンチマークプロセスのあらゆる重要なステップを処理します。
- 生テキストからの埋め込み生成
- ベクターストアへの効率的なデータベース読み込み
- 包括的な負荷テストとパフォーマンス測定
この包括的なオープンソーススイートは、ベンチマークプロセスの再現性だけでなく、拡張性も保証します。
重要な点として、開発者はもはやQdrantの特定のベンチマークを再現するだけに留まりません。Supernovaを使用することで、フレームワーク全体を独自のデータコーパスに向けることが可能になります。この機能により、特定のユースケースに正確に合わせた真に関連性の高いカスタムベンチマークを作成でき、独自のデータ特性やクエリパターンにおける実世界のパフォーマンスを反映させることができます。データセットとフレームワークに関する詳細な技術的洞察については、Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Faceをご覧ください。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
リーダーボードから実世界のトレードオフへ
FineWeb-10Bは、単純なリーダーボードを超えて、ベクトルデータベースに固有の複雑なパフォーマンス曲線とトレードオフを明らかにし、ベンチマークのあり方を根本から変えます。100億個のベクトルと、上位1000件の最近傍までの正確なグラウンドトゥルース(正解データ)を備えたこのデータセットは、実世界のエンタープライズ規模の条件下でエンジンがどのように動作するかを比類のない視点で提供します。目的は単一の「勝者」を決めることではなく、詳細な運用マップを提供することです。
データベースに万能な優位性はありません。その強みは特定の要求に依存します。スペクトルを考えてみましょう。Elasticsearchのようなエンジンは、計算コストを抑えつつ「十分な」精度の検索を迅速に提供できるため、近似的な結果が許容されるシナリオで優れています。対照的に、QdrantやMilvusのような専用のベクトルデータベースは、多くの場合、より高いリコール(より多くの真の最近傍を取得する)を提供しますが、特に規模が拡大するにつれて、速度やリソースのプロファイルが異なる可能性があります。
最終的に、FineWeb-10Bの真の価値は、エンジニアリングチームに実用的でデータに基づいた洞察を与えることにあります。この透明性により、特定のアプリケーションニーズに合わせた情報に基づいた意思決定が可能になります。上位5件の最も関連性の高いドキュメントを必要とする低遅延のRAG(検索拡張生成)システムを設計する場合でも、後続の処理のために上位1000件の結果を要求する高リコールの候補生成パイプラインを設計する場合でも、このデータセットは各アーキテクチャの選択におけるレイテンシと精度のトレードオフを正確に定義します。
よくある質問
FineWeb-10Bデータセットとは何ですか?
FineWeb-10Bは、ベクトルデータベースのベンチマークを行うためにQdrantが作成した大規模なオープンソースデータセットです。実際のWebデータから抽出された100億個のベクトルと、12万件の検索クエリに対する正確で事前に計算された「グラウンドトゥルース」が含まれています。
なぜほとんどのベクトルデータベースのベンチマークは信頼できないのですか?
ほとんどのベンチマークが信頼できない理由は主に2つあります。本番環境の規模を反映していない小さなデータセットを使用していること、そして正確な回答を計算するには計算コストがかかるため、近似的または合成的な「グラウンドトゥルース」を使用していることが多いことです。これが誤解を招くパフォーマンス結果につながります。
ベクトル検索における「グラウンドトゥルース」とは何ですか?
ベクトル検索において「グラウンドトゥルース」とは、特定のクエリに対する最も近い近傍の、決定的かつ完全に正確なセットを指します。これは、ショートカットを使用せずにデータセット内のすべてのベクトルに対してクエリベクトルを比較することで確立されます。これは正確性を保証するブルートフォース(総当たり)手法です。
FineWeb-10BはどのようにAIベンチマークを改善しますか?
スケーラビリティと精度の核心的な問題を解決します。検証可能で正確なグラウンドトゥルースを備えた100億ベクトルのデータセットと、オープンソースのツールチェーン(Supernova)を提供することで、開発者は実際のプロダクションワークロードを反映した、現実的で再現性があり、透明性の高いベンチマークを実行できるようになります。

