ベンチマークの蜃気楼:なぜすべてのベンダーが勝者となるのか
プロジェクトのために信頼できるVector DBを選択することは、しばしば鏡の回廊を歩くような感覚に陥ります。すべてのベンダーのベンチマークページは自社製品を誇らしげにトップに掲げており、矛盾した状況が業界全体の混乱を招き、公開されたパフォーマンス指標への信頼を損なっています。この広範な現象は、必ずしも悪意や意図的な欺瞞の兆候とは限りません。
むしろ、これは「Vector search benchmarking(ベクトル検索のベンチマーク)」を誠実に行うことの極端な難しさを浮き彫りにしています。これらの複雑なシステムを正確に評価するには膨大な計算リソースと緻密な手法が必要であり、多くのベンダーが近道を選択せざるを得なくなっています。その結果、不完全で「中途半端な」結果となり、真のパフォーマンス洞察を求めるユーザーにとって客観的な比較はほぼ不可能になっています。
このベンチマークの課題の中心にあるのは、精度を測る最も重要な指標である「recall(再現率)」です。Recallは、クエリの真の近傍点のうち、エンジンがデータセットから実際にいくつ取得できたかを正確に定量化するものです。この指標を確実に測定するには、まず近似ではなく正確に真の近傍点を計算し、比較のための「ground truth(正解データ)」を確立する必要があります。
この正確なground truthを達成することは、大規模なデプロイメントにおいては計算コストが過大です。100億個のベクトルを12万個のクエリで処理するシナリオを考えてみてください。これには1000兆(10^15)回を超える正確な距離計算が必要です。この天文学的な計算の壁こそが、これまで誰もこれほど網羅的で精密な計算を行ってこなかった理由であり、ベンダーの主張に対する深い懐疑心を生み、業界には真に信頼できる独立したベンチマークが存在しない状態が続いてきました。
懐疑的になるべき1000兆の理由
Vector DBの真のパフォーマンスを測定することは、特定のクエリに対してエンジンが取得した実際の近傍点の割合である「recall」にかかっています。この指標には根本的なジレンマがあります。recallを正確に評価するには、まず近似なしで計算された正確な近傍点の集合である「ground truth」を所有していなければならないのです。この決定的な答えがなければ、いかなるrecallの測定も本質的に推測の域を出ません。
このground truthを確立するには膨大な計算が必要です。100億個のベクトルに対して12万個のクエリを実行する場合を考えてみてください。正確な近傍点を特定するには、1000兆(10^15)回を超える距離計算が必要です。この天文学的な規模は、これまで大多数にとって包括的で公平なベンチマークを非現実的なものにしてきた計算上の障壁です。
このような法外なコストが、業界が真に中立で大規模なベンチマークデータセットを開発することを直接的に妨げてきました。その結果、ベンダーは独自の、多くの場合小規模なベンチマークを作成せざるを得なくなり、自社に都合の良いパフォーマンス主張を繰り返す悪循環が続いています。この歴史的な障壁こそが、客観的なVector DBの評価を得ることが困難であり続けている理由です。
すべてを変える24テラバイトのデータセット
Qdrantは、計算コストの高いground truth(正解データ)の確立という課題に取り組むことで、業界の状況を劇的に変えました。以前は、100億個のベクトルに対して正確な最近傍探索を行うには1000兆回以上の距離計算が必要であり、これは乗り越えられない壁でした。しかし、Qdrantは多額の投資を行い、膨大なGPUリソースを投じて100億個のベクトルからなる24テラバイトのデータセットを作成し、これを公開しました。この記念碑的な取り組みにより、インターネット規模のベクトル検索における初の正確なground truthが提供されました。詳細はInternet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Faceをご覧ください。
この新たな明確さにより、エンジン間の性能差が浮き彫りになりました。この厳格なデータセットの一部を用いてテストしたところ、Elasticsearchは設定にかかわらず95%の精度を超えるのに苦戦しました。対照的に、QdrantとMilvusはいずれも一貫して98%の精度を達成し、真の最近傍を検索する優れた能力を実証しました。
これらの結果は、それぞれの運用プロファイルの違いを浮き彫りにしています。Elasticsearchは、それほど高い再現率を求めない場合に速度を優先できる「大まかに正しい結果を出すための最速の手段」であり続けます。しかし、高い精度と迅速な検索の両方を必要とするアプリケーションにおいて、Qdrantは最も正確な結果を競争力のある速度で提供する明確なリーダーとして浮上しました。このデータセットにより、ようやく客観的で公平な比較が可能になりました。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
アクションプラン:今、どのようにベクトルDBを選ぶべきか
100億個のベクトル、24テラバイトのデータセットに対するground truthを計算したQdrantの記念碑的な取り組みは、業界全体の状況を一変させました。1000兆回もの距離計算から生まれたこの公開リソースは、これまでコストと複雑さの面で不可能と考えられていた、再現率を測定するための検証可能な基準をようやく提供するものです。この進展は、個別のベンチマーク結果をはるかに凌駕するものです。
ベンダーが公開する主張には常に懐疑的であってください。ベンチマークの難しさゆえに、すべてのベクトルデータベースベンダーが自社のベンチマークページで自社製品を優位に見せています。こうした調整された物語に頼るのではなく、この新しいデータを活用して自ら判断してください。
これらの前例のないツールを活用し、貴社の特定の本番ワークロードに対してデータベースを厳密にテストしてください。これは、貴社独自のクエリパターンやデータ特性に基づいてパフォーマンスを評価することを意味します。目的は単一の「勝者」を決めることではなく、現実世界でのトレードオフを詳細に理解することです。
アプリケーションにおける検索速度、再現精度(recall accuracy)、運用コストの複雑な相互関係を考慮してください。例えば、MilvusとQdrantの両方が98%の精度を達成したとしても、その速度プロファイルは大きく異なる可能性があります。情報に基づいた意思決定は、最適なシステム設計のためにこれら重要な要素をいかにバランスさせるかにかかっています。
よくある質問
なぜほとんどのベクトルデータベースのベンチマークは信頼できないのですか?
「再現率(recall)」のようなパフォーマンス指標を正確に測定するには計算コストがかかるため、信頼できません。多くのベンダーは近道をしており、その結果、自社が競合他社を上回っているように見せる偏った「不完全な」結果を提示しています。
ベクトルデータベースの文脈における「再現率(recall)」とは何ですか?
再現率は検索の精度を測定するものです。これは、特定のクエリに対してデータベースが正常に取得できた真の最近傍の割合です。98%の再現率とは、エンジンが実際に最も近い100個のベクトルのうち98個を見つけたことを意味します。
Qdrantの100億ベクトルデータセットの意義は何ですか?
この24TBのデータセットは、正確な最近傍探索の「正解(ground truth)」を事前計算済みとして含んだ、この規模では初のデータセットです。これは、異なるベクトルデータベースを相互に正確にベンチマークするための公開された公平な基盤を提供し、業界の大きな問題を解決します。
新しいベンチマークによると、どのベクトルデータベースが最適ですか?
すべてのケースにおいて「最適」なものは存在しません。テストではそれぞれ異なる強みが示されています。Elasticsearchは「おおよそ正しい」結果(精度約95%)を得るのに高速ですが、QdrantとMilvusはより高い精度(約98%)を達成可能です。中でもQdrantは、高速かつ高精度であると評価されています。

