Skip to content
research

AI 벤치마크의 숨겨진 거짓말

모든 벡터 데이터베이스는 자신이 가장 빠르다고 주장하지만, 그 벤치마크는 결함이 있는 데이터를 기반으로 합니다. 최근 공개된 방대한 오픈 소스 데이터셋이 진실을 폭로하며 업계 전체가 성능을 재고하게 만들었습니다.

Aki Tanaka
AI 벤치마크의 숨겨진 거짓말

규모와 정답(Ground-Truth)의 함정

벡터 데이터베이스 벤치마크는 주로 규모 부족으로 인해 개발자를 오도하는 경우가 많습니다. 100만 개의 벡터를 대상으로 한 테스트는 1억 개 이상을 요구하는 프로덕션 환경에서의 실제 성능을 거의 보여주지 못합니다. 예를 들어, 이전 벤치마크는 종종 dbpedia-openai-1M-angular(100만 벡터)나 deep-image-96-angular(1,000만 벡터)와 같은 데이터셋을 사용했습니다.

이러한 소규모 테스트는 중요한 프로덕션 병목 현상을 유발하지 못합니다. 이는 메모리 압박(memory pressure), 긴 인덱스 구축 시간(index build times), 또는 데이터가 디스크에서 페이지 아웃될 때 발생하는 심각한 테일 레이턴시(tail latency)와 같은 실제 문제를 드러내지 못합니다. 즉, 배포 환경과는 완전히 다른 설정을 측정하고 있는 것입니다.

두 번째 주요 함정은 정답(ground truth)에 있습니다. 재현율(Recall)은 엔진이 얼마나 많은 실제 최근접 이웃을 반환하는지를 측정합니다. 재현율을 정확하게 계산하려면 모든 쿼리에 대한 정확한 최근접 이웃을 알아야 하며, 이를 위해서는 모든 벡터에 대한 무차별 대입(brute-force) 비교가 필요합니다. 100억 개의 벡터와 12만 개의 쿼리 환경에서는 1,000조 번 이상의 거리 계산이 필요하며, 이는 이전에는 불가능하다고 여겨졌던 작업입니다.

결과적으로 대부분의 벤치마크는 타협합니다. 다음 중 하나를 선택합니다:

  • 근사치 정답을 계산하여, 하나의 근사치를 다른 근사치와 비교 측정합니다.
  • 실제 세계의 임베딩이 가진 복잡한 클러스터링 구조가 결여된, 무작위로 생성된 합성 벡터를 사용하여 검색 문제를 인위적으로 단순화합니다.

Qdrant의 100억 벡터 도전

Qdrant는 기념비적인 릴리스를 통해 규모와 정답에 대한 핵심 문제를 해결했습니다. 그들은 100억 개의 벡터로 구성되고 24.5테라바이트에 달하는 공개 데이터셋인 FineWeb-10B를 도입했습니다. Hugging Face의 방대한 FineWeb 코퍼스에서 추출된 이 데이터셋은 실제 웹 콘텐츠를 나타내며, 더 작은 샘플로는 달성할 수 없는 강력한 벡터 데이터베이스 벤치마킹을 위한 독보적인 규모를 제공합니다.

이처럼 거대한 데이터셋에 대한 신뢰할 수 있는 정답을 확립하려면 엄청난 컴퓨팅 파워가 필요했습니다. Qdrant는 12만 개의 개별 쿼리에 대해 상위 1,000개의 최근접 이웃을 정확하게 식별하기 위해 1,000조 번 이상의 거리 계산을 수행했습니다. 이 무차별 대입 방식은 이전의 근사치를 우회하여, 이 전례 없는 규모와 깊이에서 이전에는 불가능하다고 여겨졌던 정확한 재현율 측정을 제공합니다.

FineWeb-10B의 풍부한 구성은 실제 애플리케이션을 위한 다양한 검색 전략의 포괄적인 테스트를 가능하게 합니다. 동일한 문서에서 생성된 밀집(dense) 및 희소(sparse) 벡터를 모두 포함하여 의미론적 의미와 키워드 관련성을 모두 포착합니다. 이러한 이중 벡터 설계는 다음 항목에 대한 현실적인 벤치마킹을 가능하게 합니다:

  • 의미론적 검색(Semantic search)
  • 키워드 검색(Keyword search)
  • 하이브리드 검색(Hybrid retrieval)
  • 정확하게 벤치마킹하기 어렵기로 악명 높은 복잡한 필터링 쿼리

더 이상 블랙박스는 없다: 오픈 소스의 의무

Qdrant의 접근 방식은 단순한 마케팅 주장을 넘어 완전한 투명성을 옹호합니다. 100억 개의 벡터와 24.5테라바이트의 임베딩을 포함하는 방대한 FineWeb-10B 데이터셋은 Hugging Face에서 무료로 다운로드할 수 있습니다. 이는 필요한 컴퓨팅 자원이 있다면 전체 코퍼스에 걸쳐 정확한 최근접 이웃을 직접 재계산하여 Qdrant가 발표한 결과를 독립적으로 검증할 수 있음을 의미합니다. 이러한 개방성은 벡터 데이터베이스 벤치마킹을 독점적인 블랙박스에서 검증 가능한 과학적 노력으로 근본적으로 변화시킵니다.

이 전례 없는 데이터셋을 보완하기 위해 Qdrant는 FineWeb-10B를 구축하는 데 사용된 전체 분산 툴체인을 오픈 소스로 공개했습니다. Supernova라는 이름의 이 강력한 프레임워크는 허용적인 Apache 2.0 라이선스 하에 운영됩니다. Supernova는 벤치마킹 프로세스의 모든 중요한 단계를 처리합니다:

  • 원시 텍스트로부터 임베딩 생성
  • 벡터 저장소로의 효율적인 데이터베이스 로딩
  • 포괄적인 부하 테스트 및 성능 측정

이 포괄적인 오픈 소스 제품군은 벤치마크 프로세스의 재현성뿐만 아니라 확장성까지 보장합니다.

중요한 점은 개발자가 더 이상 Qdrant의 특정 벤치마크를 재현하는 데만 국한되지 않는다는 것입니다. Supernova를 사용하면 개발자는 전체 프레임워크를 자신의 독점 데이터 코퍼스에 적용할 수 있습니다. 이러한 기능을 통해 특정 사용 사례에 정확히 맞춘 진정으로 관련성 높은 맞춤형 벤치마크를 생성할 수 있으며, 고유한 데이터 특성과 쿼리 패턴에 대한 실제 성능을 반영할 수 있습니다. 데이터셋 및 프레임워크에 대한 추가적인 기술적 통찰력을 얻으려면 Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Face를 읽어보십시오.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

리더보드에서 실제 트레이드오프까지

FineWeb-10B는 벤치마킹의 서사를 근본적으로 변화시켜, 단순한 리더보드를 넘어 벡터 데이터베이스에 내재된 복잡한 성능 곡선과 트레이드오프를 드러냅니다. 100억 개의 벡터와 상위 1000개 근접 이웃까지의 정확한 그라운드 트루스(ground truth)를 갖춘 이 데이터셋은 실제 엔터프라이즈 규모의 조건에서 엔진이 어떻게 작동하는지에 대한 독보적인 시각을 제공합니다. 목표는 단일 '승자'를 가리는 것이 아니라 상세한 운영 지도를 제공하는 것입니다.

데이터베이스가 모든 면에서 우월한 것은 아니며, 강점은 특정 요구 사항에 따라 달라집니다. 스펙트럼을 고려해 보십시오. Elasticsearch와 같은 엔진은 더 낮은 계산 비용으로 '충분히 좋은' 정확도를 위해 빠른 검색을 제공할 수 있으며, 근사치 결과가 허용되는 시나리오에서 탁월합니다. 반면, Qdrant나 Milvus와 같이 목적에 맞게 구축된 벡터 데이터베이스는 종종 훨씬 더 높은 재현율(recall)을 제공하여 더 많은 실제 근접 이웃을 검색하지만, 특히 규모가 커짐에 따라 속도나 리소스 프로필이 다를 수 있습니다.

궁극적으로 FineWeb-10B의 심오한 가치는 엔지니어링 팀에게 실행 가능하고 데이터 기반의 통찰력을 제공하는 데 있습니다. 이러한 투명성은 정확한 애플리케이션 요구 사항에 맞춘 정보에 입각한 의사 결정을 가능하게 합니다. 상위 5개의 가장 관련성 높은 문서가 필요한 저지연 RAG(Retrieval-Augmented Generation) 시스템을 설계하든, 후속 처리를 위해 상위 1000개의 결과가 필요한 고재현율 후보 생성 파이프라인을 설계하든, 이 데이터셋은 각 아키텍처 선택에 대한 지연 시간(latency) 및 정확도 트레이드오프를 정확하게 구분합니다.

자주 묻는 질문

FineWeb-10B 데이터셋이란 무엇인가요?

FineWeb-10B는 벡터 데이터베이스 벤치마킹을 위해 Qdrant에서 만든 대규모 오픈 소스 데이터셋입니다. 이 데이터셋은 실제 웹 데이터에서 추출한 100억 개의 벡터와 12만 개의 검색 쿼리에 대해 미리 계산된 정확한 '그라운드 트루스' 답변을 포함하고 있습니다.

대부분의 벡터 데이터베이스 벤치마크가 신뢰할 수 없는 이유는 무엇인가요?

대부분의 벤치마크는 두 가지 주요 문제로 인해 신뢰할 수 없습니다. 첫째, 프로덕션 규모를 반영하지 못하는 작은 데이터셋을 사용하며, 둘째, 정확한 답변을 계산하는 데 비용이 많이 들기 때문에 근사치나 합성된 '그라운드 트루스'를 사용하는 경우가 많습니다. 이는 오해의 소지가 있는 성능 결과를 초래합니다.

벡터 검색에서 '그라운드 트루스(ground truth)'란 무엇인가요?

벡터 검색에서 'ground truth'는 주어진 쿼리에 대해 가장 정확하고 완벽한 최근접 이웃 집합을 의미합니다. 이는 지름길 없이 전체 데이터셋의 모든 벡터와 쿼리 벡터를 비교하는 브루트 포스(brute-force) 방식을 통해 확립되며, 결과의 정확성을 보장합니다.

FineWeb-10B는 AI 벤치마킹을 어떻게 개선하나요?

규모와 정확성이라는 핵심 문제를 해결합니다. 검증 가능하고 정확한 ground truth를 포함한 100억 개의 벡터 데이터셋과 오픈 소스 툴체인(Supernova)을 제공함으로써, 개발자가 실제 프로덕션 워크로드를 반영하는 현실적이고 재현 가능하며 투명한 벤치마크를 실행할 수 있도록 지원합니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.