Мираж бенчмарков: почему каждый вендор побеждает
Выбор надежной векторной базы данных для вашего проекта часто напоминает блуждание по зеркальному лабиринту. Страница бенчмарков каждого вендора с гордостью демонстрирует их продукт на вершине, создавая противоречивую картину, которая порождает путаницу в отрасли и подрывает доверие к опубликованным показателям производительности. Это широко распространенное явление не обязательно является признаком злого умысла или преднамеренного обмана.
Скорее, оно подчеркивает чрезвычайную сложность честного бенчмаркинга векторного поиска. Точная оценка этих сложных систем требует огромных вычислительных ресурсов и тщательной методологии, что вынуждает многих вендоров идти на упрощения. Это часто приводит к неполным или «сырым» результатам, делая объективное сравнение практически невозможным для пользователей, ищущих реальные данные о производительности.
Центральным элементом этой проблемы бенчмаркинга является recall (полнота) — важнейший показатель точности. Recall точно количественно определяет, сколько истинных ближайших соседей запроса движок на самом деле извлекает из набора данных. Чтобы надежно измерить этот показатель, нужно сначала вычислить этих истинных ближайших соседей точно — а не приблизительно — установив фундаментальную «ground truth» (истину) для сравнения.
Достижение этой точной истины вычислительно непосильно для крупномасштабных развертываний. Рассмотрим набор данных из 10 миллиардов векторов, обработанный с помощью 120 000 запросов: этот сценарий требует более квадриллиона (10^15) точных вычислений расстояний. Этот астрономический вычислительный барьер объясняет, почему никто ранее не предпринимал таких исчерпывающих и точных расчетов, что порождает глубокий скептицизм в отношении заявлений вендоров и оставляет отрасль без по-настоящему надежных, независимых бенчмарков.
Квадриллион причин для скептицизма
Измерение истинной производительности векторной базы данных зависит от recall, доли фактических ближайших соседей, которую движок извлекает для данного запроса. Этот показатель представляет собой фундаментальную дилемму: чтобы точно оценить recall, нужно сначала обладать «ground truth» — точным набором ближайших соседей, вычисленным без аппроксимации. Без этого окончательного ответа любое измерение recall по своей сути является спекулятивным.
Установление этой ground truth требует огромных вычислительных мощностей. Рассмотрим набор данных из 10 миллиардов векторов, требующий 120 000 запросов; определение точных ближайших соседей требует более квадриллиона (10^15) вычислений расстояний. Этот астрономический масштаб представляет собой вычислительный барьер, который исторически делал всесторонний, непредвзятый бенчмаркинг непрактичным для подавляющего большинства.
Столь непомерные затраты напрямую препятствовали развитию в отрасли по-настоящему нейтральных, крупномасштабных наборов данных для бенчмаркинга. В результате вендоры были вынуждены создавать свои собственные, зачастую меньшие по размеру бенчмарки, невольно увековечивая цикл саморекламных заявлений о производительности. Этот исторический барьер объясняет постоянную сложность получения объективных оценок векторных баз данных.
Набор данных объемом 24 терабайта, который меняет все
Qdrant кардинально изменил ситуацию, взяв на себя вычислительно сложную задачу по установлению ground truth (эталонных данных). Ранее расчет точных ближайших соседей для 10 миллиардов векторов требовал более квадриллиона вычислений расстояний, что было непреодолимым барьером. Но Qdrant вложил значительные ресурсы, задействовав колоссальные мощности GPU для создания 24-терабайтного набора данных из 10 миллиардов векторов, который теперь находится в открытом доступе. Это монументальное усилие предоставляет первые точно вычисленные эталонные данные для векторного поиска интернет-масштаба; подробнее об этом можно узнать здесь: Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Face.
Эта новая ясность выявляет резкие различия в производительности между движками. При тестировании на части этого строгого набора данных Elasticsearch с трудом преодолел порог в 95% точности, независимо от конфигурации. Напротив, и Qdrant, и Milvus стабильно достигали 98% точности, демонстрируя свое превосходство в поиске истинных ближайших соседей.
Эти результаты подчеркивают различные операционные профили. Elasticsearch остается самым быстрым способом получить «приблизительно верный» результат, предлагая скорость для менее критичных требований к полноте поиска (recall). Однако Qdrant становится явным лидером для приложений, требующих как высокой точности, так и быстрого поиска, обеспечивая наиболее точные результаты при конкурентной скорости. Этот набор данных наконец позволяет проводить объективные сравнения «яблок с яблоками».
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Ваш план действий: как выбрать векторную БД прямо сейчас
Монументальное усилие Qdrant по вычислению ground truth для набора данных из 10 миллиардов векторов объемом 24 терабайта меняет весь ландшафт. Этот общедоступный ресурс, созданный на основе квадриллионов вычислений расстояний, наконец предлагает проверяемую базу для измерения полноты поиска (recall) — достижение, которое ранее считалось слишком дорогим и сложным. Это развитие событий перевешивает любые отдельные результаты бенчмарков.
Сохраняйте острую скептичность по отношению к заявлениям вендоров. Каждый поставщик векторных баз данных по-прежнему представляет свой продукт как лучший на собственных страницах с бенчмарками, что является естественным следствием сложности самого процесса тестирования. Вместо того чтобы полагаться на эти тщательно отобранные нарративы, вооружитесь этими новыми данными.
Используйте эти беспрецедентные инструменты для тщательного тестирования баз данных на вашей конкретной production-нагрузке. Это означает оценку производительности для ваших уникальных шаблонов запросов и характеристик данных. Цель состоит не в том, чтобы объявить единственного «победителя», а в том, чтобы досконально понять реальные компромиссы.
Учитывайте сложное взаимодействие между скоростью поиска, точностью полноты (recall accuracy) и операционными затратами для вашего приложения. Например, хотя Milvus и Qdrant могут оба достигать 98% точности, их профили скорости могут существенно различаться. Ваше взвешенное решение будет зависеть от баланса этих критических факторов для оптимального проектирования системы.
Часто задаваемые вопросы
Почему большинство бенчмарков векторных баз данных ненадежны?
Они ненадежны, потому что точное измерение метрик производительности, таких как «recall», является вычислительно затратным. Многие вендоры идут на уловки, что приводит к предвзятым, «сырым» результатам, где они выглядят лучше конкурентов.
Что такое «recall» в контексте векторной базы данных?
Recall измеряет точность поиска. Это процент истинных ближайших соседей, которые база данных успешно находит для заданного запроса. Recall 98% означает, что движок нашел 98 из 100 фактически ближайших векторов.
В чем значимость набора данных Qdrant из 10 миллиардов векторов?
Этот набор данных объемом 24 ТБ — первый в своем масштабе, включающий предварительно вычисленные «эталонные данные» (ground truth) точных ближайших соседей. Он предоставляет публичную, объективную основу для точного сравнительного анализа различных векторных баз данных, решая серьезную отраслевую проблему.
Какая векторная база данных является лучшей согласно новому бенчмарку?
Не существует единого «лучшего» решения для всех случаев. Тесты показывают разные сильные стороны: Elasticsearch быстр для получения «приблизительно верных» результатов (точность ~95%), в то время как Qdrant и Milvus могут достигать более высокой точности (~98%), при этом Qdrant отмечается как быстрое и точное решение.

