Skip to content
research

Тайная ложь бенчмарков AI

Каждая векторная база данных заявляет, что она самая быстрая, но их бенчмарки построены на фундаменте из ошибочных данных. Новый масштабный open-source датасет раскрыл правду, заставив всю индустрию переосмыслить показатели производительности.

Aki Tanaka
Тайная ложь бенчмарков AI

Ловушка масштаба и эталонных данных (Ground-Truth)

Бенчмарки векторных баз данных часто вводят разработчиков в заблуждение, прежде всего из-за недостаточного масштаба. Тест на 1 миллионе векторов мало что говорит о реальной производительности в продакшн-среде, требующей 100 миллионов и более. Например, предыдущие бенчмарки часто использовали такие наборы данных, как dbpedia-openai-1M-angular (1 миллион векторов) или deep-image-96-angular (10 миллионов).

Такие мелкомасштабные тесты не позволяют выявить критические узкие места продакшена. Они не показывают реальных проблем с нагрузкой на память, длительным временем построения индекса или значительными задержками в «хвосте» (tail latency), которые возникают, когда данные вытесняются с диска. Вы измеряете совершенно не то, что развертываете в реальности.

Вторая главная ловушка кроется в ground truth (эталонных данных). Показатель Recall измеряет, сколько истинных ближайших соседей возвращает движок. Чтобы точно рассчитать Recall, необходимо знать точных ближайших соседей для каждого запроса, что требует полного перебора (brute-force) по каждому вектору. При 10 миллиардах векторов и 120 000 запросов это требует более квадриллиона вычислений расстояний — задача, которая ранее считалась невыполнимой.

В результате большинство бенчмарков идут на компромиссы. Они либо:

  • Вычисляют приблизительный ground truth, измеряя одну аппроксимацию относительно другой.
  • Используют синтетические, случайно сгенерированные векторы, в которых отсутствуют сложные кластерные структуры реальных эмбеддингов, что искусственно упрощает задачу поиска.

Вызов Qdrant: 10 миллиардов векторов

Qdrant решила критические проблемы масштаба и ground truth с помощью монументального релиза. Они представили FineWeb-10B, общедоступный датасет, состоящий из 10 миллиардов векторов и занимающий 24,5 терабайта. Этот датасет, созданный на основе обширного корпуса FineWeb от Hugging Face, представляет собой аутентичный веб-контент, обеспечивая беспрецедентный масштаб для надежного бенчмаркинга векторных баз данных, недостижимый при использовании меньших выборок.

Создание надежного ground truth для такого колоссального набора данных потребовало экстраординарных вычислительных мощностей. Qdrant выполнила более квадриллиона вычислений расстояний, чтобы точно определить 1000 ближайших соседей для 120 000 различных запросов. Этот метод полного перебора позволяет обойти предыдущие аппроксимации, обеспечивая точное измерение Recall, которое ранее считалось невозможным при таком беспрецедентном масштабе и глубине.

Богатая структура FineWeb-10B позволяет проводить всестороннее тестирование различных стратегий поиска для реальных приложений. Он включает как плотные (dense), так и разреженные (sparse) векторы, сгенерированные из одних и тех же документов, что позволяет уловить семантический смысл и релевантность ключевых слов. Этот дизайн с двумя типами векторов позволяет проводить реалистичное тестирование для:

  • Семантического поиска
  • Поиска по ключевым словам
  • Гибридного поиска
  • Сложных запросов с фильтрацией, которые, как известно, крайне трудно точно протестировать.

Больше никаких «черных ящиков»: мандат Open-Source

Подход Qdrant отстаивает полную прозрачность, выходя за рамки простых маркетинговых заявлений. Масштабный датасет FineWeb-10B с его 10 миллиардами векторов и 24,5 терабайтами эмбеддингов находится в свободном доступе для скачивания на Hugging Face. Это означает, что вы можете, при наличии необходимых вычислительных ресурсов, самостоятельно пересчитать точных ближайших соседей по всему корпусу, тем самым независимо проверив опубликованные результаты Qdrant. Эта открытость фундаментально превращает бенчмаркинг векторных баз данных из проприетарного «черного ящика» в проверяемое научное исследование.

В дополнение к этому беспрецедентному набору данных, Qdrant открыла исходный код всего распределенного инструментария, использованного для создания FineWeb-10B. Этот надежный фреймворк под названием Supernova работает на основе разрешительной лицензии Apache 2.0. Supernova выполняет каждый критический этап процесса бенчмаркинга:

  • Генерация эмбеддингов из необработанного текста
  • Эффективная загрузка базы данных в векторные хранилища
  • Комплексное нагрузочное тестирование и измерение производительности

Этот всеобъемлющий набор инструментов с открытым исходным кодом обеспечивает не только воспроизводимость, но и расширяемость процесса бенчмаркинга.

Важно отметить, что разработчики больше не ограничены простым воспроизведением конкретного бенчмарка Qdrant. Supernova позволяет им применять весь фреймворк к собственному проприетарному корпусу данных. Эта возможность позволяет создавать по-настоящему актуальный, кастомный бенчмарк, точно адаптированный под их конкретный сценарий использования, отражающий реальную производительность на их уникальных характеристиках данных и паттернах запросов. Для получения дополнительной технической информации о наборе данных и фреймворке читайте Internet-Scale Knowledge Retrieval: A Novel Vector Search Dataset at 10B Scale - Hugging Face.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

От таблиц лидеров к реальным компромиссам

FineWeb-10B фундаментально меняет подход к бенчмаркингу, выходя за рамки упрощенных таблиц лидеров и раскрывая сложные кривые производительности и компромиссы, присущие векторным базам данных. Имея 10 миллиардов векторов и точные эталонные данные (ground truth) до 1000 ближайших соседей, этот набор данных предоставляет беспрецедентный взгляд на то, как движки ведут себя в реальных условиях корпоративного масштаба. Цель состоит не в том, чтобы короновать одного «победителя», а в том, чтобы предложить подробную операционную карту.

Базы данных не являются универсально превосходными; их сильные стороны зависят от конкретных требований. Рассмотрим спектр: такой движок, как Elasticsearch, может обеспечить быстрый поиск с «достаточно хорошей» точностью при меньших вычислительных затратах, преуспевая в сценариях, где приемлемы приблизительные результаты. И наоборот, специализированные векторные базы данных, такие как Qdrant или Milvus, часто обеспечивают значительно более высокий recall (полноту) — извлекая больше истинных ближайших соседей — хотя, возможно, с другими профилями скорости или ресурсов, особенно по мере увеличения масштаба.

В конечном счете, глубокая ценность FineWeb-10B заключается в предоставлении инженерным командам практических, основанных на данных инсайтов. Эта прозрачность позволяет принимать обоснованные решения, адаптированные к точным потребностям приложения. Будь то проектирование системы Retrieval-Augmented Generation (RAG) с низкой задержкой, требующей 5 наиболее релевантных документов, или конвейера генерации кандидатов с высокой полнотой, требующего 1000 результатов для последующей обработки, набор данных точно определяет компромиссы между задержкой (latency) и точностью для каждого архитектурного выбора.

Часто задаваемые вопросы

Что такое набор данных FineWeb-10B?

FineWeb-10B — это массивный набор данных с открытым исходным кодом, созданный Qdrant для бенчмаркинга векторных баз данных. Он содержит 10 миллиардов векторов из реальных веб-данных, а также точные, предварительно вычисленные эталонные ответы (ground truth) для 120 000 поисковых запросов.

Почему большинство бенчмарков векторных баз данных ненадежны?

Большинство бенчмарков ненадежны из-за двух основных проблем: они используют небольшие наборы данных, которые не отражают производственный масштаб, и часто используют приблизительные или синтетические эталонные данные, поскольку вычисление точных ответов требует больших вычислительных затрат. Это приводит к вводящим в заблуждение результатам производительности.

Что такое 'ground truth' в векторном поиске?

В векторном поиске 'ground truth' относится к окончательному, идеально точному набору ближайших соседей для заданного запроса. Он устанавливается путем сравнения векторного запроса с каждым вектором во всем наборе данных без каких-либо сокращений — метод «грубой силы» (brute-force), который гарантирует правильность.

Как FineWeb-10B улучшает бенчмаркинг ИИ?

Он решает основные проблемы масштабируемости и точности. Предоставляя набор данных из 10 миллиардов векторов с проверяемыми, точными эталонными данными (ground truth) и инструментарием с открытым исходным кодом (Supernova), он позволяет разработчикам проводить реалистичные, воспроизводимые и прозрачные бенчмарки, которые отражают реальные рабочие нагрузки.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.