Skip to content
research

Эта 125B AI-модель оставила облачные решения далеко позади

Настольный ПК, по-видимому, обгоняет облачный ИИ с ошеломляющим отрывом, но бенчмарк скрывает компромиссы, которые могут изменить значение этих цифр. Вот хитроумная инженерия, стоящая за этим результатом, и то, что нужно для его воспроизведения.

Aki Tanaka
Эта 125B AI-модель оставила облачные решения далеко позади

У результата в 6,6 секунды есть свои нюансы

Strata запустила 125-миллиардную параметрическую модель Qwen 3.8 Flash-Next локально, выполнив запрос с длинным ответом за 6,6 секунды. Тот же тест, запущенный через облачный сервис OpenRouter, занял 33 секунды. Это 5-кратное преимущество в скорости при локальном запуске также проявилось в задачах по программированию и творческому письму.

Создатель Niko1221 отметил различную производительность в разных бенчмарках. Например, короткая логическая задача привела к почти ничейному результату: 1,4 секунды локально против 1,5 секунды в облаке. Результаты последовательно менялись в зависимости от сложности задачи и длины ответа, подчеркивая адаптивное поведение модели.

Важно отметить, что несколько оговорок смягчают прямое сравнение. Локальная модель использовала 2-битную квантованную версию, которая по своей сути меньше и быстрее, чем полноточный вариант. Конфигурации облачного оборудования и нагрузка провайдера были неконтролируемыми переменными, что потенциально искажало результаты. Кроме того, локальная установка использовала GPU RTX 5090 с 32 ГБ видеопамяти — высококлассный компонент, значительно превосходящий возможности типичного потребительского оборудования.

Эти факторы позволяют предположить, что впечатляющее ускорение зависит от конкретных условий. Инновационный подход Strata к распределенной обработке между GPU, CPU, RAM и SSD, безусловно, позволяет локально запускать массивные модели, но сравнение с облачными сервисами остается сложным.

Как модель 125B помещается на настольном ПК

Достижение локального вывода с моделью на 125 миллиардов параметров, такой как Qwen 3.8 Flash-Next, может показаться невозможным, учитывая, что даже топовый GPU, такой как RTX 5090, имеет всего 32 ГБ видеопамяти. Секрет кроется в архитектуре Mixture-of-Experts (MoE), которую Strata использует весьма изобретательно. Хотя общая модель имеет 125 млрд параметров, для любого заданного токена активны только около 6 миллиардов, при этом небольшое подмножество экспертов выбирается динамически.

Strata интеллектуально распределяет рабочую нагрузку между ресурсами вашего ПК. Общие компоненты модели и часто используемые эксперты размещаются в видеопамяти GPU. Однако все 24 576 экспертов хранятся в оперативной памяти системы, что обеспечивает быстрый доступ к ним.

Таблица поиска объемом примерно 29 ГБ остается на SSD. Strata превентивно извлекает необходимые небольшие строки, устраняя узкие места ввода-вывода и обеспечивая плавную работу. Эта многоуровневая стратегия памяти позволяет запускать по-настоящему массивную модель на потребительском оборудовании.

Настройка в видео подчеркивает необходимое оборудование:

  • RTX 5090 с 32 ГБ видеопамяти
  • Процессор Core Ultra 9 285K
  • 62 ГБ оперативной памяти
  • Около 80 ГБ свободного места на диске для установки.

Эта конфигурация доказывает, что с оптимизированным программным обеспечением, таким как Strata, высокопроизводительный локальный вывод ИИ становится все более доступным.

«Дверной звонок» позволяет CPU и GPU работать сообща

Основная инновация Strata заключается в продуманной оркестровке гетерогенного оборудования. GPU, определив десять экспертов, необходимых для данного слоя, сигнализирует об их ID через сегмент общей памяти, метко названный «дверным звонком» (doorbell). Это уведомление позволяет CPU одновременно начать обработку в оперативной памяти системы.

В отличие от простого выгрузки целых слоев, Strata динамически назначает доступных экспертов на GPU и направляет любые промахи кэша непосредственно на CPU. Это позволяет обоим процессорам работать параллельно над одним и тем же слоем, устраняя время простоя, обычно связанное с перемещением данных, и обеспечивая непрерывные вычисления.

Для дальнейшего ускорения процесса Strata интегрирует speculative decoding (спекулятивное декодирование). Небольшая эффективная вспомогательная модель предлагает несколько потенциальных следующих токенов, которые основная модель Qwen 3.8 Flash-Next затем проверяет одним пакетом. Этот подход обеспечил заявленное ускорение в 1,6–1,8 раза в тестах, при этом основная модель соглашалась с предложениями вспомогательной примерно в 79% случаев, не изменяя итоговый результат.

Этот унифицированный подход, использующий GPU VRAM для активных экспертов, системную оперативную память для полного набора экспертов и даже NVMe SSD для массивной таблицы поиска, максимизирует пропускную способность. Для получения более подробной технической информации об этом проекте с открытым исходным кодом вы можете посетить GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware. Strata эффективно превращает настольный ПК в мощный распределенный движок для инференса.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Быстрый инференс — это не то же самое, что бесплатное обновление

Локальный инференс предлагает убедительные преимущества, однако результаты скорости Strata не являются универсальной гарантией качества или производительности модели. 2-битная локальная квантованная версия Qwen 3.8 Flash-Next показала хорошие результаты в специфических тестах из видео, однако это не доказывает паритет с облачной моделью, потенциально работающей с более высокой точностью. Точность часто влияет на нюансы рассуждений и фактическую достоверность.

Strata также требует значительных системных ресурсов. Модель 125B может потреблять почти всю доступную VRAM (например, 32 ГБ на RTX 5090) и значительную часть системной оперативной памяти (до 39 ГБ в видео). Первая загрузка модели может «заморозить» ПК на несколько минут, а более длинные чаты или другие промпты могут изменить пропускную способность, как было отмечено в самом видео.

Эти впечатляющие бенчмарки зависят от конкретной системы. Например, ускорение в 3–5 раз, показанное в видео на RTX 5090, нельзя напрямую сравнивать с конфигурацией, имеющей 12 ГБ VRAM или меньший объем системной оперативной памяти.

В конечном счете, локальный инференс обеспечивает конфиденциальность, контроль со стороны пользователя и низкие предельные затраты на электроэнергию. Облачные сервисы, напротив, позволяют избежать первоначальных инвестиций в высокопроизводительные GPU и могут обеспечить более высокую точность и стабильный доступ к мощным моделям. Результаты Strata — это убедительная демонстрация того, что возможно сделать с помощью оптимизированного программного и аппаратного обеспечения, а не бесплатное обновление для каждого пользователя.

Часто задаваемые вопросы

Что такое Strata?

Strata — это движок для инференса с открытым исходным кодом, предназначенный для локального запуска Qwen 3.8 Flash-Next путем распределения нагрузки между GPU, CPU, системной оперативной памятью и SSD.

Как локальная модель обошла облачную в видео?

На ПК автора с RTX 5090 Strata выполнила длинный ответ за 6,6 секунды против 33 секунд при облачном запуске. Результаты зависят от промптов, оборудования, нагрузки на провайдера и настроек.

Какой ПК нужен для запуска Strata?

В видео сообщается о минимуме в 12 ГБ VRAM, 32 ГБ системной оперативной памяти и около 80 ГБ свободного места на диске. Больший объем памяти и быстрый SSD могут помочь; использованная модель потребляла значительный объем оперативной памяти и VRAM.

Является ли Strata быстрее облачного ИИ для любой задачи?

Нет. Тест на логическую задачу в видео закончился фактически вничью, а производительность облака варьируется. Локальный результат также был получен с использованием 2-битной квантованной модели, поэтому сравнение скорости не подтверждает равенство в точности.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.