Убийца бенчмарков, который не видит кубик
DeepSeek V4.1 flash ворвалась на сцену 10 сентября 2026 года — это мультимодальная модель Mixture-of-Experts (MoE) с основой 552B и ошеломляющим контекстным окном в 1 млн токенов. Обладая 8 млрд активных параметров для ввода и 16 млрд для вывода, этот претендент с лицензией MIT и конкурентоспособной ценой в $0,003 за миллион кэшированных входных токенов был не просто очередным новичком. Он объявил войну действующим чемпионам, по сообщениям, превзойдя GPT-5.6 Sol от OpenAI и Claude Opus-5.0 от Anthropic в критических агентных тестах, готовясь переосмыслить агентное программирование, рассуждение и визуальное понимание.
Затем появился Мэтью Берман, вооружившись симуляцией кубика Рубика и инструментарием Codex. Его вирусный тест был направлен на проверку разрекламированного визуального и пространственного мышления DeepSeek V4.1 flash. Задача была простой: собрать кубик, что имело огромное значение для модели, претендующей на «нативное понимание изображений» и превосходный интеллект.
То, что произошло, было не демонстрацией продвинутого ИИ, а впечатляющим провалом. DeepSeek V4.1 flash не просто не смогла собрать кубик Рубика; она даже не смогла осознать его фундаментальную природу. Видео Бермана показало, что каждый квадратик «плавает» независимо, не будучи связанным с целым, а цвета необъяснимым образом меняются без какого-либо физического движения. Модель, несмотря на это «жульническое» проявление изменчивой реальности, оставалась в полном недоумении, не в силах воспринять твердый объект или его внутренние пространственные отношения.
Когда «визуального понимания» недостаточно
DeepSeek V4.1 flash, разрекламированная за свое «нативное понимание изображений» и контекстное окно в 1 млн токенов, только что с треском провалилась на простом кубике Рубика. Видео Мэтью Бермана «DeepSeek проваливает тест с кубиком Рубика» жестоко обнажило критический разрыв: модель не может понять динамические 3D-объекты. Это не просто баг; это фундаментальный пробел в ее хваленых визуальных возможностях.
Работая на базе Codex, модель V4.1 flash совершенно неверно представила кубик. Квадраты «плавали независимо», а не соединялись, а стороны меняли цвет без физического вращения. Система «жульничала», меняя цвета напрямую, но все равно не смогла решить головоломку, продемонстрировав глубокую неспособность поддерживать связную, устойчивую пространственную модель.
Распознать статический объект, например «это кубик», — одно дело; манипулирование его физикой в динамической среде требует совершенно другой когнитивной архитектуры. Это требует устойчивого внутреннего представления отношений, гравитации и движения. Производительность DeepSeek V4.1 flash предполагает, что ей не хватает этого важнейшего 3D-мышления, сводя сложные взаимодействия к разрозненным визуальным событиям.
Это не аномалия для DeepSeek. Предыдущие итерации также испытывали трудности со сложным пространственным рендерингом и точным движением по осям в других тестах. Провал с кубиком Рубика подчеркивает повторяющуюся «ахиллесову пяту», предполагая, что впечатляющие результаты DeepSeek в тестах могут скрывать более глубокую, нерешенную проблему в ее фундаментальном понимании физического пространства.
Кубик Рубика: лакмусовая бумажка для ИИ
Кубики Рубика долгое время служили для ИИ высшей лакмусовой бумажкой — обманчиво простой задачей, требующей глубокого интеллекта. Например, DeepCubeA от Google DeepMind в 2019 году собрал кубик в среднем за 20 ходов, доказав, что специализированный ИИ может освоить эту задачу. Это не новая проблема для ИИ; она уже решена.
Помимо простого решения головоломок, кубик критически оценивает способности модели в следующих областях:
- Пространственное мышление: понимание манипуляций с 3D-объектами.
- Поддержание состояния: отслеживание постоянно меняющейся конфигурации кубика.
- Логическое планирование: разработка многошаговых стратегий решения.
Это требует усвоения физических правил объекта, а не просто распознавания пикселей или паттернов.
DeepSeek V4.1 flash, модель с контекстным окном 1 млн токенов и конкурентными победами над OpenAI GPT-5.6 Sol и Anthropic Claude Opus-5.0 в агентских бенчмарках, не справилась с этой базовой проверкой. Наблюдаемый сбой, при котором квадраты плавали независимо, а цвета менялись без движения, обнажает глубокий разрыв в её «нативном понимании изображений». Кубик Рубика выступает в роли беспощадной сыворотки правды, отбрасывая браваду бенчмарков и выявляя истинное понимание физического мира моделью. Подробнее об их передовых моделях см. DeepSeek | Into the Unknown.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
За пределами бенчмарков: поиск физического обоснования
Бенчмарки, даже продвинутые агентские, такие как DeepSWE v1.1 или CyberGym, часто упускают критические «слепые зоны». DeepSeek V4.1 flash, как сообщается, превосходит GPT-5.6 Sol и Claude Opus-5.0 в этих тестах, но проваливается на симуляции кубика Рубика, демонстрируя глубокий разрыв между выполнением абстрактных задач и фундаментальной физической реальностью. Квадраты модели плавали независимо, цвета менялись без движения – явная галлюцинация физики, а не просто неспособность решить задачу.
Это подчеркивает огромную проблему физического обоснования (physical grounding). Модель может обладать обширными абстрактными знаниями и «нативным пониманием изображений», но без связной внутренней модели причинно-следственных связей в 3D-пространстве её интеллект остается хрупким. DeepSeek V4.1 flash, несмотря на контекст 1 млн токенов и мультимодальные возможности, не смогла связать свои визуальные входные данные с конкретными, постоянными правилами простого объекта.
Чтобы ИИ мог по-настоящему выйти за рамки текста и статических изображений в робототехнику, сложные симуляции и реальные агентские задачи, этот разрыв должен быть преодолен. Моделям требуется надежное, постоянное понимание физического мира, в котором они существуют, а не просто поверхностная интерпретация пикселей. До тех пор даже «убийцы бенчмарков» будут терпеть крах при столкновении с простейшими истинами нашей вселенной.
Часто задаваемые вопросы
Какая модель тестировалась в видео?
В видео тестируется модель DeepSeek V4.1 Flash, мощная мультимодальная модель Mixture-of-Experts (MoE), выпущенная в сентябре 2026 года, с использованием инструментария Codex от OpenAI.
Почему модель DeepSeek провалила тест с кубиком Рубика?
Модель провалилась, потому что не смогла поддерживать связную 3D-модель кубика Рубика. Квадраты казались плавающими независимо и меняли цвет без движения, что указывает на фундаментальное отсутствие пространственного и физического понимания.
Решал ли когда-нибудь ИИ кубик Рубика раньше?
Да. В 2019 году DeepCubeA из Калифорнийского университета в Ирвайне, ИИ на основе глубокого обучения с подкреплением, мог решить его за доли секунды. Это подчеркивает разрыв между специализированным ИИ и общими способностями к рассуждению больших мультимодальных моделей.
Что этот провал говорит о текущих бенчмарках ИИ?
Это предполагает, что стандартные агентские бенчмарки и тесты на рассуждение могут неадекватно проверять физическое обоснование и динамическое пространственное понимание, позволяя моделям с высокими баллами сохранять критические «слепые зоны».

