El asesino de benchmarks que no puede ver un cubo
DeepSeek V4.1 flash irrumpió en escena el 10 de septiembre de 2026, un modelo multimodal de Mixture-of-Experts (MoE) que cuenta con una estructura de 552B y una asombrosa ventana de contexto de 1M de tokens. Con 8B de parámetros activos para entrada y 16B para salida, este retador con licencia MIT, con un precio competitivo de $0.003 por millón de tokens de entrada en caché, no era solo un participante más. Declaró la guerra a los campeones reinantes, superando supuestamente a GPT-5.6 Sol de OpenAI y a Claude Opus-5.0 de Anthropic en benchmarks agenticos críticos, listo para redefinir la codificación, el razonamiento y la comprensión visual agentica.
Luego llegó Matthew Berman, armado con un cubo de Rubik simulado y el arnés de Codex. Su prueba viral tenía como objetivo validar el anunciado razonamiento visual y espacial de DeepSeek V4.1 flash. La tarea era simple: resolver el cubo, una implicación profunda para un modelo que afirma tener "comprensión nativa de imágenes" e inteligencia superior.
Lo que se desarrolló no fue una demostración de IA avanzada, sino un colapso espectacular. DeepSeek V4.1 flash no solo falló al resolver el cubo de Rubik; ni siquiera pudo comprender su naturaleza fundamental. El video de Berman mostró cada cuadrado flotando de forma independiente, desconectado del conjunto, con colores cambiando inexplicablemente sin ningún movimiento físico. El modelo, a pesar de esta muestra de "trampa" de realidad mutable, permaneció totalmente desconcertado, incapaz de percibir un objeto sólido o sus relaciones espaciales inherentes.
Cuando la 'Comprensión Visual' no es suficiente
DeepSeek V4.1 flash, promocionado por su "comprensión nativa de imágenes" y su contexto de 1M de tokens, acaba de estrellarse espectacularmente con un simple cubo de Rubik. El video de Matthew Berman "DeepSeek Fails the Rubik’s Cube Test" expuso brutalmente una desconexión crítica: el modelo no puede comprender objetos 3D dinámicos. Esto no es solo un error; es una brecha fundamental en sus alardeadas capacidades visuales.
Ejecutándose en el arnés de Codex, el modelo V4.1 flash tergiversó totalmente el cubo. Los cuadrados "flotaban independientemente" en lugar de conectarse, y los lados cambiaban de color sin rotación física. El sistema "hizo trampa" alterando los colores directamente, pero aun así no logró resolver el rompecabezas, demostrando una profunda incapacidad para mantener un modelo espacial coherente y persistente.
Reconocer un objeto estático, como "esto es un cubo", es una cosa; manipular su física en un entorno dinámico exige una arquitectura cognitiva completamente diferente. Esto requiere una representación interna persistente de las relaciones, la gravedad y el movimiento. El rendimiento de DeepSeek V4.1 flash sugiere que carece de este crucial razonamiento 3D, reduciendo interacciones complejas a eventos visuales desconectados.
Esto no es una anomalía para DeepSeek. Iteraciones anteriores también han tenido dificultades con la representación espacial intrincada y el movimiento preciso de ejes en otras pruebas. El fallo del cubo de Rubik subraya un talón de Aquiles recurrente, lo que sugiere que las impresionantes puntuaciones de los benchmarks de DeepSeek podrían ocultar un problema más profundo y no resuelto en su comprensión fundamental del espacio físico.
El cubo de Rubik: Un suero de la verdad para la IA
Los cubos de Rubik han servido durante mucho tiempo como la prueba de fuego definitiva de la IA, un desafío engañosamente simple que exige una inteligencia profunda. DeepCubeA de Google DeepMind, por ejemplo, resolvió famosamente el cubo en un promedio de 20 movimientos en 2019, demostrando que la IA especializada puede dominar esta tarea. Este no es un problema novedoso para la IA; es uno ya resuelto.
Más allá de la simple resolución de rompecabezas, el cubo mide de forma crítica la capacidad de un modelo en:
- Razonamiento espacial: comprensión de la manipulación de objetos en 3D.
- Mantenimiento de estado: seguimiento de la configuración siempre cambiante del cubo.
- Planificación lógica: elaboración de estrategias para soluciones de múltiples pasos.
Requiere interiorizar las reglas físicas de un objeto, no solo reconocer píxeles o patrones.
DeepSeek V4.1 flash, un modelo que cuenta con 1M de contexto y victorias competitivas contra GPT-5.6 Sol de OpenAI y Claude Opus-5.0 de Anthropic en benchmarks de agentes, se desmoronó bajo este escrutinio básico. Su fallo observado —donde los cuadrados flotaban de forma independiente y los colores cambiaban sin movimiento— expone una desconexión profunda en su "comprensión nativa de imágenes". El cubo de Rubik actúa como un suero de la verdad implacable, eliminando la bravuconería de los benchmarks para revelar la verdadera comprensión de un modelo sobre el mundo físico. Para más información sobre sus modelos avanzados, consulte DeepSeek | Into the Unknown.
¿Te está gustando? Recibe uno así en tu bandeja cada mañana.
un correo al día · date de baja en dos clics · sin rastreadores de terceros
Más allá de los benchmarks: La búsqueda de la fundamentación física
Los benchmarks, incluso los de agentes avanzados como DeepSWE v1.1 o CyberGym, a menudo pasan por alto puntos ciegos críticos. Se informa que DeepSeek V4.1 flash supera a GPT-5.6 Sol y Claude Opus-5.0 en estos, pero falla en un cubo de Rubik simulado, lo que demuestra una profunda desconexión entre el rendimiento en tareas abstractas y la realidad física fundamental. Los cuadrados del modelo flotaban de forma independiente, los colores cambiaban sin movimiento: una clara alucinación de la física, no solo un fallo al resolverlo.
Esto resalta el inmenso desafío de la fundamentación física. Un modelo puede poseer un vasto conocimiento abstracto y una "comprensión nativa de imágenes", pero sin un modelo interno coherente de causa y efecto en un espacio 3D, su inteligencia sigue siendo frágil. DeepSeek V4.1 flash, a pesar de su contexto de 1M de tokens y sus capacidades multimodales, no pudo conectar su entrada visual con las reglas concretas y persistentes de un objeto simple.
Para que la IA avance realmente más allá del texto y las imágenes estáticas hacia la robótica, simulaciones complejas y tareas de agentes en el mundo real, esta brecha debe cerrarse. Los modelos requieren una comprensión persistente y robusta del mundo físico que habitan, no solo una interpretación superficial de los píxeles. Hasta entonces, incluso los modelos que superan los benchmarks seguirán colapsando cuando se enfrenten a las verdades más simples de nuestro universo.
Preguntas frecuentes
¿Qué modelo se probó en el video?
El video prueba el modelo DeepSeek V4.1 Flash, un potente modelo multimodal de Mezcla de Expertos (MoE) lanzado en septiembre de 2026, utilizando el arnés Codex de OpenAI.
¿Por qué el modelo DeepSeek falló en la prueba del cubo de Rubik?
El modelo falló porque no pudo mantener un modelo 3D coherente del cubo de Rubik. Los cuadrados parecían flotar de forma independiente y cambiar de color sin movimiento, lo que indica una falta fundamental de comprensión espacial y física.
¿Ha resuelto alguna vez una IA un cubo de Rubik antes?
Sí. En 2019, DeepCubeA de UC Irvine, una IA de aprendizaje por refuerzo profundo, pudo resolverlo en una fracción de segundo. Esto resalta una brecha entre la IA especializada y el razonamiento de propósito general de los grandes modelos multimodales.
¿Qué revela este fallo sobre los benchmarks actuales de IA?
Sugiere que los benchmarks estándar de agentes y razonamiento pueden no evaluar adecuadamente la fundamentación física y la comprensión espacial dinámica, permitiendo que modelos con puntuaciones altas sigan teniendo puntos ciegos críticos.

