Skip to content
comparisons

Claude perdió. He aquí el porqué.

Enfrentamos al Claude Opus de mayor puntuación contra el más económico y de pesos abiertos Qwen 3.8 en una batalla de programación en el mundo real. El modelo que ganó no fue el que predecían los benchmarks.

Vera Cole
Claude perdió. He aquí el porqué.

Los benchmarks mienten. La prueba lo demuestra.

Los benchmarks a menudo tergiversan la utilidad en el mundo real. Sobre el papel, Claude Opus 5 parece superior, con una puntuación de 63 en Artificial Analysis. Su competidor, Qwen 3.8, le sigue con una puntuación de 58. Esta ventaja de cinco puntos sugiere que Claude debería ser el claro ganador en inteligencia y capacidad bruta.

Para desafiar esta suposición, ideamos una prueba rigurosa: pedir a ambos modelos que construyeran un juego completo y jugable de carrera infinita en 3D. Los parámetros fueron estrictos: un único archivo HTML, inspirado en Temple Run, usando three.js, todo a partir de un prompt idéntico y sin absolutamente ninguna instrucción de seguimiento o corrección.

Los resultados fueron drásticos. A pesar de su menor puntuación en los benchmarks, el 'más débil' Qwen 3.8 produjo un juego demostrablemente más fluido y jugable. Destacó en áreas críticas como el movimiento, la detección de colisiones y la generación procedimental de rutas, entregando una base de código mejor estructurada en general.

Claude Opus 5, aunque generó código rápidamente, produjo un juego que se sentía menos pulido y era más difícil de controlar. Esta aplicación en el mundo real expone una brecha crítica: las puntuaciones de los benchmarks, aunque indicativas de inteligencia bruta, frecuentemente fallan al predecir la utilidad práctica y la experiencia del usuario en tareas complejas y creativas.

Por qué apresurarse a programar falla

Claude Opus 5 comenzó inmediatamente a generar grandes cantidades de JavaScript para el juego de carrera infinita en 3D. Esta rápida producción creó una ilusión de progreso veloz, con la escena de three.js y los modelos de jugador tomando forma rápidamente. Al ver fluir el código, parecía que Claude estaba ganando la carrera inicial.

Qwen 3.8 adoptó una estrategia marcadamente diferente y metódica. Comenzó delineando meticulosamente los sistemas centrales del juego: el bucle del juego, el estado del jugador, la detección de colisiones y la generación procedimental. No se escribió ni una sola línea de código funcional hasta que concluyó esta fase arquitectónica integral.

La infame verbosity (verborrea) de Qwen y su tendencia a "pensar demasiado las cosas" se convirtieron en una ventaja crucial para esta tarea compleja. Este enfoque deliberado, centrado primero en la planificación, aseguró un producto final robusto y jugable, manejando el movimiento, las colisiones y el estado del juego con una ejecución superior. La velocidad bruta de Claude, en cambio, produjo un juego frágil y menos jugable.

El resultado destacó una diferencia crítica: mientras que Claude entregó un gran volumen de JavaScript rápidamente, la architectural foresight (previsión arquitectónica) inicial de Qwen produjo un juego que se sentía significativamente más fluido y era mucho más fácil de desarrollar. Este resultado práctico desafió directamente la ventaja de Claude en los benchmarks.

Costo, control y contexto

La inferencia alojada de Qwen redefine la viabilidad económica para el despliegue de IA a gran escala. Su precio, de $2 por millón de tokens de entrada y $6 por millón de tokens de salida, socava drásticamente a competidores como Claude, convirtiéndolo en la única opción realista para agentic workflows (flujos de trabajo agentes) de alto volumen. Un agente podría leer vastas bases de código, llamar al modelo repetidamente, generar tareas e inspeccionar errores, acciones donde el mayor costo por token de Claude se vuelve rápidamente prohibitivo.

Más allá de la economía, Qwen ofrece un control inigualable a través de sus open weights (pesos abiertos). Las empresas obtienen la ventaja estratégica de desplegar modelos en su propia infraestructura, garantizando la privacidad de los datos y la máxima personalización. Aunque el modelo completo Qwen 3.8 2.4T-A95B sigue fuera del alcance de la mayoría de los despliegues locales, al requerir hardware de centro de datos de múltiples nodos, la variante práctica Qwen 3.8 27B puede ejecutarse localmente en GPUs de consumo con 24GB de VRAM. Esto permite la experimentación interna y el ajuste fino, una capacidad que Claude no proporciona.

Esta libertad, sin embargo, conlleva contrapartidas claras. Qwen opera a un ritmo más lento, generando alrededor de 47-48 tokens por segundo según Artificial Analysis, lo que puede afectar las interacciones en tiempo real. Además, el modelo es notoriamente verboso, propenso a ofrecer "una pequeña historia de vida" incluso cuando se solicita una solución concisa. Si bien esta verbosidad puede ser beneficiosa para agentes autónomos complejos que requieren una comprensión contextual profunda, exige más infraestructura y una mayor tolerancia a un modelo más lento y deliberado. Esta no es una libertad sin costo; es una inversión estratégica en control por encima de la velocidad bruta y el pulido inmediato.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

Su nueva matriz de decisión de IA

Elegir el modelo de IA adecuado ahora exige una comprensión precisa de su perfil operativo, no solo de sus puntuaciones en benchmarks. La era de un modelo "mejor" universal ha terminado; en cambio, los desarrolladores deben alinear las fortalezas del modelo con los requisitos específicos del proyecto.

Para tareas de programación inmediatas, soluciones rápidas o cuando un estallido rápido de inteligencia bruta es primordial, Claude Opus 5 sigue siendo la opción superior. Su velocidad y salida pulida, derivadas de su puntuación de 63 en Artificial Analysis, aceleran el desarrollo para problemas interactivos cotidianos donde el tiempo de respuesta del prompt es crítico.

Sin embargo, para flujos de trabajo agentes sofisticados, arquitectura de sistemas complejos o cualquier proyecto sensible al presupuesto, Qwen 3.8 es la elección definitiva. Su precio de alojamiento, a $2 de entrada / $6 de salida por millón de tokens, hace que las operaciones de alto volumen sean económicamente viables, a diferencia de los costos prohibitivos de Claude. Además, el acceso a los pesos abiertos de Qwen proporciona un control y una flexibilidad inigualables para implementaciones personalizadas.

La habilidad esencial para los desarrolladores ahora es dominar estos matices y contrapartidas. El éxito depende de seleccionar la herramienta especializada para el trabajo, comprendiendo el delicado equilibrio entre velocidad, costo e implementación personalizada. Ignore este enfoque adaptativo y encontrará que sus proyectos son rápidamente superados por aquellos que aprovechan el modelo correcto para cada desafío.

Preguntas frecuentes

¿Por qué Qwen 3.8 tuvo un mejor desempeño que Claude Opus 5 en la prueba de desarrollo de juegos?

Qwen adoptó un enfoque más deliberado y centrado en la planificación para la tarea compleja, lo que resultó en un juego más cohesivo y jugable. El enfoque más rápido y centrado en el código de Claude produjo un resultado menos funcional, a pesar de su puntuación más alta en los benchmarks.

¿Cuál es la principal ventaja de un modelo de pesos abiertos como Qwen 3.8?

Las principales ventajas son el control y el costo. Los pesos abiertos permiten a los desarrolladores autoalojar y personalizar el modelo, y su precio de inferencia alojada es significativamente más barato que el de los competidores propietarios, lo que lo hace ideal para tareas de alto volumen o agentes.

¿Es Qwen 3.8 más rápido o más lento que Claude Opus 5?

Qwen 3.8 es generalmente más lento, con benchmarks de alrededor de 47-48 tokens por segundo en comparación con los ~62 tokens por segundo de Claude Opus 5. Su naturaleza verbosa también puede hacer que se sienta más lento para consultas simples.

¿Puedo ejecutar el modelo Qwen de 2.4 billones de parámetros en mi propia computadora?

No, ejecutar el modelo completo de 2.4T requiere hardware de clase centro de datos y múltiples nodos. Sin embargo, versiones más pequeñas como el modelo Qwen 3.8 27B están diseñadas para la implementación local en GPUs de grado consumidor con alrededor de 24GB de VRAM.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only