El resultado de 6.6 segundos tiene truco
Strata ejecutó un modelo Qwen 3.8 Flash-Next de 125 mil millones de parámetros de forma local, completando un prompt de respuesta larga en 6.6 segundos. La misma prueba, ejecutada a través del servicio en la nube de OpenRouter, tomó 33 segundos. Esta ventaja de velocidad local de 5x también apareció en tareas de programación y escritura creativa.
El creador Niko1221 observó un rendimiento variable en los benchmarks. Un acertijo lógico corto, por ejemplo, resultó en un empate técnico: 1.4 segundos localmente frente a 1.5 segundos en la nube. Los resultados cambiaron constantemente según la complejidad de la tarea y la longitud de la respuesta, destacando el comportamiento adaptativo del modelo.
Fundamentalmente, varias advertencias moderan la comparación directa. El modelo local utilizó una versión cuantizada de 2-bit, inherentemente más pequeña y rápida que una variante de precisión completa. Las configuraciones de hardware en la nube y la carga del proveedor fueron variables no controladas, lo que podría sesgar los resultados. Además, la configuración local aprovechó una GPU RTX 5090 con 32 GB de VRAM, un componente de gama alta que supera con creces las capacidades típicas del hardware de consumo.
Estos factores sugieren que la impresionante aceleración depende de condiciones específicas. El enfoque innovador de Strata para el procesamiento distribuido entre GPU, CPU, RAM y SSD ciertamente permite la ejecución local de modelos masivos, pero la comparación con los servicios en la nube sigue siendo compleja.
Cómo un modelo de 125B cabe en una computadora de escritorio
Lograr una inferencia local con un modelo de 125 mil millones de parámetros como Qwen 3.8 Flash-Next podría parecer imposible, dado que incluso una GPU de primer nivel como una RTX 5090 solo tiene 32 GB de VRAM. El secreto reside en la arquitectura Mixture-of-Experts (MoE) del modelo, que Strata aprovecha ingeniosamente. Aunque el modelo total es de 125B de parámetros, solo unos 6 mil millones están activos para cualquier token dado, con un pequeño subconjunto de expertos seleccionados dinámicamente.
Strata distribuye inteligentemente la carga de trabajo entre los recursos de su PC. Los componentes compartidos del modelo y los expertos a los que se accede con frecuencia residen en la VRAM de la GPU. Sin embargo, los 24,576 expertos se almacenan en la RAM del sistema, lo que permite un acceso rápido.
Una tabla de búsqueda de aproximadamente 29 GB permanece en el SSD. Strata busca preventivamente las filas pequeñas y necesarias, eliminando los cuellos de botella de E/S y asegurando un funcionamiento fluido. Esta estrategia de memoria por niveles permite que un modelo verdaderamente masivo se ejecute en hardware de consumo.
La configuración del video destaca el hardware requerido:
- Una RTX 5090 con 32 GB VRAM
- Un procesador Core Ultra 9 285K
- 62 GB RAM
- Aproximadamente 80 GB de espacio libre en disco para la instalación.
Esta configuración demuestra que con software optimizado como Strata, la inferencia de IA local de alto rendimiento es cada vez más accesible.
El 'timbre' permite que la CPU y la GPU trabajen en equipo
La innovación central de Strata radica en su inteligente orquestación de hardware heterogéneo. La GPU, después de identificar los diez expertos necesarios para una capa determinada, señala sus ID a través de un segmento de memoria compartida, acertadamente llamado 'timbre'. Esta notificación permite que la CPU comience a procesar simultáneamente en la RAM del sistema.
A diferencia de simplemente descargar capas completas, Strata asigna dinámicamente los expertos disponibles a la GPU y envía cualquier fallo de caché directamente a la CPU. Esto permite que ambos procesadores trabajen en paralelo en la misma capa, eliminando el tiempo de inactividad típicamente asociado con el movimiento de datos y asegurando una computación continua.
Para acelerar aún más el proceso, Strata integra speculative decoding. Un modelo auxiliar pequeño y eficiente propone varios posibles tokens siguientes, que el modelo principal Qwen 3.8 Flash-Next verifica luego en un solo lote. Este enfoque ofreció una aceleración reportada de 1.6–1.8× en las pruebas, con el modelo principal coincidiendo con las propuestas del auxiliar aproximadamente el 79% de las veces, sin alterar el resultado final.
Este enfoque unificado, que aprovecha la VRAM de la GPU para los expertos activos, la RAM del sistema para el conjunto completo de expertos e incluso un SSD NVMe para una tabla de búsqueda masiva, maximiza el rendimiento. Para obtener más detalles técnicos sobre este proyecto de código abierto, puede explorar GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware. Strata transforma efectivamente una PC de escritorio en un potente motor de inferencia distribuido.
¿Te está gustando? Recibe uno así en tu bandeja cada mañana.
un correo al día · date de baja en dos clics · sin rastreadores de terceros
Una inferencia rápida no es lo mismo que una mejora gratuita
La inferencia local ofrece ventajas convincentes, pero los resultados de velocidad de Strata no son una garantía universal de la calidad o el rendimiento del modelo. La cuantización local de 2 bits de Qwen 3.8 Flash-Next funcionó bien en las pruebas específicas del video, sin embargo, esto no demuestra paridad con un modelo en la nube que potencialmente se ejecute con mayor precisión. La precisión a menudo afecta el razonamiento matizado y la veracidad.
Strata también exige recursos sustanciales del sistema. El modelo de 125B puede consumir casi toda la VRAM disponible (por ejemplo, 32 GB en una RTX 5090) y una parte significativa de la RAM del sistema (hasta 39 GB en el video). La primera carga del modelo puede bloquear una PC durante minutos, y los chats más largos o diferentes prompts pueden alterar el rendimiento, como señaló el propio video.
Estos impresionantes benchmarks son específicos del sistema. Por ejemplo, la aceleración de 3–5× del video en una RTX 5090 no es directamente comparable a una configuración con 12 GB de VRAM o menos RAM del sistema.
En última instancia, la inferencia local proporciona privacidad, control del usuario y un bajo costo marginal de electricidad. Los servicios en la nube, por el contrario, evitan la inversión inicial en GPUs de gama alta y pueden ofrecer una mayor precisión y un acceso constante a modelos potentes. Los resultados de Strata son una demostración convincente de lo que es posible con software y hardware optimizados, no una mejora gratuita para todos los usuarios.
Preguntas frecuentes
¿Qué es Strata?
Strata es un motor de inferencia de código abierto diseñado para ejecutar Qwen 3.8 Flash-Next localmente distribuyendo el trabajo entre la GPU, la CPU, la RAM del sistema y el SSD.
¿Cómo superó el modelo local a la nube en el video?
En la PC RTX 5090 del creador, Strata completó una respuesta larga en 6.6 segundos, frente a los 33 segundos de la ejecución en la nube. Los resultados dependen de los prompts, el hardware, la carga del proveedor y la configuración.
¿Qué PC necesitas para ejecutar Strata?
El video reporta un mínimo de 12 GB de VRAM, 32 GB de RAM del sistema y alrededor de 80 GB de espacio libre en disco. Más memoria y un SSD rápido pueden ayudar; el modelo utilizó una cantidad sustancial de RAM y VRAM.
¿Es Strata más rápido que la IA en la nube para todas las tareas?
No. La prueba de lógica del video fue esencialmente un empate, y el rendimiento en la nube varía. El resultado local también utilizó un modelo cuantizado de 2 bits, por lo que las comparaciones de velocidad no establecen una precisión igual.

