Por qué los modelos de IA gigantes rompen tu GPU
Los modelos de IA gigantes, especialmente los modelos de mixture of experts (MoE), presentan un desafío único para las GPU de consumo. Considera DeepSeek V4-Flash: cuenta con la asombrosa cifra de 284 mil millones de parámetros totales. Sin embargo, para cualquier token individual, solo se utiliza una pequeña fracción, alrededor de 13 mil millones. Si bien esta parte activa podría caber en muchas GPU, los 284 mil millones de parámetros completos deben residir en algún lugar, generalmente en la RAM del sistema, porque no sabes qué expertos se necesitarán a continuación.
Los motores de inferencia tradicionales como Ollama tienen dificultades con esta realidad dinámica. Cuando un modelo MoE excede la VRAM de tu GPU (por ejemplo, un modelo Qwen 3.6 35B de 38 GB en una tarjeta de 32 GB), Ollama recurre a una solución estática. Divide permanentemente el modelo, descargando capas a la CPU (por ejemplo, 30% a la CPU, 70% a la GPU). Esto significa que cada token, independientemente de los expertos que necesite, debe atravesar cada capa, lo que obliga a un desvío lento a través de la CPU para una parte significativa. En las pruebas, esto produjo apenas 58 tokens por segundo.
FreeToken ofrece un enfoque fundamentalmente diferente. Abandona la ubicación estática, replanteando el problema como dynamic scheduling. La VRAM de tu GPU se convierte en una caché inteligente para los expertos a los que se accede con frecuencia, con el modelo completo residiendo en la RAM del sistema; solo los expertos necesarios activamente se transmiten a la GPU bajo demanda. Este sistema dinámico basado en caché es mucho más adecuado para los modelos MoE, que a menudo reutilizan los mismos expertos en diferentes tokens, manteniendo el cálculo en la GPU más rápida.
El secreto de FreeToken: programación, no división
FreeToken replantea cómo tu PC maneja modelos masivos de mixture of experts. En lugar de intentar meter los 284 mil millones de parámetros completos de DeepSeek V4-Flash en tu GPU, FreeToken trata tu GPU VRAM como una caché de alta velocidad. El modelo completo vive en la RAM del sistema, y solo los expertos utilizados más recientemente se introducen dinámicamente en la VRAM. Dado que los modelos a menudo reutilizan expertos en diferentes tokens, esta estrategia reduce drásticamente el tráfico de memoria.
Cuando envías un prompt por primera vez (la fase de "prefill"), los modelos suelen necesitar acceder a muchos expertos, lo que puede ralentizar las cosas. FreeToken emplea double buffering para ocultar esta latencia. Mientras tu GPU procesa la capa actual, la herramienta transmite simultáneamente los expertos de la siguiente capa desde la RAM del sistema a través de PCIe, manteniendo la GPU ocupada y evitando esperas inactivas.
Durante la generación real, se produce un fallo de caché cuando un experto no está en la GPU. La inteligente Q* policy de FreeToken entra en acción. Mide automáticamente las velocidades específicas de PCIe y RAM de tu PC, decidiendo sobre la marcha si es más rápido llevar al experto faltante a la GPU o calcularlo directamente en la CPU. Esta división dinámica se optimiza para tu hardware único, ya sea que tengas un enlace PCIe estrecho o RAM rápida.
Poniendo a prueba la afirmación de velocidad 3x
Entonces, ¿FreeToken cumplió realmente sus promesas? El video lo sometió a una prueba adecuada en el mundo real, enfrentándolo a Ollama con un escenario desafiante: un modelo de mixture of experts de 38 GB en una GPU de consumo equipada con solo 32 GB de VRAM. Esta configuración está diseñada específicamente para romper los motores de inferencia tradicionales, obligándolos a descargar una parte significativa del modelo a una RAM del sistema más lenta.
En esta situación, Ollama divide el modelo por capas, enviando aproximadamente el 30% a la CPU. Esto significa que cada token realiza un desvío a través de la lenta CPU para ciertas capas, lo que provoca cuellos de botella significativos. Como resultado, Ollama procesó la tarea con lentitud, tardando más de 14 minutos y 20 segundos a una velocidad pausada de 58 tokens por segundo.
FreeToken, por el contrario, completó la misma tarea en unos rápidos 4 minutos y 40 segundos, entregando unos impresionantes 132 tokens por segundo. Eso supone una aceleración de casi 3 veces, lo que marca una diferencia significativa para cualquiera que ejecute modelos más grandes localmente donde el tamaño del modelo supera la VRAM de la GPU.
La inteligente estrategia de almacenamiento en caché de FreeToken también tuvo una demostración en vivo. La herramienta le permite cambiar el tamaño de su caché de expertos de GPU sobre la marcha, demostrando visualmente que una pequeña parte de los expertos 'activos' realiza la mayor parte del trabajo pesado. Los investigadores observaron que reducir la caché del 58% al 40% del tamaño total del modelo solo resultó en una reducción de velocidad del 7%. Esto valida la idea central: a menudo solo el 20-40% de los expertos del modelo se utilizan activamente, lo que confirma la eficiencia del método de dynamic caching de FreeToken. Para profundizar en la implementación técnica, puede explorar el proyecto en GitHub - FlashML-org/FreeToken: FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently..
¿Te está gustando? Recibe uno así en tu bandeja cada mañana.
un correo al día · date de baja en dos clics · sin rastreadores de terceros
FreeToken no es una solución milagrosa
FreeToken no es una varita mágica para todas las tareas de IA. Sus impresionantes ganancias de velocidad aparecen solo cuando su mixture of experts model supera la capacidad de VRAM de su GPU. Recuerde esa prueba de video crucial: un modelo de 38 GB en una GPU de 32 GB, un escenario diseñado para romper los motores de inferencia tradicionales.
Pero para modelos más pequeños, la historia cambia. Un modelo cuantizado de 4 bits, por ejemplo, que cabe cómodamente dentro de sus 32 GB de VRAM, en realidad se ejecuta más rápido en Ollama. El video demostró 240 tokens por segundo con Ollama frente a los 225 tokens por segundo de FreeToken en este caso. La sofisticada arquitectura de streaming de FreeToken, diseñada para sobrecargas de VRAM, se convierte en una sobrecarga pura cuando no queda nada que transmitir desde la RAM del sistema.
Entonces, aquí está el consejo directo: si su modelo cabe completamente en su GPU, quédese con Ollama o Llama.cpp para obtener un rendimiento óptimo. Solo cuando desee ejecutar esos mixture of experts models masivos a escala de centro de datos que de otro modo no cabrían en su hardware de consumo, debería cambiar a FreeToken. Desbloquea y acelera drásticamente esos modelos que antes eran inalcanzables.
Preguntas frecuentes
¿Qué es FreeToken?
FreeToken es un motor de inferencia de código abierto diseñado específicamente para ejecutar modelos de IA de tipo Mixture of Experts (MoE) grandes de manera eficiente en hardware de consumo, sirviendo como una alternativa de alto rendimiento a herramientas como Ollama o Llama.cpp para esta tarea específica.
¿Cómo hace FreeToken que los modelos de IA sean más rápidos?
En lugar de dividir permanentemente las capas del modelo entre la CPU y la GPU, FreeToken trata la VRAM de la GPU como una caché dinámica para los 'expertos' más utilizados. Utiliza programación inteligente, doble búfer y co-ejecución adaptativa de CPU-GPU para minimizar la latencia de transferencia de datos, especialmente cuando el modelo es más grande que la VRAM disponible.
¿Es FreeToken siempre más rápido que Ollama?
No. La principal ventaja de FreeToken es cuando un modelo MoE es demasiado grande para caber en la VRAM de su GPU. Si un modelo cabe cómodamente en la VRAM, Ollama o Llama.cpp probablemente serán más rápidos porque la arquitectura de streaming de FreeToken introduce una sobrecarga innecesaria.
¿En qué tipo de modelos se especializa FreeToken?
FreeToken está diseñado específicamente para modelos de Mixture of Experts (MoE), como DeepSeek-V4-Flash, Qwen3.6-35B y GLM-5.2. Su arquitectura está optimizada para manejar la activación dinámica de 'experts' exclusiva de estos modelos.

