Skip to content
research

Los modelos de IA podrían haber encontrado una forma de superar los tokens

Un vocabulario diminuto parece un atajo, pero conlleva una costosa penalización de velocidad y una sorprendente ventaja de entrenamiento. El verdadero avance puede no consistir tanto en reemplazar los chatbots actuales, sino en hacer que los modelos pequeños sean más fáciles de enseñar.

Aki Tanaka
Los modelos de IA podrían haber encontrado una forma de superar los tokens

El atajo de la tokenización tiene un costo oculto

Los modelos de lenguaje grandes (LLM) convencionales operan dividiendo el texto en subword tokens, recurriendo a vocabularios extensos; Llama 3, por ejemplo, utiliza aproximadamente 128,000 de estos tokens. En contraste, los byte models procesan el texto usando apenas 256 símbolos de byte, representando cada carácter como su valor de byte crudo.

Este atajo de tokenización, aunque eficiente, introduce límites arbitrarios. Considere la palabra “tiramisu”, que un tokenizador podría fragmentar en T, IRAM e ISU. Una tokenización tan frágil puede degradar el rendimiento con errores tipográficos, idiomas menos representados y código, donde la comprensión precisa a nivel de carácter es crítica.

Históricamente, los modelos de tokens prevalecieron debido a limitaciones prácticas. Las secuencias más cortas, un resultado directo de la tokenización, hicieron que el entrenamiento y la inferencia fueran factibles con recursos computacionales limitados. Los modelos de bytes, a pesar de su fidelidad cruda, se quedaron atrás en rendimiento bajo estas condiciones, lo que llevó a su desuso generalizado.

El puente desde los logits de Llama hasta los bytes crudos

Destilar conocimiento desde un profesor basado en tokens grande como Llama 3 8B hacia un estudiante pequeño basado en bytes presenta un desafío fundamental. El modelo profesor predice probabilidades sobre su extenso vocabulario de 128,000 tokens, que un estudiante de bytes, operando con apenas 256 símbolos, no puede consumir directamente. Este desajuste de destilación impidió históricamente el entrenamiento eficiente entre vocabularios.

Los investigadores abordaron esto introduciendo un marcador de fin de token (<eot>). Este símbolo especial captura cualquier masa de probabilidad que de otro modo se perdería al traducir una predicción de token en una secuencia de predicciones de bytes. Por ejemplo, si un token como "tiramisu" se divide en bytes t, iram, isu, el marcador <eot> asegura que la probabilidad completa del token original se conserve a través de su representación en bytes.

Este mecanismo innovador permite una transferencia de probabilidad exacta en una sola pasada. Al añadir el símbolo <eot>, los investigadores garantizaron que la distribución de probabilidad completa del profesor pudiera mapearse con precisión al vocabulario del estudiante de bytes sin aproximaciones.

Este avance permite que los modelos de bytes pequeños aprendan directa y efectivamente de modelos de tokens potentes y existentes como Llama 3 8B. Elimina la necesidad de tokenizadores idénticos entre profesor y estudiante, desbloqueando un nuevo camino para desarrollar modelos de lenguaje más robustos y eficientes.

Por qué los bytes pueden ganar cuando el entrenamiento se prolonga

Investigadores de Meta y la University of Washington llevaron a cabo un experimento crítico, entrenando modelos estudiantes de aproximadamente 1 billón de parámetros con datos de hasta un billón de bytes. Destilaron conocimiento de un profesor Llama 3 8B, convirtiendo meticulosamente sus predicciones basadas en tokens en probabilidades a nivel de byte.

Al principio del entrenamiento, los modelos de tokens superaron consistentemente a sus contrapartes de bytes, un patrón común debido a su capacidad para procesar más información semántica por paso. Sin embargo, a medida que el entrenamiento se extendió, los modelos de bytes demostraron una curva de mejora más pronunciada y sostenida, superando finalmente a los modelos de tokens.

Este entrenamiento extendido reveló una eficiencia sorprendente: los modelos de bytes destilados lograron un rendimiento igual al de los modelos de tokens con aproximadamente una sexta parte de los datos de entrenamiento. Para más detalles sobre la metodología, consulte el artículo Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models.

La ventaja a largo plazo de los byte models es significativa. Si bien los checkpoints actuales aún no muestran la ganancia completa, la scaling-law extrapolation proyecta que los byte models podrían alcanzar hasta cuatro puntos de referencia más que los token models. Esta proyección, que no es una puntuación ya realizada, destaca su potencial en entornos de entrenamiento con gran capacidad de cómputo.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

Más baratos de entrenar, más lentos al responder

Las distribuciones a nivel de byte ofrecen una ventaja de almacenamiento convincente. En lugar de depender de una truncación top-k con pérdida, los investigadores preservaron todas las predicciones, reduciendo el logit storage a aproximadamente una quinta parte del espacio requerido para las distribuciones de tokens convencionales. Esto permite una fidelidad total en el proceso de destilación, un factor crítico para capturar el comportamiento matizado del modelo profesor.

Esta eficiencia, sin embargo, introduce un compromiso durante la inferencia. Las secuencias de bytes son típicamente de cuatro a cinco veces más largas que sus contrapartes tokenizadas. Esta longitud extendida se traduce directamente en un mayor inference time y potencialmente mayores KV-cache memory requirements, lo que plantea un desafío para aplicaciones en tiempo real y despliegues con recursos limitados.

Los byte models muestran potencial para escenarios que priorizan entornos de entrenamiento con gran capacidad de cómputo y aquellos vulnerables a la fragilidad inducida por el tokenizador, como el manejo de idiomas nuevos o conjuntos de caracteres complejos. La ventaja proyectada de cuatro puntos en los benchmarks y los menores requisitos de datos de entrenamiento son significativos. Sin embargo, su velocidad práctica, los costos de despliegue y la validación definitiva de esta ganancia de rendimiento proyectada siguen siendo áreas para una mayor investigación.

Preguntas frecuentes

¿Qué es un byte model?

Un byte model lee el texto como secuencias de bytes en lugar de dividirlo en subword tokens de un vocabulario aprendido.

¿Cómo destila Meta un token model en un byte model?

El método mapea las probabilidades de los tokens del profesor a bytes y utiliza un marcador de fin de token para preservar la distribución de probabilidad completa.

¿Superan ya los byte models a los token models?

Los resultados reportados muestran que los byte models mejoran con más entrenamiento, pero la ganancia proyectada de cuatro puntos en los benchmarks es una extrapolación, no un resultado final medido.

¿Cuál es el principal inconveniente de los byte models?

Sus secuencias son típicamente de cuatro a cinco veces más largas que las secuencias de tokens, lo que puede hacer que la inferencia sea más lenta y aumentar el uso de memoria.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.