Skip to content
research

El avance del Backprop con una trampa masiva

Un ingenioso truco de entrenamiento convierte cada token en un pequeño experimento, y algunos resultados iniciales sorprendieron a los investigadores. Pero una factura de computación que empequeñece al entrenamiento estándar podría mantener esta idea fuera de los modelos de producción actuales.

Aki Tanaka
El avance del Backprop con una trampa masiva

La regla de 40 años que los investigadores de IA quieren romper

Cada modelo de IA, desde los modelos de lenguaje grandes hasta los clasificadores de imágenes, se entrena utilizando backpropagation, un algoritmo popularizado en 1986. Este método funciona ejecutando datos hacia adelante a través de una red neuronal para hacer predicciones, calculando una "pérdida" para medir el error y luego usando la regla de la cadena del cálculo para determinar gradientes precisos: cómo debe ajustarse cada peso para reducir ese error.

El poder de backpropagation reside en su cálculo eficiente de estos gradientes exactos, pero exige que cada operación dentro del modelo sea diferenciable. Esta restricción a menudo requiere almacenar activaciones intermedias para el paso hacia atrás, influyendo en casi todas las opciones arquitectónicas y diseños de hardware en el aprendizaje profundo actual. La alternativa, las estrategias evolutivas, implica adivinar los ajustes de peso y verificar iterativamente la reducción de la pérdida; sin embargo, estos métodos son notoriamente lentos debido a la necesidad de múltiples pases hacia adelante.

Los investigadores de Q Labs están desafiando este paradigma de 40 años con Dust, un enfoque de entrenamiento novedoso para transformers. Dust investiga si un transformer puede aprender eficazmente mediante prueba y error, no mediante el cálculo de gradientes, perturbando las activaciones en lugar de los pesos. Esta investigación indaga en la pregunta fundamental de si el aprendizaje automático puede liberarse del requisito de diferenciabilidad, permitiendo potencialmente arquitecturas de modelos completamente nuevas y no diferenciables.

Dust convierte cada token en un experimento

Las estrategias evolutivas han ofrecido durante mucho tiempo una alternativa a backpropagation, pero tradicionalmente operan en el espacio de pesos. Esto significa que perturban los parámetros de un modelo directamente, lo que requiere un pase hacia adelante separado para cada conjunto de pesos perturbados para evaluar su impacto en la pérdida. Dichos métodos son "dolorosamente lentos" debido a la sobrecarga computacional de estas evaluaciones individuales.

Dust, un método novedoso de Q Labs, cambia este paradigma al inyectar ruido aleatorio independiente en el espacio de activación de un modelo, específicamente, en la salida de cada capa en cada posición de token. En lugar de adivinar los cambios de peso, Dust estima qué perturbaciones de activación reducen la pérdida para cada token, aprovechando estos conocimientos para inferir los ajustes de peso apropiados.

Este enfoque crea una "población virtual". Un solo pase hacia adelante con una secuencia de 2,048 tokens ejecuta efectivamente 2,048 ensayos de perturbación en paralelo. El ruido que reduce la pérdida en una posición de token determinada es "recompensado", y estas señales ponderadas por recompensa se promedian luego para estimar el gradiente de cada capa.

A partir de estos gradientes estimados, las actualizaciones de peso se calculan utilizando el mismo mecanismo que backpropagation. La diferencia crítica es que Dust deriva sus estimaciones de gradiente de la prueba y error dentro del espacio de activación, en lugar del cálculo a través de la regla de la cadena. Este método innovador representa una desviación significativa de los paradigmas de entrenamiento convencionales.

Los resultados fueron extraños, y vale la pena observarlos

Los resultados iniciales de Q Labs revelaron una victoria limitada para Dust. En ejecuciones de entrenamiento más cortas (100k y 1M de tokens), Dust superó a la backpropagation ajustada para lograr un modelo más inteligente. Aunque no alcanzó completamente en ejecuciones más largas, más muestras redujeron progresivamente la brecha de rendimiento, con una pérdida ajustada de ley de potencia extrapolada de 4.43 para Dust frente a 4.63 para backpropagation a 20M de tokens bajo presupuestos de población grandes.

Al comparar Dust con los métodos de orden cero existentes, la distinción fue sustancial. Dust tuvo un rendimiento significativamente mejor que EGGROLL, incluso cuando EGGROLL recibió 256 veces más muestras de población. Esto demostró la eficiencia superior de Dust para estimar gradientes a través de perturbaciones de activación.

Quizás lo más contraintuitivo es que los modelos probados más grandes parecieron ser más eficientes en cuanto a población. Este beneficio de escalado se extendió a modelos de hasta 243 millones de parámetros. Estos experimentos, sin embargo, utilizaron modelos pequeños al estilo GPT basados en modded-nanoGPT y el conjunto de datos FineWeb, no los LLM a escala de producción que solemos encontrar. Para obtener más detalles técnicos, explore Dust: Pretraining Transformers Without Backpropagation - Q Labs.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

El inconveniente: un método ingenioso que cuesta demasiado

El ingenio de Dust conlleva un costo computacional considerable. El paralelismo a nivel de token, aunque innovador, no reduce el total de horas de GPU o FLOPs en comparación con la retropropagación; simplemente los reasigna. Los investigadores de Q Labs afirman explícitamente que Dust requiere órdenes de magnitud más de cómputo, lo que lo hace poco práctico como reemplazo directo de la retropropagación hoy en día, especialmente para modelos que superan los 243 millones de parámetros probados.

Las aplicaciones a corto plazo para métodos de entrenamiento sin derivadas como Dust se encuentran probablemente en áreas donde la retropropagación tiene dificultades debido a su requisito de diferenciabilidad. Esto incluye el entrenamiento de modelos con componentes no diferenciables tales como:

  • Programas externos
  • Simuladores complejos
  • Módulos de toma de decisiones discretos
  • Autollamadas repetidas dentro de la arquitectura del modelo

Esté atento a las mejoras en la eficiencia y al desarrollo de métodos de entrenamiento híbridos que combinen la flexibilidad de Dust con la velocidad de la retropropagación. Tales enfoques podrían desbloquear arquitecturas novedosas actualmente limitadas por la diferenciabilidad analítica. Para aquellos interesados en inspeccionar la mecánica, Q Labs proporciona una investigación detallada en su sitio web y una implementación de código abierto en GitHub.

Preguntas frecuentes

¿Qué es Dust?

Dust es un método experimental para entrenar modelos transformer mediante la perturbación de activaciones y la estimación de direcciones de aprendizaje a partir de cambios en la pérdida, sin utilizar retropropagación.

¿Cómo evita Dust la retropropagación?

Añade ruido aleatorio a las activaciones de las capas a través de las posiciones de los tokens, mide cómo responde la pérdida y combina esas señales para estimar las actualizaciones.

¿Supera Dust a la retropropagación?

Superó a la retropropagación ajustada en algunas ejecuciones de entrenamiento cortas, pero no ha mostrado una ventaja general en la eficiencia de cómputo a escalas de entrenamiento prácticas.

¿Por qué podría ser importante el entrenamiento sin retropropagación?

Podría facilitar el entrenamiento de sistemas que involucran operaciones no diferenciables, como programas externos o simuladores, que no encajan perfectamente en el entrenamiento estándar basado en gradientes.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.