A Regra de 40 Anos que Pesquisadores de IA Querem Quebrar
Todo modelo de IA, desde grandes modelos de linguagem até classificadores de imagem, treina usando backpropagation, um algoritmo popularizado em 1986. Este método funciona executando dados através de uma rede neural para fazer previsões, calculando uma "perda" para medir o erro e, em seguida, usando a regra da cadeia do cálculo para determinar gradientes precisos — como cada peso deve ser ajustado para reduzir esse erro.
O poder do backpropagation reside no seu cálculo eficiente desses gradientes exatos, mas exige que cada operação dentro do modelo seja diferenciável. Essa restrição frequentemente exige o armazenamento de ativações intermediárias para a passagem reversa, influenciando quase todas as escolhas arquiteturais e designs de hardware em deep learning hoje. A alternativa, estratégias evolutivas, envolve adivinhar ajustes de peso e verificar iterativamente a redução da perda; no entanto, esses métodos são notoriamente lentos devido à necessidade de múltiplas passagens diretas.
Pesquisadores da Q Labs estão desafiando esse paradigma de 40 anos com Dust, uma nova abordagem de treinamento para transformers. O Dust investiga se um transformer pode aprender efetivamente por tentativa e erro, não por cálculo de gradiente, perturbando ativações em vez de pesos. Esta pesquisa investiga a questão fundamental de se o aprendizado de máquina pode se libertar do requisito de diferenciabilidade, potencialmente permitindo arquiteturas de modelo totalmente novas e não diferenciáveis.
Dust Transforma Cada Token em um Experimento
Estratégias evolutivas há muito oferecem uma alternativa ao backpropagation, mas tradicionalmente operam no espaço de pesos. Isso significa que elas perturbam os parâmetros de um modelo diretamente, exigindo uma passagem direta separada para cada conjunto de pesos perturbados para avaliar seu impacto na perda. Tais métodos são "dolorosamente lentos" devido à sobrecarga computacional dessas avaliações individuais.
Dust, um método inovador da Q Labs, inverte esse paradigma ao injetar ruído aleatório independente no espaço de ativação de um modelo — especificamente, na saída de cada camada em cada posição de token. Em vez de adivinhar mudanças de peso, o Dust estima quais perturbações de ativação reduzem a perda para cada token, aproveitando esses insights para inferir ajustes de peso apropriados.
Essa abordagem cria uma "população virtual". Uma única passagem direta com uma sequência de 2.048 tokens executa efetivamente 2.048 experimentos de perturbação paralelos. O ruído que reduz a perda em uma determinada posição de token é "recompensado", e esses sinais ponderados pela recompensa são então calculados pela média para estimar o gradiente para cada camada.
A partir desses gradientes estimados, as atualizações de peso são calculadas usando o mesmo mecanismo do backpropagation. A diferença crítica é que o Dust deriva suas estimativas de gradiente por tentativa e erro dentro do espaço de ativação, em vez de cálculo via regra da cadeia. Este método inovador representa um afastamento significativo dos paradigmas de treinamento convencionais.
Os Resultados Foram Estranhos — e Vale a Pena Observar
Resultados iniciais da Q Labs revelaram uma vitória limitada para o Dust. Em execuções de treinamento mais curtas (100 mil e 1 milhão de tokens), o Dust superou o backpropagation ajustado ao alcançar um modelo mais inteligente. Embora não tenha alcançado totalmente em execuções mais longas, mais amostras reduziram progressivamente a lacuna de desempenho, com uma perda ajustada por lei de potência extrapolada de 4,43 para o Dust versus 4,63 para o backpropagation em 20 milhões de tokens sob grandes orçamentos populacionais.
Ao comparar o Dust com métodos de ordem zero existentes, a distinção foi substancial. O Dust teve um desempenho significativamente melhor que o EGGROLL, mesmo quando o EGGROLL recebeu 256 vezes mais amostras populacionais. Isso demonstrou a eficiência superior do Dust na estimativa de gradientes por meio de perturbações de ativação.
Talvez o mais contraintuitivo seja que modelos testados maiores pareceram ser mais eficientes em termos de população. Esse benefício de escala estendeu-se a modelos de até 243 milhões de parâmetros. Esses experimentos, no entanto, usaram pequenos modelos estilo GPT baseados no modded-nanoGPT e no conjunto de dados FineWeb, não os LLMs em escala de produção que encontramos normalmente. Para mais detalhes técnicos, explore Dust: Pretraining Transformers Without Backpropagation - Q Labs.
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
O problema: um método inteligente que custa caro demais
A engenhosidade do Dust vem com um custo computacional considerável. O paralelismo em nível de token, embora inovador, não reduz o total de horas de GPU ou FLOPs em comparação com a retropropagação (backpropagation); ele apenas os realoca. Os pesquisadores do Q Labs afirmam explicitamente que o Dust requer ordens de magnitude a mais de computação, tornando-o impraticável como um substituto direto para a retropropagação hoje, especialmente para modelos que excedem os 243 milhões de parâmetros testados.
Aplicações de curto prazo para métodos de treinamento sem derivadas, como o Dust, provavelmente ocorrerão em áreas onde a retropropagação enfrenta dificuldades devido ao seu requisito de diferenciabilidade. Isso inclui o treinamento de modelos com componentes não diferenciáveis, tais como:
- Programas externos
- Simuladores complexos
- Módulos de tomada de decisão discreta
- Autochamadas repetidas dentro da arquitetura do modelo
Fique atento a melhorias de eficiência e ao desenvolvimento de métodos de treinamento híbridos que combinam a flexibilidade do Dust com a velocidade da retropropagação. Tais abordagens poderiam desbloquear arquiteturas inovadoras atualmente limitadas pela diferenciabilidade analítica. Para aqueles ansiosos por inspecionar a mecânica, o Q Labs fornece pesquisas detalhadas em seu site e uma implementação de código aberto no GitHub.
Perguntas Frequentes
O que é o Dust?
O Dust é um método experimental para treinar modelos transformer perturbando ativações e estimando direções de aprendizado a partir de mudanças na perda (loss), sem usar retropropagação.
Como o Dust evita a retropropagação?
Ele adiciona ruído aleatório às ativações de camada em todas as posições de token, mede como a perda responde e combina esses sinais para estimar as atualizações.
O Dust supera a retropropagação?
Ele superou a retropropagação ajustada em algumas execuções curtas de treinamento, mas não mostrou uma vantagem geral de eficiência computacional em escalas de treinamento práticas.
Por que treinar sem retropropagação pode ser importante?
Isso poderia tornar mais fácil treinar sistemas que envolvem operações não diferenciáveis, como programas externos ou simuladores, que não se encaixam perfeitamente no treinamento padrão baseado em gradiente.

