O atalho do tokenizador tem um custo oculto
Grandes modelos de linguagem (LLMs) convencionais operam dividindo o texto em subword tokens, extraídos de vocabulários extensos — o Llama 3, por exemplo, utiliza aproximadamente 128.000 desses tokens. Em contraste, byte models processam texto usando meros 256 símbolos de byte, representando cada caractere como seu valor de byte bruto.
Este atalho de tokenização, embora eficiente, introduz limites arbitrários. Considere a palavra “tiramisu”, que um tokenizador pode fragmentar em T, IRAM e ISU. Tal tokenização frágil pode degradar o desempenho com erros de digitação, idiomas menos representados e código, onde a compreensão precisa em nível de caractere é crítica.
Historicamente, modelos de token prevaleceram devido a restrições práticas. Sequências mais curtas, um resultado direto da tokenização, tornaram o treinamento e a inferência viáveis em recursos computacionais limitados. Modelos de byte, apesar de sua fidelidade bruta, ficaram para trás em desempenho sob essas condições, levando ao seu desuso generalizado.
A ponte dos logits do Llama para bytes brutos
Destilar conhecimento de um grande professor baseado em tokens como o Llama 3 8B para um pequeno aluno baseado em bytes apresenta um desafio fundamental. O modelo professor prevê probabilidades sobre seu extenso vocabulário de 128.000 tokens, que um aluno de bytes, operando com meros 256 símbolos, não consegue consumir diretamente. Esse descompasso de destilação historicamente impediu o treinamento eficiente entre vocabulários.
Pesquisadores abordaram isso introduzindo um marcador de end-of-token (<eot>). Este símbolo especial captura qualquer massa de probabilidade que, de outra forma, seria perdida ao traduzir uma previsão de token em uma sequência de previsões de byte. Por exemplo, se um token como "tiramisu" for quebrado em bytes t, iram, isu, o marcador <eot> garante que a probabilidade total do token original seja conservada em sua representação de byte.
Este mecanismo inovador permite uma transferência exata de probabilidade em uma única passagem. Ao adicionar o símbolo <eot>, os pesquisadores garantiram que a distribuição de probabilidade completa do professor pudesse ser mapeada precisamente para o vocabulário do aluno de bytes sem aproximação.
Este avanço permite que pequenos modelos de byte aprendam direta e efetivamente de poderosos modelos de token existentes, como o Llama 3 8B. Ele elimina a necessidade de tokenizadores idênticos entre professor e aluno, desbloqueando um novo caminho para o desenvolvimento de modelos de linguagem mais robustos e eficientes.
Por que os bytes podem vencer quando o treinamento é longo
Pesquisadores da Meta e da University of Washington conduziram um experimento crítico, treinando modelos alunos de aproximadamente 1 bilhão de parâmetros com dados de até um trilhão de bytes. Eles destilaram conhecimento de um professor Llama 3 8B, convertendo meticulosamente suas previsões baseadas em tokens em probabilidades de nível de byte.
No início do treinamento, os modelos de token superaram consistentemente seus equivalentes de byte, um padrão comum devido à sua capacidade de processar mais informações semânticas por etapa. No entanto, à medida que o treinamento se estendeu, os modelos de byte demonstraram uma curva de melhoria mais acentuada e sustentada, eventualmente superando os modelos de token.
Este treinamento estendido revelou uma eficiência impressionante: modelos de byte destilados alcançaram um desempenho equivalente aos modelos de token com aproximadamente um sexto dos dados de treinamento. Para mais detalhes sobre a metodologia, consulte o artigo Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models.
A vantagem a longo prazo dos modelos de byte é significativa. Embora os checkpoints atuais ainda não mostrem o ganho total, a scaling-law extrapolation projeta que os modelos de byte poderiam alcançar até quatro pontos de benchmark a mais do que os modelos de token. Esta projeção, que não é uma pontuação já realizada, destaca seu potencial em ambientes de treinamento com alto poder computacional.
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
Mais barato para ensinar, mais lento para responder
As distribuições em nível de byte oferecem uma vantagem de armazenamento convincente. Em vez de depender do truncamento lossy top-k, os pesquisadores preservaram todas as previsões, reduzindo o logit storage para aproximadamente um quinto do espaço necessário para distribuições de token convencionais. Isso permite fidelidade total no processo de destilação, um fator crítico para capturar o comportamento sutil do modelo professor.
Essa eficiência, no entanto, introduz um compromisso durante a inferência. As sequências de bytes são tipicamente quatro a cinco vezes mais longas do que suas contrapartes tokenizadas. Esse comprimento estendido traduz-se diretamente em um aumento no inference time e potencialmente em maiores KV-cache memory requirements, representando um desafio para aplicações em tempo real e implantações com recursos limitados.
Os modelos de byte mostram promessa para cenários que priorizam ambientes de treinamento com alto poder computacional e aqueles vulneráveis à fragilidade induzida por tokenizadores, como o tratamento de novos idiomas ou conjuntos de caracteres complexos. A vantagem projetada de quatro pontos no benchmark e os requisitos reduzidos de dados de treinamento são significativos. No entanto, sua velocidade prática, custos de implantação e a validação final desse ganho de desempenho projetado permanecem áreas para investigação adicional.
Perguntas Frequentes
O que é um modelo de byte?
Um modelo de byte lê o texto como sequências de bytes em vez de dividi-lo em subpalavras (tokens) de um vocabulário aprendido.
Como a Meta destila um modelo de token em um modelo de byte?
O método mapeia as probabilidades de token do professor para bytes e usa um marcador de fim de token para preservar a distribuição de probabilidade completa.
Os modelos de byte já superam os modelos de token?
Os resultados relatados mostram que os modelos de byte melhoram com mais treinamento, mas o ganho projetado de quatro pontos no benchmark é uma extrapolação, não um resultado final medido.
Qual é a principal desvantagem dos modelos de byte?
Suas sequências são tipicamente quatro a cinco vezes mais longas do que as sequências de token, o que pode tornar a inferência mais lenta e aumentar o uso de memória.

