토크나이저 지름길에는 숨겨진 비용이 있습니다
기존의 거대 언어 모델(LLM)은 텍스트를 하위 단어 토큰(subword tokens)으로 분할하여 방대한 어휘 사전에서 가져오는 방식으로 작동합니다. 예를 들어 Llama 3는 약 128,000개의 토큰을 사용합니다. 반면, 바이트 모델(byte models)은 각 문자를 원시 바이트 값으로 나타내는 단 256개의 바이트 기호를 사용하여 텍스트를 처리합니다.
이러한 토큰화 지름길은 효율적이지만 임의적인 경계를 도입합니다. “tiramisu”라는 단어를 예로 들면, 토크나이저는 이를 T, IRAM, ISU로 분할할 수 있습니다. 이러한 취약한 토큰화는 오타, 덜 표현된 언어, 그리고 정밀한 문자 수준의 이해가 중요한 코드에서 성능을 저하시킬 수 있습니다.
역사적으로 토큰 모델이 우세했던 이유는 실질적인 제약 때문이었습니다. 토큰화의 직접적인 결과인 더 짧은 시퀀스는 제한된 컴퓨팅 자원에서 학습과 추론을 가능하게 했습니다. 바이트 모델은 원시적인 충실도에도 불구하고 이러한 조건에서 성능이 뒤처졌기 때문에 널리 사용되지 못했습니다.
Llama의 로짓(logits)에서 원시 바이트로의 가교
Llama 3 8B와 같은 대규모 토큰 기반 교사 모델에서 작은 바이트 기반 학생 모델로 지식을 증류하는 것은 근본적인 도전 과제입니다. 교사 모델은 128,000개의 방대한 토큰 어휘 사전에 대한 확률을 예측하는데, 단 256개의 기호로 작동하는 바이트 학생 모델은 이를 직접적으로 수용할 수 없습니다. 이러한 증류 불일치(distillation mismatch)는 역사적으로 효율적인 교차 어휘 학습을 방해해 왔습니다.
연구진은 토큰 종료(<eot>) 마커를 도입하여 이 문제를 해결했습니다. 이 특수 기호는 토큰 예측을 바이트 예측 시퀀스로 변환할 때 손실될 수 있는 모든 확률 질량을 포착합니다. 예를 들어, "tiramisu"와 같은 토큰이 t, iram, isu 바이트로 분할되면, <eot> 마커는 원래 토큰의 전체 확률이 바이트 표현 전체에 걸쳐 보존되도록 합니다.
이 혁신적인 메커니즘은 단 한 번의 패스로 정확한 확률 전송을 가능하게 합니다. 연구진은 <eot> 기호를 추가함으로써 교사의 전체 확률 분포가 근사치 없이 바이트 학생의 어휘 사전으로 정확하게 매핑될 수 있도록 보장했습니다.
이 돌파구를 통해 작은 바이트 모델은 Llama 3 8B와 같은 강력한 기존 토큰 모델로부터 직접적이고 효과적으로 학습할 수 있게 되었습니다. 이는 교사와 학생 간에 동일한 토크나이저가 필요 없게 만들어, 더 강력하고 효율적인 언어 모델을 개발하기 위한 새로운 경로를 열어줍니다.
학습 기간이 길어질 때 바이트 모델이 유리한 이유
Meta와 워싱턴 대학교의 연구진은 약 10억 개의 파라미터를 가진 학생 모델을 최대 1조 바이트의 데이터로 학습시키는 중요한 실험을 수행했습니다. 그들은 Llama 3 8B 교사 모델로부터 지식을 증류하여, 토큰 기반 예측을 바이트 수준의 확률로 세심하게 변환했습니다.
학습 초기에는 토큰 모델이 바이트 모델보다 지속적으로 우수한 성능을 보였는데, 이는 단계별로 더 많은 의미 정보를 처리할 수 있는 능력 때문이라는 일반적인 패턴이었습니다. 그러나 학습이 연장됨에 따라 바이트 모델은 더 가파르고 지속적인 개선 곡선을 보였으며, 결국 토큰 모델을 능가했습니다.
이번 심층 학습을 통해 놀라운 효율성이 밝혀졌습니다. 증류된 byte 모델은 약 6분의 1의 학습 데이터만으로도 token 모델과 대등한 성능을 달성했습니다. 방법론에 대한 자세한 내용은 논문 Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models을 참조하십시오.
byte 모델의 장기적인 이점은 상당합니다. 현재 체크포인트에서는 아직 전체적인 이득이 완전히 나타나지 않았지만, scaling-law extrapolation에 따르면 byte 모델은 token 모델보다 벤치마크 점수를 최대 4점까지 높일 수 있을 것으로 예상됩니다. 이는 이미 실현된 점수가 아닌 예측치이며, 컴퓨팅 자원이 풍부한 학습 환경에서의 잠재력을 강조합니다.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
학습 비용은 저렴하지만, 답변 속도는 느림
Byte-level 분포는 저장 측면에서 강력한 이점을 제공합니다. 연구진은 손실이 발생하는 top-k 절단에 의존하는 대신 모든 예측값을 보존하여 logit storage를 기존 token 분포 대비 약 5분의 1 수준으로 줄였습니다. 이를 통해 증류 과정에서 완전한 충실도를 유지할 수 있으며, 이는 teacher 모델의 미묘한 동작을 포착하는 데 결정적인 요소입니다.
그러나 이러한 효율성은 추론 과정에서 트레이드오프를 발생시킵니다. Byte 시퀀스는 일반적으로 토큰화된 시퀀스보다 4~5배 더 깁니다. 이러한 길이 증가는 직접적으로 inference time 증가와 잠재적인 KV-cache memory requirements 상승으로 이어지며, 이는 실시간 애플리케이션 및 자원이 제한된 환경에서의 배포에 도전 과제가 됩니다.
Byte 모델은 컴퓨팅 자원이 풍부한 학습 환경을 우선시하거나, 새로운 언어나 복잡한 문자 집합을 다룰 때 발생하는 tokenizer 기반의 취약성에 민감한 시나리오에서 가능성을 보여줍니다. 예상되는 4점의 벤치마크 우위와 학습 데이터 요구량 감소는 매우 의미가 큽니다. 하지만 실제 속도, 배포 비용, 그리고 이러한 성능 향상 예측에 대한 최종 검증은 향후 추가 연구가 필요한 영역입니다.
자주 묻는 질문
byte 모델이란 무엇인가요?
byte 모델은 텍스트를 학습된 어휘 사전에서 분할된 subword token이 아닌, byte 시퀀스로 읽어 들입니다.
Meta는 어떻게 token 모델을 byte 모델로 증류하나요?
이 방법은 teacher 모델의 token 확률을 byte로 매핑하고, end-of-token 마커를 사용하여 전체 확률 분포를 보존합니다.
byte 모델이 이미 token 모델을 능가하나요?
보고된 결과에 따르면 byte 모델은 학습이 진행될수록 성능이 향상되지만, 예상되는 4점의 벤치마크 향상은 최종 측정된 결과가 아닌 외삽법에 의한 예측치입니다.
byte 모델의 주요 단점은 무엇인가요?
시퀀스 길이가 token 시퀀스보다 일반적으로 4~5배 길기 때문에 추론 속도가 느려지고 메모리 사용량이 증가할 수 있습니다.

