AI 연구자들이 깨고 싶어 하는 40년 된 규칙
대규모 언어 모델부터 이미지 분류기에 이르기까지 모든 AI 모델은 1986년에 대중화된 알고리즘인 backpropagation을 사용하여 학습합니다. 이 방법은 신경망을 통해 데이터를 순방향으로 전달하여 예측을 수행하고, 오차를 측정하기 위해 "손실(loss)"을 계산한 다음, 미적분학의 연쇄 법칙(chain rule)을 사용하여 각 가중치가 오차를 줄이기 위해 어떻게 조정되어야 하는지 정밀한 그래디언트(gradient)를 결정하는 방식으로 작동합니다.
Backpropagation의 힘은 이러한 정확한 그래디언트를 효율적으로 계산하는 데 있지만, 모델 내의 모든 연산이 미분 가능해야 한다는 조건을 요구합니다. 이러한 제약은 종종 역방향 패스를 위해 중간 활성화 값을 저장해야 하며, 오늘날 딥러닝의 거의 모든 아키텍처 선택과 하드웨어 설계에 영향을 미칩니다. 대안인 진화 전략(evolutionary strategies)은 가중치 조정을 추측하고 반복적으로 손실 감소를 확인하는 방식을 포함하지만, 여러 번의 순방향 패스가 필요하기 때문에 매우 느린 것으로 알려져 있습니다.
Q Labs의 연구자들은 트랜스포머를 위한 새로운 학습 접근 방식인 Dust를 통해 이 40년 된 패러다임에 도전하고 있습니다. Dust는 트랜스포머가 가중치가 아닌 활성화 값을 교란함으로써 그래디언트 계산이 아닌 시행착오를 통해 효과적으로 학습할 수 있는지 조사합니다. 이 연구는 머신러닝이 미분 가능성 요구 사항에서 벗어나 완전히 새로운 비미분 가능 모델 아키텍처를 가능하게 할 수 있는지에 대한 근본적인 질문을 탐구합니다.
Dust는 모든 토큰을 실험으로 바꿉니다
진화 전략은 오랫동안 backpropagation의 대안으로 제시되어 왔지만, 전통적으로 weight space에서 작동합니다. 이는 모델의 파라미터를 직접 교란한다는 의미이며, 손실에 미치는 영향을 평가하기 위해 각 교란된 가중치 세트마다 별도의 순방향 패스가 필요합니다. 이러한 방법은 개별 평가에 따른 계산 오버헤드로 인해 "고통스러울 정도로 느립니다."
Q Labs의 새로운 방법인 Dust는 모델의 activation space, 구체적으로는 모든 토큰 위치에서 각 레이어의 출력에 독립적인 무작위 노이즈를 주입함으로써 이 패러다임을 뒤집습니다. 가중치 변경을 추측하는 대신, Dust는 각 토큰에 대해 어떤 활성화 교란이 손실을 줄이는지 추정하고, 이러한 통찰력을 활용하여 적절한 가중치 조정을 추론합니다.
이 접근 방식은 "가상 모집단(virtual population)"을 생성합니다. 2,048개의 토큰 시퀀스를 사용한 단일 순방향 패스는 사실상 2,048개의 병렬 교란 실험을 실행하는 것과 같습니다. 특정 토큰 위치에서 손실을 낮추는 노이즈는 "보상"을 받으며, 이러한 보상 가중치가 적용된 신호들은 평균화되어 각 레이어의 그래디언트를 추정하는 데 사용됩니다.
이러한 추정된 그래디언트로부터 가중치 업데이트는 backpropagation과 동일한 메커니즘을 사용하여 계산됩니다. 결정적인 차이점은 Dust가 연쇄 법칙을 통한 미적분학이 아닌, 활성화 공간 내에서의 시행착오를 통해 그래디언트 추정치를 도출한다는 것입니다. 이 혁신적인 방법은 기존의 학습 패러다임에서 크게 벗어난 것을 의미합니다.
결과는 기이했지만, 주목할 가치가 있었습니다
Q Labs의 초기 결과는 Dust의 제한적인 승리를 보여주었습니다. 더 짧은 학습 실행(100k 및 1M 토큰)에서 Dust는 더 똑똑한 모델을 달성하는 데 있어 튜닝된 backpropagation을 능가했습니다. 더 긴 실행에서는 완전히 따라잡지는 못했지만, 더 많은 샘플이 성능 격차를 점진적으로 좁혔으며, 대규모 모집단 예산 하에서 20M 토큰일 때 외삽된 거듭제곱 법칙(power-law) 피팅 손실은 Dust가 4.43, backpropagation이 4.63을 기록했습니다.
Dust를 기존의 0차(zeroth-order) 방법론들과 비교했을 때, 그 차이는 상당했습니다. Dust는 EGGROLL이 256배 더 많은 모집단 샘플을 사용했을 때조차도 EGGROLL보다 훨씬 뛰어난 성능을 보였습니다. 이는 활성화 섭동(activation perturbations)을 통해 기울기를 추정하는 데 있어 Dust의 효율성이 우수함을 입증합니다.
가장 직관에 반하는 점은 테스트된 모델의 크기가 클수록 모집단 효율성이 더 높아 보였다는 것입니다. 이러한 스케일링 이점은 최대 2억 4,300만 개의 파라미터를 가진 모델까지 확장되었습니다. 하지만 이 실험들은 우리가 흔히 접하는 프로덕션 규모의 LLM이 아닌, modded-nanoGPT와 FineWeb 데이터셋을 기반으로 한 소규모 GPT 스타일 모델을 사용했습니다. 더 자세한 기술적 내용은 Dust: Pretraining Transformers Without Backpropagation - Q Labs에서 확인하실 수 있습니다.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
문제점: 너무 많은 비용이 드는 영리한 방법
Dust의 독창성에는 상당한 컴퓨팅 비용이 따릅니다. 토큰 수준의 병렬 처리는 혁신적이지만, 역전파(backpropagation)와 비교했을 때 전체 GPU 시간이나 FLOPs를 줄이지는 못하며, 단지 이를 재분배할 뿐입니다. Q Labs의 연구진은 Dust가 역전파보다 몇 자릿수 더 많은 컴퓨팅 자원을 필요로 한다고 명시하고 있으며, 이는 특히 테스트된 2억 4,300만 파라미터를 초과하는 모델의 경우 역전파를 직접 대체하기에는 비실용적임을 의미합니다.
Dust와 같은 미분 없는(derivative-free) 학습 방법의 단기적인 응용 분야는 역전파가 미분 가능성 요구 조건 때문에 어려움을 겪는 영역이 될 가능성이 높습니다. 여기에는 다음과 같은 미분 불가능한 구성 요소(non-differentiable components)를 포함하는 모델 학습이 포함됩니다:
- 외부 프로그램
- 복잡한 시뮬레이터
- 이산적 의사결정 모듈
- 모델 아키텍처 내의 반복적인 자기 호출
효율성 개선과 Dust의 유연성 및 역전파의 속도를 결합한 하이브리드 학습 방법(hybrid training methods)의 개발을 주목하십시오. 이러한 접근 방식은 현재 분석적 미분 가능성에 의해 제약받는 새로운 아키텍처를 실현할 수 있습니다. 메커니즘을 직접 확인하고 싶은 분들을 위해 Q Labs는 웹사이트에 상세한 연구 내용을 제공하며, GitHub에 오픈 소스 구현체를 공개하고 있습니다.
자주 묻는 질문
Dust란 무엇인가요?
Dust는 역전파를 사용하지 않고 활성화를 섭동시키고 손실 변화로부터 학습 방향을 추정하여 트랜스포머 모델을 학습시키는 실험적인 방법입니다.
Dust는 어떻게 역전파를 피하나요?
토큰 위치 전반에 걸쳐 레이어 활성화에 무작위 노이즈를 추가하고, 손실이 어떻게 반응하는지 측정한 뒤, 해당 신호들을 결합하여 업데이트를 추정합니다.
Dust가 역전파보다 성능이 뛰어난가요?
일부 짧은 학습 실행에서는 튜닝된 역전파보다 나은 성능을 보였지만, 실제 학습 규모에서 전반적인 컴퓨팅 효율성 우위를 보여주지는 못했습니다.
역전파 없는 학습이 왜 중요한가요?
표준적인 기울기 기반 학습에 깔끔하게 맞지 않는 외부 프로그램이나 시뮬레이터와 같은 미분 불가능한 연산을 포함하는 시스템을 더 쉽게 학습시킬 수 있기 때문입니다.

