Q 랩스(Q Labs) 연구진이 딥러닝의 핵심 학습 알고리즘인 백프로파게이션(Backpropagation) 없이 트랜스포머 언어 모델을 사전 학습(pretraining)할 수 있는 새로운 0차(zeroth-order) 방법론 '더스트(Dust)'를 발표했습니다. 이는 현대 신경망 훈련의 근간을 이루는 백프로파게이션의 한계를 극복하고, 방대한 연산 자원을 활용하여 더 유연하고 확장 가능한 학습 방식을 제시한다는 점에서 주목할 만합니다.
더스트는 가중치(weight) 대신 활성화(activation)에 교란(perturbation)을 가하고, 손실(loss)을 얼마나 줄이는지에 따라 각 교란에 보상(reward)을 부여한 뒤, 이 보상 가중치 교란을 평균하여 경사(gradient)를 추정합니다. 특히, 각 토큰(token)을 가상 개체(virtual population member)로 간주하여 한 번의 순방향 전달(forward pass)로 모든 토큰을 병렬 평가함으로써, 기존 진화 전략(Evolution Strategies, ES) 방식보다 10^3~10^4배 더 효율적입니다. 놀랍게도 더스트는 모델 규모가 클수록 개체 효율성(population-efficiency)이 높아지는 경향을 보였으며, 2억 4천 3백만 개 매개변수(parameter) 모델이 120배 작은 모델보다 더 나은 성능을 발휘했습니다.
이러한 연구 결과는 딥러닝 학습의 '쓴 교훈(Bitter Lesson)'을 상기시킵니다. 즉, 특정 편향(inductive bias)에 의존하기보다 충분한 연산 자원을 활용하는 일반적인 방법론이 결국 승리한다는 것입니다. 백프로파게이션은 미분 가능성(differentiability)이라는 제약 때문에 탐색할 수 있는 아키텍처(architecture) 공간을 제한할 수 있습니다. 더스트는 이러한 제약을 벗어나 연산 중심의 무차별 대입(brute-force computation) 방식을 통해 더 넓은 탐색 공간을 열어주고, 이는 궁극적으로 모델의 일반화(generalization) 능력을 크게 향상시킬 잠재력을 가지고 있습니다. 컴퓨팅 파워가 계속 증가하는 시대에 더스트와 같은 0차 방법론은 딥러닝의 미래를 바꿀 중요한 전환점이 될 수 있습니다.