최근 구글 딥마인드(Google DeepMind) 연구진이 인공지능(AI) 모델 학습의 핵심인 역전파(backpropagation) 과정 없이 트랜스포머(Transformer)를 사전학습(pre-training)할 수 있는 0차 최적화(zero-order optimization) 방법 'Dust'를 발표했습니다. 이는 각 토큰(token)의 활성값에 독립적인 잡음(noise)을 더하고 손실 감소량을 보상으로 삼아 그래디언트(gradient)를 추정하는 방식으로, 대규모 탐색을 통해 역전파에 근접하거나 특정 조건에서는 더 낮은 손실을 달성할 수 있음을 보여주었습니다.
Dust는 '가상 집단(virtual population)'이라는 독특한 방식을 사용합니다. 이는 각 토큰을 독립적인 탐색 개체처럼 활용하여, 가중치를 개체마다 복제할 필요 없이 한 번의 순전파(forward pass)로 수천 개의 개체를 병렬 평가할 수 있게 합니다. 기존의 가중치 공간 탐색 방식인 EGGROLL-Transformer보다 훨씬 효율적이며, 100만 토큰 이상에서는 효율 차이가 약 1,000~10,000배에 달합니다. 특히, 2억 4,300만 파라미터(parameter)의 대규모 모델에서 더 효율적인 결과를 보여, 모델 크기가 커질수록 집단 크기 대비 성능이 우수해지는 경향을 확인했습니다. 이는 'The Bitter Lesson'처럼 충분한 연산량이 투입되면 미분 가능성이라는 제약 없이도 더 나은 결과를 얻을 수 있다는 철학을 반영합니다.
Dust의 등장은 AI 학습의 유연성을 크게 높일 잠재력을 가집니다. 역전파는 미분 가능성을 요구하며, 이 제약이 기존 신경망 구조와 최적화기, 하드웨어 발전을 이끌어왔습니다. 하지만 Dust는 이러한 제약에서 벗어나 더 유연한 탐색 기반의 기여도 할당(credit assignment)을 가능하게 하여, 일반화 성능 개선으로 이어질 수 있습니다. 아직은 역전파보다 훨씬 많은 연산량이 필요해 실용적인 대체제로 보기는 어렵지만, 효율성을 여러 자릿수 규모로 개선한다면 미래 AI 학습의 중요한 대안이 될 수 있습니다. 이는 미분 불가능한 시스템이나 복잡한 환경에서도 AI를 학습시킬 수 있는 새로운 길을 열어줄 것입니다.