최근 발표된 '드리프트 계약(The Drift Contract)' 연구는 딥러닝 모델 훈련의 오랜 난제였던 '깊이에 따른 정확도 저하'와 '하이퍼파라미터(hyperparameter) 민감성'을 해결할 혁신적인 접근법을 제시했습니다. 이 연구는 각 계층(layer)을 독립적으로 훈련하는 지역 학습(local learning) 방식에 스펙트럼 업데이트(spectral update) 기법을 적용하여, 모델의 깊이가 깊어져도 안정적인 성능을 유지하는 데 성공했습니다.
연구팀은 뮤온(Muon) 스타일의 스펙트럼 업데이트 기하학(momentum orthogonalization with spectral step scaling)을 계층별 지역 업데이트에 적용했습니다. CIFAR-10 MLP 벤치마크 테스트 결과, 이 방식은 모델 너비(width) 128에서 2048, 깊이(depth) 12에서 48까지 단일 스텝 사이즈(step-size) 설정으로도 최상의 성능을 보였습니다. 반면, 기존의 지역 아담(local Adam) 옵티마이저는 깊이가 48에 도달하자 성능이 급격히 저하되었으며, 각 깊이마다 하이퍼파라미터를 재조정해야 하는 번거로움이 있었습니다. 특히, 스펙트럼 업데이트는 깊이 48에서 42.7%의 정확도를 달성한 반면, 지역 아담은 재조정 후에도 31.3%에 그쳤습니다. 또한, 이 연구는 각 계층의 가중치(weight) 변화를 입력값에 따라 제한하는 '드리프트 계약'이라는 새로운 스텝 사이즈(step size) 공식을 도입하여 학습 속도(learning rate)를 더욱 해석 가능하게 만들고, 표준 옵티마이저가 제공하지 못하는 계층별 드리프트 경계(drift bound)를 제공합니다.
이 '드리프트 계약' 방식은 딥러닝 모델 훈련의 효율성과 안정성을 크게 향상시킬 잠재력을 가지고 있습니다. 특히, 각 계층을 독립적으로 훈련함으로써 구조적으로 병렬 처리가 가능해져, 대규모 모델 훈련 시간을 단축하고 컴퓨팅 자원 활용을 최적화할 수 있습니다. 이는 복잡하고 깊은 인공지능(AI) 모델을 개발하는 데 있어 중요한 진전이며, 하이퍼파라미터 튜닝(tuning)에 드는 시간과 노력을 줄여 연구자와 개발자에게 더 큰 자유를 제공할 것입니다. 다만, RMSNorm과 가중치 감소(weight decay)가 적용된 경우 스펙트럼 업데이트의 안정성 이점이 전역 학습(global training)에 집중되는 경향이 있어, 정규화(normalization)가 없는 환경에서 지역 학습의 이점이 극대화된다는 점은 고려해야 합니다.
