최근 발표된 논문에서 딥러닝 모델 학습에 널리 사용되는 최적화 기법인 아담(Adam)과 같은 적응형 모멘트 추정(adaptive moment estimation) 메커니즘의 동작을 보다 깊이 이해하기 위한 새로운 '신뢰 영역 프레임워크'(trust-region framework)가 개발되었습니다. 이 프레임워크는 확률적 경사 하강법(stochastic gradient optimization)에서 각 개별 가중치(weight)의 업데이트 크기를 특정 '신뢰 영역' 내로 제한하는 방식을 제안합니다.
이 신뢰 영역은 2차에서 4차 사이의 모멘트(moment) 제약에 의해 결정되며, 이를 통해 2차 모멘트 추정 및 정규화된 p차 모멘트 추정에 기반한 새로운 학습률(learning-rate) 메커니즘군이 도출됩니다. 특히 p가 4일 때는 첨도(kurtosis)와 유사한 추정 방식이 사용됩니다. 이 일반화된 메커니즘을 'Gmake'라고 부르며, 이는 모멘트 추정을 통한 정규화, 학습률 스케줄링, 운동량(momentum)으로서의 스펙트럼 저역 통과 필터링, 그리고 연산자 수준의 스펙트럼 정규화 등을 하나의 신뢰 영역 프레임워크 내에서 통합적으로 해석할 수 있는 기반을 제공합니다.
GPT2-124M 모델을 FineWeb-Edu 및 TinyStories 데이터셋으로 학습시킨 실험 결과, 4차 모멘트 활용 방식은 신뢰 영역 제약이 약할 때 가장 큰 이점을 제공하는 것으로 나타났습니다. 반면, 신뢰 영역 제어가 점진적으로 강해질수록 2차 모멘트 활용 방식이 경쟁력을 갖추며, 때로는 4차 모멘트 방식보다 약간 더 낮은 검증 손실(validation loss)을 달성하기도 했습니다. 이는 최적화 과정에서 모멘트 추정의 차수와 신뢰 영역 제어 강도 간의 복잡한 상호작용이 있음을 시사합니다.