딥러닝 모델 학습의 표준 최적화 알고리즘인 아담(Adam)이 이론적으로 가장 효율적인 자연 경사 하강법(Natural Gradient Descent, NGD)과 어떤 기하학적 관계를 가지는지에 대한 연구가 발표되었습니다. 이 연구는 아담의 전체 업데이트 규칙을 모멘텀(momentum)을 포함하여 분석했으며, 아담이 실제 NGD 경로에서 얼마나 벗어나는지를 정량적으로 측정했습니다.
연구팀은 아담의 작동 방식을 대각 피셔 정보 행렬(diagonal empirical Fisher approximation)의 근사치로 보고, 대각선 절단, 경험적 레이블 대체, 시간 지연 등의 요소를 고려했습니다. 스케일 불변(scale-invariant) 지표인 $\gamma(\Delta\theta)$를 사용하여 선형 회귀, 로지스틱 회귀, 비볼록(non-convex) 소규모 신경망 등 네 가지 손실 함수(loss landscape)에서 아담의 기하학적 편차를 측정했습니다. 그 결과, 아담의 궤적은 환경에 따라 달라지는데, 조건이 좋은(well-conditioned) 환경에서는 편차가 낮았지만, 조건이 나쁜(ill-conditioned) 환경에서는 편차가 크게 증가하여 신경망에서는 약 1,000배의 불일치를 보였습니다. 이러한 기하학적 편차가 클수록 초기 최적화 속도는 느려졌지만, 최종 손실 값(loss minimization)을 달성하는 데는 영향을 미치지 않았습니다.
이 연구는 아담의 강력한 실용적 최적화 성능이 NGD 경로를 정밀하게 추적하기보다는, 구조적 근사 오차와 모멘텀 스무딩(momentum smoothing)의 균형에서 비롯될 수 있음을 시사합니다. 또한, 개선된 경험적 피셔(iEF)가 표준 경험적 피셔(EF)보다 더 안정적인 경로를 추적하며, EF는 종종 진동하거나 발산하는 경향을 보였습니다. 이는 아담이 완벽한 이론적 경로를 따르지 않더라도, 실제 딥러닝 모델 학습에서 효과적인 이유를 설명하는 중요한 단서가 됩니다.
