인공지능(AI) 모델 학습에 필수적인 적응형 최적화(adaptive optimizer) 기법에서, 전처리 지수(preconditioning exponent)와 전역 학습률(global learning rate) 간의 복잡한 상호작용이 새로운 연구를 통해 밝혀졌습니다. 기존에는 두 번째 모멘트 추정치(second-moment estimate)의 고정된 거듭제곱으로 매개변수화되는 전처리 지수에 대한 이해가 부족했는데, 이번 연구는 이 둘의 결합된 작용이 모델의 교차 환경 일반화(cross-environment generalization) 능력에 결정적인 영향을 미친다는 것을 보여줍니다.
공유에 장(Gongyue Zhang)과 홍하이 리우(Honghai Liu) 연구팀은 안정적인 희소 특징, 환경 의존적인 가짜 희소 특징, 밀집 특징, 고차원 노이즈를 포함하는 4가지 환경 분류 문제를 통해 통제된 교차 환경 연구를 수행했습니다. 이들은 -0.5부터 0.5까지 21개의 전처리 지수(p)와 10^-4부터 10^-2까지 5개의 학습률(eta) 조합을 테스트했습니다. 그 결과, 교차 환경 정확도를 최대화하는 전처리 지수가 학습률의 로그 값에 거의 선형적으로 감소한다는 사실을 발견했습니다. 특히 학습률이 10^-2일 때, 소스(source) 도메인 검증은 양의 지수를 선호했지만, 교차 환경 및 최악 환경 기준에서는 음의 지수가 더 높은 성능을 보였습니다.
이러한 현상은 낮은 전처리 지수(p)가 학습된 가짜-안정(spurious-to-stable) 및 노이즈-안정(noise-to-stable) 가중치 비율을 줄여주기 때문입니다. 즉, 음의 전처리 지수는 높은 학습률과 결합하여 모델이 환경 변화에 더욱 견고하게 반응하도록 돕는 '높은 스텝 크기 할당(high-step-size allocation)' 체제를 생성합니다. 이는 모델 선택 과정에서 소스 도메인 검증이 실제 환경 변화에 대한 견고성을 최대화하는 최적화 체제와 다른 결과를 선택할 수 있다는 중요한 충돌 지점을 드러냅니다. 이 연구는 단일 시드(single-seed) 및 제한된 예산으로 수행된 메커니즘 연구이므로, 광범위한 벤치마크 주장보다는 특정 조건에서의 통찰을 제공합니다. 이는 AI 모델의 일반화 성능을 높이기 위한 최적화 전략 수립에 새로운 방향을 제시할 수 있습니다.
