대규모 인공지능(AI) 모델을 더 작고 효율적인 모델로 만드는 지식 증류(Knowledge Distillation, KD) 기술은 서버에서 클라이언트로 AI 서비스를 제공할 때 필수적입니다. 하지만 교사(Teacher) 모델과 학생(Student) 모델 간의 능력 차이가 클 경우, 즉 서버 모델은 매우 크고 클라이언트 모델은 매우 작아야 할 때, 기존 지식 증류 방식은 성능 저하를 겪는다는 한계가 있었습니다. 이러한 문제를 해결하기 위해 'Progressive$^2$'라는 새로운 지식 증류 접근 방식이 제안되었습니다.
Progressive$^2$는 '점진적으로 강력해지는 교사'와 '점진적으로 작아지는 학생'이라는 두 가지 혁신적인 전략을 결합합니다. 교사 모델 측면에서는 모든 레이어를 동시에 증류하는 대신, 의미론적 진행(semantic progression)에 따라 점진적으로 더 많은 레이어를 선택하여 체계적인 학습 커리큘럼을 만듭니다. 또한, 교사 측 다중 특징 융합 어댑터(multi-feature fusion adapter)를 설계하여 훈련 안정성을 높였습니다. 학생 모델 측면에서는 처음부터 작은 모델을 훈련하는 대신, 네트워크 크기를 점진적으로 줄여나가며 교사 모델과 반복적으로 공동 진화(co-evolution)하도록 합니다. 이 유연한 프레임워크는 교사 모델의 점진적 전략만으로도 정확도와 훈련 효율성 사이의 최적 균형을 달성할 수 있으며, 교사와 학생의 통합은 전반적인 성능을 더욱 향상시킵니다.
이 기술은 AI 모델 압축 분야에 중요한 진전을 가져올 것으로 기대됩니다. 특히 자원 제약이 있는 엣지 디바이스(edge device)나 모바일 환경에서 대규모 AI 모델을 효율적으로 배포하고 운영하는 데 큰 도움이 될 것입니다. 모델 경량화는 서비스 품질(Quality of Service, QoS)을 개선하고, 에너지 소비를 줄이며, 실시간 추론(real-time inference) 성능을 높이는 데 기여합니다. Progressive$^2$는 이러한 이점들을 극대화하여 더 많은 AI 애플리케이션이 다양한 환경에서 실용화될 수 있는 기반을 마련할 것입니다.
