최근 발표된 논문에서 이미지 속 텍스트를 인식하는 OCR(광학 문자 인식) 시스템의 정확도를 획기적으로 개선할 수 있는 새로운 학습 방법론 'GAD-RL(Gated and Attenuated On-Policy Distillation)'이 소개되었습니다. 기존 비전-언어 모델(Vision-language models) 기반 OCR은 이미지 내의 비정상적인 텍스트(예: 오타, 비문)를 언어적으로 그럴듯한 표현으로 자동 수정하는 경향이 있어, 원본 텍스트를 그대로 옮겨야 하는 OCR의 '충실도(faithfulness)'를 떨어뜨리는 문제가 있었습니다.
GAD-RL은 이러한 문제를 해결하기 위해 학생 모델(student model)의 학습 진행 상황에 따라 교사 모델(teacher model)의 지도(supervision) 강도를 조절하는 적응형 증류(adaptive distillation) 방식을 사용합니다. 연구진은 고정된 교사 모델의 지도가 학생 모델의 성능 향상에 따라 점차 비효율적이 된다는 점에 착안했습니다. GAD-RL은 학생 모델의 현재 작업 성능과 지역 분포(local distributions)에 맞춰 증류 과정을 동적으로 조절합니다. 예를 들어, 학생 모델의 작업 보상(task reward)이 0.95 이상인 경우 증류를 비활성화하고, 그룹 평균 보상이 증가함에 따라 증류 강도를 지속적으로 약화시킵니다. 또한, 교사 모델의 Top-1 토큰에 대한 학생 모델의 확률을 가중치로 사용하여, 학생 모델이 해당 후보에 대한 지지도가 낮을 때는 보조 업데이트(auxiliary updates)를 완화합니다.
이러한 적응형 학습 전략을 통해 GAD-RL은 Qwen3.5-2B 모델에서 CHAOS-Bench 기준 59.92%의 마이크로 리콜(Micro Recall)을 달성했습니다. 이는 기존의 GRPO 및 GRPO+OPD(고정 가중치) 방법론보다 각각 8.45%p, 4.43%p 높은 수치입니다. 또한 OmniDocBench v1.6에서는 91.18의 종합 점수(Overall score)를 기록하며 뛰어난 성능을 입증했습니다. 이 연구는 OCR 시스템이 단순히 텍스트를 인식하는 것을 넘어, 원본 이미지의 의미를 왜곡하지 않고 정확하게 보존하는 것이 얼마나 중요한지를 보여주며, 향후 OCR 기술 발전의 중요한 전환점이 될 것으로 보입니다. 특히, 문서 디지털화, 자동 번역, 접근성 기술 등 다양한 분야에서 더욱 신뢰할 수 있는 텍스트 처리 환경을 제공할 수 있을 것입니다.