인공지능(AI) 모델이 특정 결과를 예측할 때, 그 예측이 얼마나 신뢰할 수 있는지 나타내는 것이 바로 '확률 교정(probability calibration)'입니다. 예를 들어, AI가 어떤 환자가 질병에 걸릴 확률을 80%로 예측했다면, 실제로 그 예측이 80%의 정확도를 보여야 신뢰할 수 있는 모델이라고 할 수 있습니다. 하지만 대부분의 기존 교정 방법론은 모델을 교정하는 데 사용되는 데이터(calibration data)의 레이블이 완벽하게 깨끗하다는 낙관적인 가정을 전제로 합니다. 현실에서는 약한 주석자, 과거의 결정, 휴리스틱, 또는 원거리 감독(distant supervision) 등 다양한 이유로 레이블에 노이즈가 포함되는 경우가 많으며, 이는 모델의 예측 신뢰도를 떨어뜨리는 주된 원인이 됩니다.
이러한 문제를 해결하기 위해 Zeming Liu 외 연구진은 'LWCal(Loss-Weighted Calibration)'이라는 새로운 사후 교정기(post-hoc calibrator)를 제안했습니다. LWCal은 기본 모델의 예측 확률과 일치하지 않는 노이즈 낀 레이블을 가진 교정 데이터에 낮은 가중치를 부여함으로써, 노이즈의 영향을 줄여 예측 신뢰도를 높입니다. 특히 이 방법은 깨끗한 검증 레이블(validation label)이나 노이즈 비율에 대한 사전 추정 없이 작동하며, 기본 분류기(base classifier)를 재학습할 필요가 없어 효율적입니다. 또한, 'Gated-LWCal'이라는 변형 모델은 교정 데이터가 매우 일관성이 없을 때 원시 점수(raw score)로 되돌아가는 보수적인 불일치 게이트(disagreement gate)를 추가하여 안정성을 높였습니다. 이 기술은 CPU 환경에서만 작동하며, 테이블 형식 데이터 분류(tabular classification)에 특화되어 있습니다.
연구팀은 9가지 이진 테이블 형식 작업(binary tabular tasks)과 다양한 노이즈 조건에서 LWCal과 Gated-LWCal의 성능을 평가했습니다. 그 결과, LWCal은 평균 교정 오차(Expected Calibration Error, ECE)를 가장 낮게 달성했으며, Gated-LWCal은 적절한 점수(proper score) 간의 최적의 균형을 제공했습니다. 특히 Gated-LWCal은 무작위 포레스트(random forest) 모델 연구에서 ECE를 0.188에서 0.122로, 음의 로그 우도(Negative Log Likelihood, NLL)를 0.438에서 0.396으로 크게 개선했습니다. 이는 기존의 Platt, Isotonic, Beta 교정 방식보다 우수한 성능을 보여주며, 실제 AI 배포 환경에서 모델의 예측 신뢰도를 높이는 데 중요한 기여를 할 것으로 기대됩니다. 이러한 개선은 의료 진단, 금융 사기 탐지 등 예측 신뢰도가 중요한 분야에서 AI 모델의 실용성을 크게 향상시킬 수 있습니다.
