인공지능(AI) 모델이 내린 예측의 이유를 사람이 직관적으로 이해할 수 있도록 돕는 '시각적 반사실적 설명(Visual Counterfactual Explanations, VCE)' 기술이 주목받고 있습니다. 특히 의료와 같이 안전이 매우 중요한 분야에서 AI 모델의 의사결정 과정을 투명하게 보여주는 것은 필수적입니다. 최근 스위스 연구진은 기존 확산 모델 기반 VCE의 한계를 극복한 새로운 프레임워크 'C-VCE'를 발표하며, AI 설명 가능성(explainability)을 한 단계 끌어올렸습니다.
기존 확산 모델 기반 VCE는 이미지에 미세한 변화를 주어 AI 예측이 바뀌는 지점을 찾아내는데, 이 과정에서 외부 분류기(external classifier)에 의존했습니다. 문제는 이 분류기가 노이즈가 많은 이미지에 대해 안정적으로 작동하기 어렵다는 점이었습니다. 하지만 C-VCE는 '개념 병목 계층(concept bottleneck layer)'을 통해 분류기를 확산 모델 내부에 직접 통합합니다. 이를 통해 사용자는 사람에게 친숙한 '개념(concepts)'을 기반으로 반사실적 설명을 유도할 수 있으며, 모델은 관련 이미지 영역만 최소한으로 조정하면서도 예측을 뒤집는 변화를 만들어냅니다. 또한, 변화를 최소화하고 원본 이미지와 유사성을 유지하기 위한 확률적 정규화(probabilistic regularizer)와 관련 영역에만 수정을 제한하는 마스크(mask)를 적용하여 정교함을 더했습니다.
C-VCE는 벤치마크 테스트에서 기존 방식과 동등하거나 더 나은 예측 변경률을 보이면서도, 생성된 반사실적 이미지가 원본에 훨씬 가깝고 왜곡이 적다는 장점을 입증했습니다. 이는 사용자가 추가적인 노이즈 강건 분류기에 대한 신뢰 없이도 구체적인 '가상 시나리오(what-if)' 이미지를 얻을 수 있게 해줍니다. 이 연구는 강력한 생성 모델(generative model)의 내부 개념 계층을 노출하고 제어하는 것이 모델 이해도를 높이고 안전하게 활용하는 유망한 방법임을 시사하며, AI 시스템의 투명성과 신뢰성을 높이는 데 중요한 진전으로 평가됩니다.
