비전 트랜스포머(Vision Transformer, ViT)가 '분노'와 같은 추상적인 개념을 학습하는 방식에 대한 새로운 연구 결과가 발표되었습니다. 훈련 데이터에 직접적인 참조 증거가 부족할 때, ViT는 구체적이고 해석 가능한 '앵커 개념'(예: '불')을 통해 시각적 신호를 추상적 의미에 연결하는 '환유적 접지(metonymic grounding)' 메커니즘을 사용한다는 가설이 제시되었습니다. 이는 AI가 복잡한 추상적 사고를 어떻게 수행하는지에 대한 이해를 한 단계 높이는 중요한 발견입니다.
연구팀은 CLIP과 DINO 비전 인코더에 트랜스코더(Transcoder)를 적용하여 이 과정을 분석했습니다. 이를 통해 모델 내부에서 보다 구체적인 개념(예: '불')과 연관될 수 있는 중간 특징들을 추출하고, 이러한 특징들이 추상 개념 인식 회로에서 어떻게 기여하는지 추적했습니다. 엄선된 아이콘 데이터셋을 활용한 실험 결과, 지각적 원시 요소(perceptual primitives)가 초기 레이어를 지배하고, 객체와 유사한 앵커 개념들이 추상적 목표에 선행하는 구조화된 환유적 회로(metonymic circuits)가 밝혀졌습니다. 특히 텍스트가 렌더링된 이미지는 지각-텍스트 경로를 따로 활용하는 것으로 나타났습니다. 인과적 개입(causal interventions)을 통해 이러한 환유적 중간 개념들이 추상 개념 접지에 기능적으로 관여한다는 사실도 검증되었습니다.
이번 연구는 인공지능, 특히 비전 트랜스포머가 인간처럼 추상적인 개념을 이해하고 추론하는 방식에 대한 깊이 있는 통찰을 제공합니다. 이는 단순히 이미지를 인식하는 것을 넘어, 이미지에 담긴 복잡한 의미와 감정을 파악하는 AI 시스템 개발에 기여할 수 있습니다. 예를 들어, 특정 상황이나 감정을 시각적으로 이해하고 반응해야 하는 자율주행, 로봇 공학, 콘텐츠 분석 등 다양한 분야에서 더욱 정교하고 신뢰할 수 있는 AI 모델을 구축하는 데 중요한 기반이 될 것입니다. 궁극적으로는 AI의 설명 가능성(explainability)을 높여, 왜 AI가 특정 결정을 내렸는지 이해하는 데 도움을 줄 수 있습니다.