최근 발표된 연구에 따르면, 인공지능(AI)이 이미지 간의 유사성을 판단하는 방식이 고정된 코사인 유사도(cosine similarity)를 넘어, 맥락에 따라 유연하게 달라질 수 있음을 보여주었습니다. 이는 '앵커 다이버전스(Anchor Divergence)'라는 새로운 접근 방식을 통해 가능해졌으며, 대조 학습(Contrastive Learning) 기반의 벡터 표현(vector representations)이 본질적으로 다양한 기하학적 구조를 내포하고 있음을 밝혀냈습니다.
이 연구의 핵심은 대조 학습, 지수족(exponential families), 그리고 정보 기하학(information geometry)의 상호작용을 활용하여, '앵커(anchors)'에 대한 확률 분포와 표현 공간(representation space)의 브레그만 기하학(Bregman geometries) 사이에 대응 관계를 설정하는 것입니다. 이를 통해 연구진은 고정된 표현 공간 내에서 맥락별 의미론적 기하학(semantic geometries)을 지정하는 '앵커 다이버전스'를 정의했습니다. 즉, 앵커 분포를 모델링하는 것이 곧 기하학 자체를 모델링하는 것이 되어, 두 이미지가 동일한 객체를 나타내거나, 시각적 스타일을 공유하거나, 특정 임상 소견과 관련이 있는 등 다양한 맥락에 따라 유사성을 다르게 측정할 수 있게 됩니다.
이러한 맥락 의존적인 유사성 측정 방식은 이미지 검색, 추천 시스템, 의료 영상 분석 등 다양한 분야에서 혁신적인 변화를 가져올 수 있습니다. 예를 들어, 특정 스타일의 이미지를 찾을 때는 스타일 유사성에 가중치를 두고, 특정 질병과 관련된 의료 이미지를 찾을 때는 임상적 특징 유사성에 집중하는 등 사용자나 애플리케이션의 요구에 맞춰 AI의 판단 기준을 정교하게 조절할 수 있습니다. 이는 기존의 단일하고 고정된 유사성 측정 방식이 가졌던 한계를 극복하고, AI 시스템이 더욱 인간의 직관에 가까운 판단을 내릴 수 있도록 돕는 중요한 진전으로 평가됩니다.