최근 ‘어텐션으로부터의 구조(Structure from Attention)’라는 연구에서 트랜스포머 모델의 어텐션 메커니즘이 이미지 간의 3D 공간 기하학적 구조를 이해하는 데 핵심적인 역할을 한다는 흥미로운 결과가 나왔습니다. 이는 대규모 언어모델(LLM)에서 언어적 맥락을 파악하는 데 주로 사용되던 어텐션이 시각 분야에서도 예상치 못한 깊은 통찰력을 제공함을 시사합니다.
연구는 MAST3R, VGGT, DA3, Deja View와 같은 최신 비전 트랜스포머(Vision Transformer) 모델을 분석했습니다. 특히 VGGT 아키텍처를 기반으로 한 실험에서, 모델이 여러 이미지에 걸쳐 3D 점 대응(3D point correspondences)을 스스로 학습하는 능력이 확인되었습니다. 기존에는 복잡한 동시적 위치 추정 및 지도 작성(SLAM) 시스템이 필요했던 작업들을 이제 단일 순방향 전달(single forward pass)만으로 처리할 수 있게 된 것입니다. 연구진은 어텐션 행렬을 분석하여 특정 패치(patch)가 다른 이미지의 어떤 패치를 '주목'하는지 정량적으로 측정했습니다. 그 결과, 모델의 중간 레이어, 특히 14번째 레이어에서 3D 대응점을 찾아내는 능력이 무작위(chance) 대비 약 250배나 높아지는 현상을 발견했습니다. 이는 시각적 유사성(visual similarity)이 아니라 실제 3D 공간의 기하학적 대응을 어텐션이 파악하고 있음을 의미합니다.
이러한 발견은 인공지능(AI)이 3D 환경을 인지하고 이해하는 방식에 혁명적인 변화를 가져올 수 있습니다. 기존의 수많은 수작업 규칙과 복잡한 파이프라인으로 구성된 컴퓨터 비전(Computer Vision) 시스템을 대체하여, 모델이 데이터로부터 직접 3D 공간 정보를 학습하게 될 가능성이 열린 것입니다. 이는 자율주행, 로봇 공학, 증강 현실(AR) 등 3D 공간 이해가 필수적인 분야의 발전을 가속화할 것으로 기대됩니다. 또한, 모델이 '무엇을 주목하는지'를 분석함으로써 AI의 의사결정 과정을 더 잘 이해하고 제어할 수 있는 기반을 마련할 수 있습니다.
