텐센트 ARC 랩과 베이징대학교 연구진이 단 한 장의 이미지 또는 텍스트 설명만으로 사용자가 자유롭게 탐색할 수 있는 AI 세계를 생성하는 새로운 영상 월드 모델 '월드크래프터(WorldCrafter)'를 발표했습니다. 이 모델은 카메라 움직임에 따라 실시간으로 새로운 장면을 생성하면서도, 사용자가 시선을 돌렸다가 돌아왔을 때 이전에 본 사물과 공간을 정확히 기억하고 복원하여 긴 탐색 과정에서도 높은 일관성을 유지하는 것이 핵심입니다.
월드크래프터의 핵심 기술은 '3D 인식 메모리'입니다. 이 메모리는 과거에 관찰한 여러 시점의 정보를 통합하고, 다음에 생성할 장면에 필요한 기억만을 선별하여 영상 생성기에 전달합니다. 이는 단순히 최근 프레임을 이어 붙이는 방식과 달리, 이전에 본 공간과 사물 정보를 보존하면서도 현재의 움직임을 자연스럽게 이어갈 수 있도록 돕습니다. 140억 개의 매개변수를 가진 기본(Base) 모델과 고속 추론을 위한 빠른(Fast) 모델이 제공되며, 이미지 기반 생성과 텍스트 기반 생성은 물론, 여러 이미지를 입력하여 새로운 시점의 영상을 만드는 기능도 지원합니다. 공개된 데모를 통해 사용자는 키보드로 카메라를 조작하며 생성된 가상 세계를 직접 탐색할 수 있습니다.
이러한 기술은 기존의 영상 생성 모델들이 긴 시퀀스에서 일관성을 유지하기 어렵다는 한계를 극복합니다. 사용자가 가상 세계를 탐색하며 다른 방향을 살펴본 뒤 원래 시점으로 돌아오거나, 움직이는 대상을 따라가는 상황에서도 장면의 연속성을 보장합니다. 이는 몰입감 있는 가상현실(VR) 및 증강현실(AR) 콘텐츠 제작, 게임 환경 디자인, 시뮬레이션 등 다양한 분야에서 혁신적인 변화를 가져올 잠재력을 가집니다. 다만, 현재 월드크래프터는 학술 연구 목적으로만 사용이 허용되며 상업적 이용 및 프로덕션 배포는 금지되어 있습니다.