인공지능(AI)이 가상 세계를 생성하는 것을 넘어, 이제는 이미 존재하는 가상 세계를 정교하게 수정하는 '월드 에디팅(World Editing)' 능력에 대한 연구가 활발히 진행되고 있습니다. 기존의 월드 모델(world model)이 환경을 만들고 그 안에서 행동하는 데 중점을 두었다면, 이번 연구는 특정 속성을 유지하면서 세계의 엔티티(entity), 역학(dynamics), 시스템(system)에 개입하는 편집 작업에 초점을 맞춥니다. 이는 AI가 단순히 새로운 것을 만드는 것을 넘어, 복잡하게 얽힌 기존 시스템을 이해하고 의도대로 변경하는 능력을 평가하는 중요한 진전입니다.
연구진은 이러한 월드 에디팅 능력을 평가하기 위해 'IGMWorld'라는 플랫폼과 'IGMBench'라는 벤치마크를 개발했습니다. 이 벤치마크는 인기 게임인 마인크래프트(Minecraft)와 테라리아(Terraria)를 기반으로 110가지 작업과 1,100개 이상의 실행 가능한 상태 및 행동 기준을 포함합니다. AI는 속성, 엔티티, 역학, 시스템 등 다양한 수준의 개입 깊이(intervention depth)를 가진 편집 작업을 수행하며, 그 결과는 결정론적 실행 가능성, 행동, 보존, 시각적 일관성 등을 통해 평가됩니다. 최신 코딩 에이전트(coding agent)는 엄격한 작업 기준에서 78.2%의 높은 성공률을 보였으며, 기준별 성능은 94.8%에 달해 AI의 상당한 월드 에디팅 잠재력을 보여주었습니다.
이번 연구는 월드 에디팅이 월드 생성 및 상호작용과는 구별되는 독자적인 AI 능력임을 명확히 보여줍니다. 특히 편집 깊이가 깊어질수록 신뢰성이 감소하는 경향이 있었고, 대부분의 실패한 편집도 성공적으로 빌드 및 로드되었지만 요청된 대로 동작하지 않는 것이 주된 어려움으로 나타났습니다. 또한 시각적 일관성은 모든 평가 구성에서 50% 미만의 낮은 합격률을 보여 여전히 개선이 필요한 부분으로 지적됩니다. 이러한 결과는 실행 가능한 게임 환경이 AI의 월드 에디팅 능력을 연구하기 위한 실용적인 테스트베드임을 입증하며, 향후 AI가 더욱 복잡한 가상 환경을 이해하고 조작하는 데 중요한 발판이 될 것입니다.