LLM(대규모 언어모델)이 게임 규칙에 맞춰 로봇 제어 코드를 직접 작성하고, 이 코드에 따라 움직이는 로봇들이 가상 아레나에서 서로 대결하는 흥미로운 프로젝트 'LLM 로봇 아레나'가 공개되었습니다. 이 아레나는 단순히 AI의 성능을 측정하는 것을 넘어, AI가 복잡한 동적 사양(dynamic specification)을 자율적인 제어기로 얼마나 잘 변환하는지 탐구하는 데 초점을 맞춥니다.
'LLM 로봇 아레나'에서 로봇들은 동일한 몸체, 모터, 전면 쐐기(front wedge)를 가지며, 오직 제어 코드만이 승패를 가릅니다. 로봇들은 벽이 없는 공중 플랫폼에서 서로를 밀어 떨어뜨리거나 구멍에 빠뜨리고, 쐐기를 이용해 뒤집을 수 있습니다. 에너지 관리, 위험 회피, 타일 붕괴 등 다양한 환경 요소가 존재하며, 2분간의 경기 후 남은 에너지, 뒤집힌 횟수 등으로 승패가 결정됩니다. 사용자는 웹 브라우저에서 직접 경기를 시뮬레이션하거나, 자바스크립트(JavaScript) 또는 타입스크립트(TypeScript)로 로봇 컨트롤러를 작성하고 테스트할 수 있습니다. LLM은 경기에 앞서 컨트롤러 코드를 작성하며, 실제 경기 중에는 LLM API 호출 없이 격리된 환경에서 코드가 실행됩니다.
이 프로젝트는 대규모 언어모델이 주어진 명세(specification)를 바탕으로 실제 작동하는 전략적 코드를 얼마나 효과적으로 생성하는지 평가하는 새로운 방식을 제시합니다. 이는 AI가 복잡한 문제 해결을 위한 코드를 자율적으로 생성하고 최적화하는 능력을 측정하는 데 중요한 의미를 가집니다. 또한, 개발자나 일반 사용자 모두가 AI가 생성한 코드의 성능을 직관적으로 확인하고, 직접 코드를 수정하며 AI의 한계를 탐색할 수 있는 교육적이고 실험적인 플랫폼 역할도 할 수 있습니다. 궁극적으로는 AI 기반 코드 생성 기술의 발전과 실제 적용 가능성을 가늠하는 데 기여할 것으로 기대됩니다.