최근 인공지능(AI) 분야에서 의사결정 모델의 중요성이 커지고 있는 가운데, 다양한 AI 모델들이 고전 아케이드 게임 팩맨(Pac-Man)을 통해 실시간 의사결정 능력을 겨루는 흥미로운 벤치마크 프로젝트 '제브맨(Jevman)'이 공개되었습니다. 이 프로젝트는 오픈AI(OpenAI)의 디시전스(Decisions) 엔드포인트와 클라우드플레어(Cloudflare)의 클레프(Clef) 등 최신 AI 모델들을 포함해 총 6개의 모델이 참여하여 각각 100게임씩 플레이하며 성능을 측정했습니다.
제브맨 프로젝트는 각 AI 모델이 팩맨 게임의 갈림길에 도달할 때마다 미로의 상태, 알약 위치, 유령의 움직임 등 현재 상황을 JSON 형태로 전달받아 최적의 다음 이동 방향을 2초 이내에 결정하도록 설계되었습니다. 만약 2초 안에 응답하지 못하면 단순한 백업 규칙이 적용됩니다. 이처럼 낮은 지연 시간(latency)을 요구하는 환경에서 모델들은 실시간으로 팩맨을 조작하며 유령을 피하고 알약을 먹는 복잡한 의사결정을 수행했습니다. 프로젝트는 각 모델의 평균 점수와 최고 점수를 기록한 리더보드를 공개했으며, 모든 게임은 기록되어 재현 가능하도록 하여 결과의 투명성을 확보했습니다.
이 벤치마크는 AI 모델의 실시간 의사결정 능력과 반응 속도를 객관적으로 평가할 수 있는 유용한 도구입니다. 특히, 오픈소스(open-source)로 공개되어 누구나 자신의 AI 모델을 HTTP 엔드포인트로 연결하고 벤치마크에 참여시켜 다른 모델들과 성능을 비교할 수 있다는 점이 큰 의미를 가집니다. 이는 AI 개발자들이 자신들의 모델을 실제 환경에 가깝게 테스트하고 개선하는 데 기여할 뿐만 아니라, AI 의사결정 모델의 발전과 대중화를 촉진하는 계기가 될 것으로 기대됩니다.
