최근 한 개발팀이 AI 에이전트를 활용해 1인칭 슈팅 게임을 C++ 코드로 재구성하는 대규모 프로젝트를 성공적으로 마쳤습니다. 약 3개월 동안 5천억 토큰 이상을 소모하며 진행된 이 프로젝트는 전체 함수의 99%를 복원하고, 그중 83%는 원본과 바이트 단위로 완벽하게 일치하는 놀라운 성과를 보여주었습니다. 이는 AI 에이전트가 복잡하고 장기적인 개발 작업을 자율적으로 수행할 수 있음을 입증하는 중요한 사례입니다.
프로젝트 초기에는 AI 에이전트가 가독성 좋은 코드를 생성했지만, 함수 시그니처, 타입, 구조체 레이아웃 오류와 임의 변경된 로직 등 의미적으로 부정확한 문제가 많았습니다. 이에 개발팀은 원본과 재컴파일 결과를 비교해 PASS/FAIL을 반환하는 '검증 하네스(verification harness)'를 도입했습니다. 이 시스템은 모호한 목표를 기계적으로 검증 가능한 작업으로 전환했으며, 엄격한 합격 기준과 정확한 피드백 덕분에 Luna, Opus 5.5 등 비교적 저렴한 모델도 효과적으로 활용할 수 있게 되었습니다. 또한, 에이전트의 컨텍스트 이탈 문제를 해결하기 위해 매시간 지침 문서를 다시 읽도록 주입하는 방식을 사용해 자율 작업의 집중도를 유지했습니다.
이 프로젝트는 AI 에이전트의 잠재력을 보여줌과 동시에, 장기 자율 작업에서 '정확성'을 어떻게 정의하고 달성할 것인지에 대한 중요한 교훈을 남겼습니다. 단순히 읽기 좋은 코드를 넘어, 원본과 바이트 단위 일치를 목표로 한 검증 하네스 도입은 AI 에이전트가 복잡한 리버스 엔지니어링(reverse engineering) 작업에서도 높은 수준의 정확도를 달성할 수 있음을 증명했습니다. 이는 향후 오래된 소프트웨어의 현대화, 보안 취약점 수정, 다른 플랫폼으로의 이식 등 다양한 분야에서 AI 에이전트의 활용 가능성을 크게 확장할 것으로 기대됩니다. 다만, 프로젝트 팀은 게임명과 코드를 공개하지 않고 개인 용도로만 사용할 예정이라고 밝혔습니다.