최근 공개된 'Real-SWE' 벤치마크는 AI 코딩 에이전트가 실제 기업 환경에서 얼마나 유능한지 평가하기 위해 비공개 프로덕션 코드베이스와 실제 업무 과제를 사용했습니다. 이 벤치마크 결과에 따르면, 최신 AI 모델과 하네스(harness) 조합들도 실제 기업의 복잡한 시스템과 고유한 업무 규칙을 이해하고 코드를 수정하는 데 상당한 한계를 보였습니다. 가장 높은 해결률을 기록한 Fable 5.1 + Claude Code 조합도 평균 38.8%에 그쳤으며, GPT-6 Astra + Codex CLI는 33.8%로 뒤를 이었습니다. 10개 과제 중 6개는 해결률이 15% 미만이었고, 모든 과제를 완벽히 해결한 모델은 없었습니다.
Real-SWE는 기존 벤치마크와 달리 인터넷에 공개되지 않은 독점적인 기업 코드와 실제 엔지니어에게 할당되었던 경제적 가치가 있는 업무를 과제로 제시합니다. 예를 들어, 세금 청구 수정 과제는 다양한 사업자별 세율, 외부 세금 서비스 연동, 면세 고객 처리 등 복잡한 비즈니스 로직과 여러 서비스에 걸친 변경을 요구했습니다. 지시문 길이는 중앙값 1,742자였지만, 참조 솔루션이 수정한 파일 수는 중앙값 11개에 달해 단일 변경이 여러 애플리케이션 부분에 영향을 미칠 수 있음을 보여줍니다. 실패의 가장 흔한 원인은 '요구사항 누락'이었으며, 10분 미만의 짧은 실행에서도 71.4%가 실패하는 등 전반적인 난도가 높았습니다. 또한, 실행 1회당 추정 비용은 모델에 따라 2.50~6.96달러로, 실제 업무에 적용하기에는 비용 효율성 측면에서도 고려할 점이 많습니다.
이러한 결과는 AI 코딩 에이전트가 아직 실제 소프트웨어 엔지니어의 역할을 완전히 대체하기 어렵다는 현실을 명확히 보여줍니다. 특히 기업별 고유한 코딩 관례와 복잡한 비즈니스 로직, 여러 시스템에 걸친 통합적 이해는 여전히 AI가 넘어서야 할 큰 장벽입니다. 하지만 동시에 이는 AI 에이전트 기술 발전의 중요한 이정표가 될 수 있습니다. 실제 환경의 복잡성을 반영한 벤치마크를 통해 모델 개발자들은 더욱 현실적인 목표를 설정하고, 요구사항 이해, 다중 파일 수정, 통합 오류 방지 등 AI의 약점을 보완하는 데 집중할 수 있을 것입니다. 궁극적으로는 AI가 단순 코딩을 넘어 복잡한 시스템 설계와 유지보수까지 지원하는 진정한 협력 도구로 발전할 가능성을 열어줄 것입니다.