최근 한 연구에서 GPT-5.6 루나(Luna) 모델이 GPT-6 아스트라(Astra) 모델과 비교하여 코드 리뷰에서 놀라운 비용 효율성을 입증했습니다. 공개된 50개의 풀 리퀘스트(PR)를 분석한 결과, 루나는 아스트라가 발견한 버그 수의 75%를 단 3.6%의 비용으로 찾아냈습니다. 이는 루나가 일반적인 코드 정확성 버그 검토에 매우 경제적인 대안이 될 수 있음을 시사합니다.
구체적으로, 루나는 69개의 검증된 버그를 발견했으며, 아스트라는 92개를 찾아냈습니다. PR당 리뷰 비용은 루나가 0.0041달러, 아스트라가 0.113달러로 약 28배의 차이를 보였습니다. 하지만 정확도 측면에서는 아스트라가 우위를 점했습니다. 루나의 지적 중 24%가 잘못된 내용이었던 반면, 아스트라는 4%만이 틀렸습니다. 특히 인증 및 권한과 같은 보안에 민감한 코드에서는 루나가 24개의 보안 버그 중 9개를 찾은 데 비해, 아스트라는 19개를 찾아내며 더 높은 신뢰도를 보였습니다. 흥미로운 점은 두 모델이 서로 다른 유형의 버그를 발견하기도 한다는 것입니다. 루나만 찾은 버그가 25개였으며, 두 모델을 병행하여 사용하면 총 5.86달러의 비용으로 전체 검증된 버그 143개 중 117개(82%)를 발견할 수 있었습니다.
이러한 결과는 개발팀이 AI 기반 코드 리뷰 솔루션을 도입할 때 비용과 성능 사이의 균형을 어떻게 가져갈지 중요한 시사점을 제공합니다. 일반적인 코드 품질 향상에는 루나와 같은 저비용 모델이 충분히 효과적일 수 있지만, 보안이나 복잡한 로직 검토에는 아스트라와 같은 고성능 모델을 활용하거나 두 모델을 병행하는 전략이 필요합니다. 특히, AI 모델의 비결정적 출력 특성과 학습 데이터 중복 가능성, 그리고 완전한 버그 목록의 부재는 실제 프로덕션 환경에서 AI 코드 리뷰를 적용할 때 추가적인 검증과 신중한 접근이 필요함을 보여줍니다. 궁극적으로는 AI 에이전트가 코드 변경 사항뿐만 아니라 저장소 이력, 호출 그래프, 프로덕션 데이터 등 전체 맥락을 이해하고 리뷰 강도를 조절하는 방향으로 발전할 것으로 예상됩니다.