최근 깃허브(GitHub)의 300개 오픈소스 프로젝트에서 27만 건 이상의 코드 리뷰 대화를 분석한 연구 결과가 발표되었습니다. 이 연구는 인공지능(AI) 에이전트와 인간 리뷰어가 코드에 대해 어떤 피드백을 주고받고, 이것이 실제 코드 수정과 후속 대화로 어떻게 이어지는지를 비교했습니다. 핵심은 AI가 코드의 문제를 찾아 수정안을 제시하는 데 집중하는 반면, 인간은 구현 의도, 테스트 방식, 프로젝트 관례 등 맥락적 질문을 던지고 지식을 전달하는 데 능하다는 점입니다.
연구에 따르면 AI 리뷰 코멘트의 95% 이상이 코드 개선 및 결함 탐지에 집중했습니다. AI는 인간보다 훨씬 길고 많은 수정안을 제시했지만, 실제 채택률은 16.6%에 불과해 인간 리뷰어의 56.5%보다 현저히 낮았습니다. 채택되지 않은 AI 제안 중 약 28.7%는 적용 시 빌드 오류를 일으키거나 프로젝트 동작과 충돌하는 잘못된 제안이었고, 24%는 문제 지적은 맞지만 개발자가 다른 방식으로 해결한 경우였습니다. 반면 인간의 리뷰는 작성자와 여러 차례 의견을 주고받는 대화로 이어지는 경우가 많았지만, AI가 시작한 리뷰는 대부분 첫 코멘트 이후 추가 응답 없이 종료되는 경향을 보였습니다. 이는 AI가 저장소 구조나 빌드 설정을 충분히 파악하지 못해 실제로는 정상인 코드를 오류로 지적하는 한계와도 연결됩니다.
이 연구는 코드 리뷰 과정에서 AI와 인간이 각자의 강점을 살려 시너지를 낼 수 있는 방향을 제시합니다. AI는 대량의 코드 변경에서 잠재적인 결함을 빠르게 선별하고 반복적인 개선 사항을 탐지하는 '센서' 역할에 적합합니다. 반면 인간은 코드 변경의 의도와 설계 이유를 확인하고, 프로젝트 고유의 맥락과 과거 결정 사항을 적용하며, 지식을 전달하고 최종 해결 여부를 판단하는 '판단자' 역할에 집중해야 합니다. AI 리뷰의 품질을 높이려면 저장소의 빌드 설정, 과거 리뷰 이력, 프로젝트 관례 등을 활용하고, 불필요하게 긴 설명보다는 짧고 검증된 문제점만 전달하도록 개선이 필요합니다. 궁극적으로 인간과 AI의 협업을 통해 더 효율적이고 고품질의 코드 리뷰 프로세스를 구축할 수 있을 것입니다.