인공지능(AI)이 소프트웨어 개발의 패러다임을 바꾸면서 코드 생성 속도가 비약적으로 빨라졌습니다. 하지만 사람이 코드를 읽고 검토하는 속도는 그대로여서, 코드 리뷰(Code Review) 시스템에 심각한 병목 현상이 발생하고 있습니다. AI가 코드를 더 잘 쓰게 된 것보다, 사람이 감당할 수 없을 정도로 코드가 빠르게 만들어지는 것이 더 근본적인 변화로 지적됩니다.
실제로 파로스 AI(Faros AI)가 4,000개 팀, 22,000명의 개발자 데이터를 분석한 결과, AI 도입도가 높은 팀일수록 코드 리뷰 소요 시간이 441.5% 증가했으며, 리뷰 없이 병합(merge)된 풀 리퀘스트(PR)도 31.3% 늘어났습니다. 이는 AI가 직접적인 원인이라기보다, 늘어난 코드 생성량을 리뷰어가 따라가지 못해 발생한 현상으로 해석됩니다. 기존 코드 리뷰는 버그 검출 외에도 유지보수성 확인, 지식 공유, 게이트키핑, 책임 분산 등 다양한 역할을 담당해왔는데, 이 모든 것을 사람이 늘어난 코드량 앞에서 감당하기 어려워진 것입니다.
이러한 문제를 해결하기 위해 AI가 1차 코드 리뷰를 담당하는 도구들이 등장하고 있습니다. 앤트로픽(Anthropic) 내부 측정에 따르면 AI 도입 후 실제 리뷰를 받는 PR 비율이 16%에서 54%로 증가했으며, 깃허브(GitHub)에서도 플랫폼 리뷰 5건 중 1건 이상에 AI 에이전트가 관여하고 있습니다. 하지만 인간과 AI는 다른 방식으로 리뷰를 수행합니다. 한 연구에 따르면 AI 리뷰 코멘트의 95% 이상이 코드 개선과 결함 탐지에 집중하는 반면, 인간은 구현 의도, 테스트 방식, 저장소 관례 등 코드 외부의 맥락을 질문하고 대화합니다. AI가 제안한 수정안의 채택률은 16.6%로 인간 리뷰어의 56.5%보다 현저히 낮았으며, AI가 시작한 리뷰의 85% 이상은 추가 응답 없이 종료되는 경향을 보였습니다.
이는 AI 리뷰어가 결함 후보를 넓게 탐지하는 '센서' 역할에 가깝고, 인간 리뷰어는 코드의 맥락과 의도를 파악하며 대화를 통해 지식을 공유하고 책임을 분산하는 '판단자' 역할에 가깝다는 것을 시사합니다. 단순히 AI 리뷰어를 도입하는 것만으로는 좋은 리뷰 시스템을 만들 수 없으며, 어떤 변경에 AI를 배치하고, 사람이 언제 개입하며, 프로젝트 맥락을 어떻게 AI에 제공할지가 중요합니다. 또한, 코드 작성 이후의 검토뿐만 아니라 스펙, 계획, 제약조건 등 코드 생성 이전 단계에서 사람이 개입하여 '의도'를 명확히 하는 방식도 대안으로 제시됩니다.
결론적으로 AI 시대의 코드 리뷰는 사람과 AI 중 누가 더 잘 리뷰하는가의 대결이 아니라, 검증, 이해, 지식 전달, 승인, 책임 등 코드 리뷰가 맡아온 다양한 역할을 누구에게 어떻게 나눌 것인가의 문제입니다. AI는 코드 내부의 결함을 빠르게 찾아내는 데 강점을 보이지만, 코드 외부의 맥락을 이해하고, 팀원 간의 지식을 공유하며, 최종적인 책임 판단을 내리는 역할은 여전히 인간의 몫입니다. 좋은 코드 리뷰는 학습하고 가르칠 수 있는 기술이며, 단순히 버그를 찾는 것을 넘어 사고 과정을 공유하고 팀의 경험으로 남기는 대화의 장이 되어야 할 것입니다.