AI 코딩 에이전트가 제안하는 명령을 인간이 승인하거나 거부하는 시뮬레이션 게임에서, 플레이어들은 평균적으로 위협적인 명령 3개 중 1개를 놓치는 것으로 분석되었습니다. 4만 회 이상의 게임 플레이와 40만 건 이상의 결정을 분석한 결과, 위협 탐지 정확도는 66.3%에 그쳐 인간의 승인이 AI 시스템의 최종 보안 경계 역할을 제대로 수행하기 어렵다는 점이 드러났습니다.
가장 명백한 파괴 명령(예: rm -rf /)의 누락률은 11.7%로 비교적 낮았지만, 자격 증명(credentials) 접근 시도와 같은 '범위 위반'은 35.0%로 훨씬 자주 놓쳤습니다. 특히 'npm run'과 같이 흔히 사용되는 스크립트 명령 뒤에 숨겨진 악성 코드는 절반 이상(52.5%)이 승인되어 심각한 사각지대를 보여주었습니다. 플레이어들은 시간 압박 속에서 명령을 검토했으며, 세션 후반으로 갈수록 위협 누락률이 다시 높아지고 안전한 명령까지 과도하게 차단하는 '승인 피로'와 '과잉 차단' 현상도 함께 나타났습니다. 이는 실제 개발 환경에서도 빠른 출시 압력과 복잡한 컨텍스트 부족이 성급한 승인으로 이어질 수 있음을 시사합니다.
이러한 결과는 AI 에이전트의 보안에 있어 인간의 개입(human-in-the-loop)만으로는 충분하지 않다는 중요한 교훈을 제공합니다. 개발자들은 에이전트에 넓은 권한을 부여하기 전에 샌드박싱(sandboxing)과 엄격한 컨텍스트 격리(context isolation)와 같은 기술적 보호 장치를 먼저 갖춰야 합니다. 인간은 모든 변경 사항의 맥락을 항상 파악하기 어렵고, 짧은 시간 안에 위험을 정확하게 판단하기 어렵기 때문에, 인간 승인을 최후의 방어선으로 의존하는 것은 위험할 수 있습니다. 대신, 다양한 위험 유형과 완화 전략, 그리고 각 전략의 장단점을 더 깊이 이해하는 것이 중요하며, 기술적 안전장치를 통해 에이전트의 잠재적 위험을 최소화하는 데 집중해야 합니다.