AI 코딩 에이전트가 개발자의 의도와 달리 치명적인 명령을 실행하여 데이터베이스를 삭제하거나 API 키를 유출하는 등의 사고를 일으킬 위험이 있습니다. 이러한 문제를 해결하기 위해 AI 감시견을 자처하는 보안 시스템 '도베르만(Doberman)'이 등장했습니다. 도베르만은 AI 에이전트의 입력, 출력, 그리고 도구(tool) 호출을 실시간으로 감시하여 위험한 명령이 실행되기 전에 차단하는 역할을 합니다. 이는 기존 AI 가드레일이 제공하는 '조언' 수준의 보호를 넘어, 실제 실행 경로에서 직접 개입하여 사고를 미연에 방지하는 강력한 보안 솔루션입니다.
도베르만은 두 가지 계층의 보안 시스템으로 작동합니다. 첫 번째 계층은 최신 보안 가이드라인에 기반한 확정적(deterministic) 규칙으로, 미리 정의된 위험 패턴을 즉시 감지하고 차단합니다. 두 번째 계층은 동적(dynamic) 학습 시스템으로, 사용자의 특정 환경과 선호도를 학습하여 보안 정책을 자동으로 강화합니다. 이 시스템은 에이전트와 실제 도구(파일 시스템, 셸, API 등) 사이에 투명한 프록시(proxy) 또는 호스트 훅(hook) 형태로 위치하며, 모든 도구 호출을 명시적이고 감사 가능한 결정으로 전환합니다. 그 결과, '통과(PASS)', '승인 필요(AUTH)', '차단(BLOCK)' 세 가지 판정 중 하나가 내려지며, '차단' 판정 시에는 해당 명령이 절대로 실행되지 않습니다. 특히, 불확실하거나 오류가 발생한 경우에도 기본적으로 '차단'을 선택하는 '실패 폐쇄(fail closed)' 원칙과, 보안 정책이 자동으로 강화될 수만 있고 약화될 수 없는 '강화 전용(raise-only)' 학습 방식을 채택하여 견고함을 더했습니다.
이러한 도베르만의 등장은 AI 에이전트의 활용이 늘어남에 따라 중요해지는 보안 문제에 대한 실질적인 해결책을 제시합니다. 기존 AI 가드레일이 89% 정도의 위험 명령만 막는다고 할 때, 이는 10번 중 한 번은 침입자를 허용하는 것과 마찬가지입니다. 도베르만은 이러한 틈새를 메워 AI 에이전트가 개발 환경에서 더 안전하게 작동할 수 있도록 돕습니다. 클로드 코드(Claude Code), 코덱스(Codex) 등 다양한 AI 코딩 에이전트와 호환되며, 오픈소스(open-source)로 제공되어 개발자들이 자유롭게 활용하고 기여할 수 있다는 점도 큰 장점입니다. 1인 개발자나 스타트업이 AI 에이전트를 활용한 서비스를 구축할 때, 잠재적인 보안 위협을 최소화하고 안정적인 운영 환경을 확보하는 데 필수적인 도구가 될 것으로 기대됩니다.