AI 에이전트의 활용이 늘면서 '프롬프트 주입(Prompt Injection)' 공격이 심각한 보안 위협으로 떠오르고 있습니다. 악의적인 프롬프트가 포함된 문서, 이메일, 웹 페이지 등으로 인해 AI 에이전트가 오작동하여 내부 시스템 명령을 실행하거나, 민감한 정보를 외부로 유출하는 등의 문제가 발생할 수 있습니다. 이러한 위협에 대응하기 위해 오픈소스 런타임 가드레일 솔루션 '모델퍼즈(ModelFuzz)'가 등장했습니다.
모델퍼즈는 AI 에이전트의 보안 취약점을 찾아내고 실시간으로 공격을 방어하는 두 가지 핵심 기능을 제공합니다. 첫째, '스캐너(Scanner)'는 오픈AI(OpenAI) 호환 엔드포인트를 대상으로 기만적인 프롬프트 주입 페이로드를 사용하여 에이전트의 취약점을 테스트합니다. 이를 통해 어떤 공격이 에이전트를 속여 특정 도구를 호출하게 만드는지 정확히 파악할 수 있습니다. 둘째, '실드(Shield)'는 에이전트가 사용하는 도구(tool) 함수에 간단한 데코레이터(decorator)를 적용하여, 함수 실행 전 모든 인수를 정책에 따라 검사합니다. 만약 정책 위반이 감지되면 함수 실행을 즉시 중단시켜 피해를 막습니다. 예를 들어, 민감한 키워드가 포함된 이메일 발송 시도를 실시간으로 차단하는 방식입니다.
기존의 프롬프트 수준 필터링은 AI 모델의 비결정적(non-deterministic) 특성 때문에 완벽한 안전을 보장하기 어려웠습니다. 모델퍼즈는 실행 계층(execution layer)에서 공격을 가로채는 방식으로, AI 에이전트가 악성 프롬프트에 속아 잘못된 결정을 내리더라도 실제 피해가 발생하기 전에 이를 막아냅니다. 이는 AI 에이전트 기반 서비스의 안정성과 신뢰성을 크게 향상시키며, 기업들이 AI를 더욱 안전하게 도입하고 활용할 수 있는 기반을 마련해 줄 것으로 기대됩니다. 모델퍼즈는 현재 호스팅 대시보드 및 중앙 집중식 정책 관리, 감사 로그, 지속적인 에이전트 스캐닝 기능을 제공하는 유료 서비스의 대기 목록을 받고 있습니다.
