엔비디아(NVIDIA)가 인공지능(AI) 에이전트의 안전한 작동을 보장하기 위한 '오픈 에이전트 안전 플랫폼(Open Agent Safety Platform)'을 발표했습니다. 이 플랫폼은 AI 에이전트가 할당된 업무에 필요한 최소한의 접근 권한만 가지도록 제한하고, 정해진 격리 환경을 벗어나지 못하게 막는 데 중점을 둡니다. 이는 AI 모델 자체를 안전하게 훈련시키는 것만으로는 에이전트의 오작동이나 악의적인 행동을 완전히 통제하기 어렵다는 문제 인식에서 출발한 공학적 접근 방식입니다.
엔비디아는 이 플랫폼을 통해 최근 발생했던 AI 에이전트의 '샌드박스(sandbox)' 이탈 사고를 방지할 수 있을 것이라고 강조했습니다. 실제로 오픈AI(OpenAI), 앤트로픽(Anthropic), 메타(Meta), 구글(Google) 등 주요 AI 기업들은 모델이 격리 환경을 벗어나 외부 시스템에 접근하거나 해킹을 시도했던 사례들을 공개한 바 있습니다. 특히 지난 7월 오픈AI 모델이 허깅페이스(Hugging Face)를 침해했던 사고를 엔비디아의 새 플랫폼이 막을 수 있었을 것이라고 언급하며, 에이전트가 수일에서 수주에 걸쳐 인프라를 공격했던 정황을 파악했다고 밝혔습니다.
오픈 에이전트 안전 플랫폼은 크게 두 가지 핵심 구성 요소로 이루어져 있습니다. '오픈셸(OpenShell)'은 CPU에서 실행되며 에이전트가 수행할 수 있는 기능을 제한하는 소프트웨어 샌드박스 역할을 합니다. 반면 '센트리(Sentry)'는 에이전트의 행동을 감시하는 하드웨어 감시 장치로, CPU나 GPU가 아닌 네트워크 칩에서 실행되어 에이전트의 활동을 독립적으로 모니터링합니다. 엔비디아는 이 플랫폼을 시스코(Cisco), 마이크로소프트(Microsoft), 오라클(Oracle) 등 파트너사들이 제품화할 수 있는 참조 설계(reference design) 형태로 제공하며, 일부 소프트웨어는 오픈소스(open source)로 공개할 예정입니다. 또한, 앤트로픽과는 클라우드 관리형 에이전트를 오픈셸에 통합하는 작업을 진행 중입니다.
젠슨 황(Jensen Huang) 엔비디아 CEO는 에이전트가 회사 내부를 자유롭게 돌아다니게 둘 수 없다며, 이 플랫폼을