yozm.tech
피드로 돌아가기
arXiv (cs.AI)HOTAI 재작성

Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution

자율 에이전트 AI가 파일을 수정하거나 메시지를 보내는 등 위험한 행동을 할 수 있다는 우려가 커지고 있습니다. 이에 아담 마조케티(Adam Mazzocchetti) 연구원은 AI의 행동을 통제하는 런타임 거버넌스 시스템 '에이비스(Aegis)'를 제안했습니다. 에이비스는 AI의 모든 행동 제안을 신뢰할 수 있는 결정 계층에서 검토해 위험한 부작용을 원천 차단합니다. 이 시스템은 샌드박스 환경에서 위험한 행동을 성공적으로 방지하며 안전성을 입증했습니다.

6시간 전·2026.08.19·읽기 1·Adam Mazzocchetti

최근 대규모 언어모델(LLM) 기반의 자율 에이전트(Agentic AI) 시스템이 빠르게 발전하면서, AI가 단순히 텍스트를 생성하는 것을 넘어 실제 환경에서 파일을 수정하거나 메시지를 전송하고 작업을 실행하는 등 다양한 도구(tool)를 직접 사용하는 단계에 이르렀습니다. 이는 AI의 유용성을 크게 높이지만, 동시에 의도치 않거나 해로운 운영상 부작용을 일으킬 수 있다는 새로운 안전성 문제를 야기합니다. 기존의 프롬프트(prompt) 수준의 제어 방식으로는 이러한 실행 경계를 효과적으로 설정하기 어렵다는 한계가 있었습니다.

이러한 문제를 해결하기 위해 아담 마조케티(Adam Mazzocchetti) 연구원은 런타임 거버넌스 시스템 '에이비스(Aegis)'를 제안했습니다. 에이비스는 자율 에이전트 AI의 출력을 단순한 실행 명령이 아닌 '행동 제안(action proposals)'으로 간주하고, 이를 신뢰할 수 있는 결정 계층(trusted decision layer)을 통해 중재합니다. 즉, AI는 행동을 제안할 뿐이고, 에이비스 런타임이 이를 평가하고 최종 실행 여부를 결정하는 구조입니다. 에이비스는 활성화된 정책 상태에 따라 제안을 평가하고, 출처(provenance)를 서버 측에서 확인하며, 불확실한 상황에서는 '실패 시 폐쇄(fail-closed)' 원칙을 적용해 잠재적 위험을 차단합니다. 또한, 특정 중요 사안에 대해서는 '상원(Senate) 스타일 합의'와 같이 다수결 기반의 비일방적 승인 경로를 거치도록 설계되었습니다.

연구팀은 에이비스를 샌드박스 환경에서 5가지 실행군, 42가지 작업, 3가지 조건에 대해 각각 10회 반복하는 방식으로 총 6,300건의 테스트를 진행했습니다. 그 결과, 기존 프롬프트 정책만 적용한 비교군에서는 79건의 위험한 정보 유출이 발생했지만, 에이비스가 적용된 2,100건의 테스트에서는 위험한 모의 도구(mock-tool) 적용이나 위험한 부작용 완료가 단 한 건도 기록되지 않았습니다. 에이비스를 통해 시도된 모든 행동 제안(1,832건)은 신뢰할 수 있는 출처가 보존되었고, 상원 스타일 합의를 거친 1,019건의 제안은 모두 정족수와 최종 서명 증거를 확보했습니다. 이러한 결과는 에이비스가 자율 에이전트의 런타임 행동 경계 거버넌스를 통해 관찰된 위험한 제안이 실제 부작용으로 이어지는 것을 효과적으로 방지했음을 시사합니다.

에이비스와 같은 런타임 거버넌스 시스템은 자율 에이전트 AI의 실질적인 배포와 활용에 있어 필수적인 안전 장치로 평가됩니다. AI가 더욱 복잡하고 중요한 작업을 수행하게 될 미래에는 AI의 자율성에 대한 신뢰를 확보하는 것이 무엇보다 중요합니다. 에이비스는 AI의 유해한 행동을 사전에 차단함으로써, 기업과 사용자가 AI 에이전트를 안심하고 업무 환경에 통합할 수 있는 기반을 제공합니다. 이는 AI 기술의 발전과 더불어 책임감 있는 AI 개발 및 운영의 중요성을 강조하며, AI 안전성 연구의 새로운 방향을 제시하는 중요한 진전입니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
3/10
약한 신호
3점인가

AI 에이전트의 안전성 문제는 중요하지만, 런타임 거버넌스 시스템은 고도의 기술력과 보안 전문성을 요구하며, 1인 창업자가 진입하기에는 시장이 아직 형성되지 않았고 기술적 난이도가 높습니다.

문제 / 미충족 수요

자율 에이전트 AI가 실제 환경에서 파일을 수정하거나 메시지를 보내는 등 위험한 행동을 할 수 있어, 안전한 통제 시스템이 필요합니다.

한국 시장
국내 불명한국에서도 AI 에이전트 활용이 늘어날수록 안전성 및 규제 준수 문제가 중요해질 것이지만, 아직 초기 단계입니다.
수익 모델

B2B SaaS 구독, API 종량제 · 돈 내는 주체: AI 에이전트를 개발하거나 운영하는 기업, 특히 규제 산업에 속한 기업

1인 실현 가능성
2/5

AI 에이전트 시스템 자체의 복잡성과 보안, 규제 준수 요구사항을 고려할 때 1인이 개발하기에는 기술적, 법적 장벽이 높습니다.

진입 지점 (Wedge)

특정 산업(예: 금융, 의료)의 규제 준수 요구사항이 높은 AI 에이전트 시스템에 대한 런타임 거버넌스 솔루션 제공

이번 주 첫 실험

AI 에이전트 개발자 커뮤니티에서 어떤 종류의 '위험한 행동'에 대한 통제 요구가 가장 높은지 설문조사 및 인터뷰를 통해 파악하기

Original source
이 글은 arXiv (cs.AI)의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기