고위험 환경에서 인공지능(AI) 기반 자동화 시스템을 안전하게 배포하는 것은 중요한 과제입니다. 특히 자율 에이전트 AI(Agentic AI)는 확률적 추론에만 의존할 경우, 추론이 깊어질수록 시스템 행동이 전문가가 설정한 안전 운영 제약 조건을 벗어나는 '인식론적 표류(epistemic drift)' 위험에 직면할 수 있습니다. 이러한 문제를 해결하기 위해 'BRaVeS'(Bounded Reasoning and Verifiable Safety)라는 새로운 프레임워크가 제안되었습니다.
BRaVeS는 '방어 가능한 차세대 추론 시스템(Defensible Next-Gen Reasoning System, DNRS)'으로 불리며, 세 가지 핵심 메커니즘을 통해 AI의 안전성을 확보합니다. 첫째, 전문가(SME)가 정의한 제약 조건을 '불변 앵커(invariant anchors)'로 인코딩하여 AI 추론 과정에서 항상 참조하도록 합니다. 둘째, MoDA-Style(Mixture of Depths Attention)이라는 깊이 인식 접근 방식을 통해 추론 중에도 이 앵커들이 가시성을 유지하도록 돕습니다. 셋째, 'SMARtAutonomy'라는 상태 계층 구조를 사용하여 인식론적 위험이 증가할수록 AI의 자율성(autonomy)을 감소시킵니다. 또한, '리아푸노프 경계 합의 프레임워크(Lyapunov-Bounded Consensus Framework, LBCF)'를 도입해 연속적인 인식론적 위험 신호를 유한한 추상화로 매핑하고, 안전한 상태 전환을 강제하거나 시스템을 인간 개입이 필요한 최종 상태로 라우팅하여 예측 불가능한 상황을 방지합니다.
이 연구는 BRaVeS 프레임워크가 산업 제어 시스템 시계열 데이터를 사용한 이산 이벤트 몬테카를로 시뮬레이션에서 유한 단계 수렴을 달성하고 안전 가드 위반이 없었음을 보여주었습니다. 이는 추상화된 조건 하에서 제한된 거버넌스 행동이 강제될 수 있음을 시뮬레이션 기반으로 입증한 것입니다. 이러한 결과는 고위험 산업(예: 자율주행, 의료, 국방)에서 AI 시스템의 신뢰성과 안전성을 높이는 데 중요한 의미를 가집니다. 향후 배포된 트랜스포머(transformer) 구현, 실시간 인간 개입(human-in-the-loop) 검증, 그리고 광범위한 적대적 환경에서의 추가 연구가 필요할 것입니다. 이 기술은 AI의 잠재력을 최대한 활용하면서도 인간의 통제와 안전을 보장하는 데 기여할 수 있습니다.