최근 연구 결과에 따르면, 여러 대규모 언어모델(LLM)이 서로 협력하여 작업을 수행하는 다중 에이전트 시스템이 외부의 은밀한 공격에 매우 취약할 수 있다는 우려가 제기되었습니다. 이러한 시스템은 각 에이전트가 특정 역할을 맡아 복잡한 문제를 해결하는 방식으로 작동하는데, 공격자가 특정 에이전트의 행동을 미묘하게 조작하여 전체 시스템의 의사결정을 왜곡시킬 수 있다는 것입니다.
연구팀은 LLM 기반 다중 에이전트 시스템의 내부 작동 방식을 분석하여 이러한 취약점을 발견했습니다. 특히, 공격자가 시스템의 최종 결과물에 직접적인 영향을 미 주지 않으면서도, 에이전트 간의 정보 교환이나 추론 과정에 개입하여 시스템의 신뢰성을 저하시킬 수 있음을 보여주었습니다. 이는 마치 팀원 중 한 명이 은밀히 잘못된 정보를 흘려 전체 팀의 판단을 흐리게 하는 것과 유사합니다. 이러한 공격은 기존의 단순한 입력 조작 방식보다 탐지하기 훨씬 어렵다는 특징이 있습니다.
이번 연구는 LLM 기반 다중 에이전트 시스템의 보안을 강화하기 위한 새로운 접근 방식의 필요성을 강조합니다. 단순히 최종 출력물만을 검증하는 것을 넘어, 시스템 내부의 에이전트별 상호작용과 추론 과정을 면밀히 모니터링하고 분석하는 기술이 필수적입니다. 이는 자율주행, 금융 거래, 국방 등 민감한 분야에 LLM 기반 AI 시스템이 도입될 때 발생할 수 있는 심각한 위험을 예방하고, AI 시스템의 전반적인 신뢰성과 안정성을 확보하는 데 중요한 시사점을 제공합니다.