최근 발표된 연구에 따르면, 인공지능(AI) 에이전트 시스템에서 새로운 형태의 보안 위협인 '스킬 캐스케이딩 공격(skill cascading attacks)'이 발견되었습니다. 이 공격은 여러 개의 스킬(skill)이 연쇄적으로 작동하여 악의적인 목표를 달성하는 방식으로, 각 스킬은 개별적으로는 무해해 보이지만, 함께 실행될 때 심각한 피해를 유발할 수 있습니다.
'스킬'은 자연어 지시, 실행 가능한 스크립트, 참조 자료 등을 포함하는 모듈형 패키지로, AI 에이전트가 특정 작업을 위해 런타임에 로드하여 기능을 확장하는 데 사용됩니다. 연구진은 이러한 스킬 기반 에이전트 시스템의 개방성이 새로운 공격 표면을 만든다고 지적하며, '스킬 캐스케이딩 공격'을 체계적으로 연구하기 위해 자동화된 다중 에이전트 레드팀 프레임워크인 'SkillCascade'와 213개의 검증된 캐스케이딩 테스트 사례 벤치마크인 'SkillCascade-Bench'를 개발했습니다. 이들은 OpenClaw, Claude Code, Codex 등 대표적인 에이전트와 대규모 언어모델(LLM) 백본을 대상으로 실험한 결과, 캐스케이딩 상호작용이 기존의 개별 스킬 스캐너나 런타임 모니터를 회피하면서 유해한 행동을 유발한다는 사실을 확인했습니다. 예를 들어, 처방전 검토 파이프라인에서 첫 번째 스킬이 최근 중단된 약물 신호를 약화시키고, 두 번째 스킬이 해당 약물 상호작용의 심각도를 낮추며, 세 번째 스킬이 최종 요약에서 낮은 우선순위 경고를 억제하여, 심각한 약물 상호작용 경고가 의사에게 도달하기 전에 조용히 사라지게 할 수 있습니다.
이 연구 결과는 구성 요소 수준의 무결성(integrity)과 시스템 수준의 안전성(safety) 사이에 존재하는 간극을 명확히 보여줍니다. 기존 보안 방식은 개별 스킬의 취약점에 초점을 맞췄지만, 스킬 간의 상호작용에서 발생하는 위험은 간과되었습니다. 따라서 이번 연구는 개별 스킬이 아닌 스킬 간의 상호작용을 추론하는 방어 메커니즘의 필요성을 강조하며, AI 에이전트 시스템의 전반적인 안전성을 확보하기 위한 새로운 보안 패러다임의 전환을 요구하고 있습니다. 이는 AI 에이전트가 더욱 복잡하고 상호 연결된 작업을 수행하게 될 미래에 필수적인 고려 사항이 될 것입니다.
