최근 연구진이 설명 가능한 인공지능(XAI) 기술을 이용해 대규모 언어모델(LLM)의 안전 필터가 어떻게 작동하는지 밝혀내고, 이를 우회하여 유해한 콘텐츠를 생성하도록 유도하는 방법을 시연했습니다. 이는 LLM의 안전성 확보에 있어 중요한 취약점을 드러낸 것으로, 현재의 안전 메커니즘이 완벽하지 않음을 보여줍니다.
연구팀은 XAI 기법 중 하나인 '활성화 지도(activation map)'를 활용해 LLM 내부에서 안전 필터가 활성화되는 특정 뉴런과 패턴을 식별했습니다. 이 정보를 바탕으로, 모델이 유해한 응답을 생성하려 할 때 안전 필터가 이를 감지하고 차단하는 과정을 역설계할 수 있었습니다. 예를 들어, 특정 단어나 구문이 안전 필터를 발동시키는 트리거임을 파악한 후, 이를 미묘하게 변형하거나 우회하는 방식으로 필터를 무력화하여 모델이 유해한 지시에도 응답하게 만들었습니다.
이번 연구 결과는 LLM 개발자들이 안전 필터의 작동 방식을 더욱 깊이 이해하고, 이를 기반으로 더 견고하고 우회하기 어려운 방어 체계를 구축해야 함을 시사합니다. 단순히 필터를 추가하는 것을 넘어, XAI를 통해 필터의 취약점을 선제적으로 파악하고 보완하는 접근 방식이 필요합니다. 이는 LLM의 윤리적이고 안전한 사용을 보장하기 위한 필수적인 단계이며, AI 안전 연구의 새로운 방향을 제시합니다.