사이버 보안 기업 체크포인트(Check Point) 연구진이 대규모 언어모델(LLM)을 공격하는 새로운 방식인 '퍼즐마스크(PuzzleMask)'를 공개했습니다. 이 기법은 겉보기에는 평범한 문장처럼 보이지만, 그 안에 악의적인 명령어나 데이터를 교묘하게 숨겨 AI 모델이 예상치 못한 방식으로 작동하도록 유도합니다. 이는 기존의 프롬프트 주입(prompt injection) 공격보다 탐지하기 훨씬 어렵다는 특징을 가집니다.
퍼즐마스크 공격은 텍스트 내에 특정 단어나 구문의 순서를 바꾸거나, 미묘한 문법적 오류를 삽입하거나, 심지어 보이지 않는 특수 문자를 활용하는 등 다양한 방식으로 악성 프롬프트를 은닉합니다. 예를 들어, 특정 단어의 철자를 살짝 틀리게 하거나, 문장 부호를 비정상적으로 사용하여 LLM이 이를 정상적인 텍스트로 인식하게 하면서도, 내부적으로는 악성 명령을 처리하도록 만드는 것입니다. 이러한 방식은 사람이 읽었을 때는 자연스러워 보이지만, AI 모델에게는 특정 지시로 해석될 수 있어 보안 시스템의 탐지를 회피하기 용이합니다.
이러한 공격은 LLM 기반의 챗봇이나 AI 비서가 오해의 소지가 있는 정보를 생성하게 하거나, 민감한 데이터를 유출하게 하거나, 심지어 외부 시스템에 대한 접근 권한을 탈취하는 데 사용될 수 있습니다. 퍼즐마스크는 AI 모델의 신뢰성을 근본적으로 훼손하며, 기업과 사용자 모두에게 심각한 보안 위협을 초래할 수 있습니다. AI 시스템 개발자들은 이러한 새로운 유형의 공격에 대비하여 모델의 견고성을 강화하고, 입력값 검증 및 이상 탐지 시스템을 고도화하는 노력이 시급합니다.