최근 연구에 따르면, 대규모 언어모델(LLM)이 생성하는 텍스트에 삽입되는 워터마크(watermark)가 단순히 출처를 식별하는 기능을 넘어, AI 에이전트(AI agent)의 행동 방식 자체를 변화시킬 수 있는 잠재력을 가진 것으로 나타났습니다. 이는 워터마크가 AI 생성 콘텐츠의 진위 여부 판별을 넘어, AI의 의사결정 과정에 미묘한 영향을 미쳐 특정 작업을 수행하거나 회피하도록 유도할 수 있음을 의미합니다.
워터마킹은 LLM이 텍스트를 생성할 때 특정 패턴이나 정보를 은밀하게 삽입하는 기술입니다. 예를 들어, 특정 단어 선택 확률을 조작하거나 문장 구조에 미세한 변화를 주어 인간이 인지하기 어렵게 만듭니다. 이번 연구는 이러한 워터마크가 적용된 LLM을 기반으로 작동하는 AI 에이전트가, 워터마크가 없는 LLM 기반 에이전트와는 다른 방식으로 행동할 수 있음을 보여주었습니다. 이는 워터마크가 에이전트의 내부 추론(inference) 과정에 영향을 미쳐, 주어진 목표를 달성하기 위한 전략 선택이나 정보 처리 방식에 변화를 가져올 수 있다는 분석입니다.
이러한 발견은 AI의 책임감과 통제 가능성 측면에서 중요한 의미를 가집니다. 워터마크가 AI 에이전트의 행동을 조작하거나 유도하는 데 사용될 수 있다면, 이는 AI의 자율성에 대한 새로운 논의를 촉발할 것입니다. 긍정적으로는 유해하거나 편향된 AI 행동을 예방하고, 특정 윤리적 가이드라인을 준수하도록 유도하는 도구로 활용될 수 있습니다. 반면, 악용될 경우 AI 에이전트의 행동을 은밀하게 통제하여 의도치 않은 결과를 초래할 위험도 존재합니다. 앞으로 워터마킹 기술의 발전과 함께 AI 에이전트의 행동 제어 및 감사(auditing) 방식에 대한 심도 깊은 연구와 논의가 필요할 것으로 보입니다.