앤트로픽(Anthropic)이 자사의 대규모 언어모델(LLM) 클로드(Claude)가 생성하는 모든 텍스트에 워터마크(watermark)를 적용할 것이라고 발표했습니다. 이는 유럽연합(EU)의 AI 규제 준수를 위한 조치로, AI가 생성한 콘텐츠임을 식별할 수 있도록 하는 것이 목표입니다. 하지만 이 워터마킹 방식이 텍스트의 품질과 의미를 훼손할 수 있다는 비판이 제기되며 논란이 커지고 있습니다.
앤트로픽은 초기 발표에서 워터마크가 '인지할 수 없으며(imperceptible)', '의미, 품질, 가독성을 변경하지 않는다'고 주장했습니다. 그러나 실제로 적용될 방식은 스테가노그래피(steganography)의 일종으로, AI가 다음 토큰(token)을 선택할 때 '녹색(green)' 또는 '빨간색(red)' 단어 목록에서 특정 단어를 선택할 확률을 미묘하게 조작하는 방식입니다. 즉, AI는 특정 단어를 다른 단어보다 약간 더 자주 선택하도록 편향되어, 나중에 비밀 키를 가진 사람이 이 패턴을 분석해 AI 생성 여부를 확률적으로 감지할 수 있게 됩니다. 이는 마치 공정한 동전이 아닌, 앞면이 나올 확률이 51%인 동전을 던지는 것과 유사합니다. 텍스트의 길이가 길수록 AI 생성 여부 판별의 정확도는 높아지지만, 단어 선택의 미묘한 조작이 글의 본질적인 의미나 뉘앙스를 바꿀 수 있다는 우려가 나옵니다.
이러한 워터마킹 방식은 AI 생성 콘텐츠의 투명성을 높이는 데 기여할 수 있지만, 동시에 글쓰기의 순수성을 훼손할 수 있다는 중요한 문제를 제기합니다. 저자의 의도와 상관없이 AI가 특정 단어 선택에 개입함으로써, 텍스트의 자연스러운 흐름이나 미묘한 표현이 왜곡될 수 있기 때문입니다. 이는 AI 도구를 사용하는 창작자들에게 윤리적, 미학적 딜레마를 안겨줄 수 있으며, AI가 생성한 콘텐츠의 '진정성(authenticity)'에 대한 근본적인 질문을 던집니다. 향후 AI 워터마킹 기술은 투명성과 창작의 자유 사이에서 균형점을 찾아야 하는 중요한 과제에 직면할 것입니다.
