앤트로픽(Anthropic)의 최신 대규모 언어모델(LLM)인 클로드 3(Claude 3)가 인공지능(AI)이 생성한 텍스트에 워터마크를 적용하기 시작했습니다. 이는 AI가 만든 콘텐츠를 식별하고 잠재적인 오용을 방지하기 위한 중요한 시도로, 텍스트 자체에 미묘한 패턴을 심어 AI 생성 여부를 판별할 수 있도록 하는 기술입니다. 이러한 워터마크는 일반 사용자의 눈에는 보이지 않지만, 특정 분석 도구를 통해 그 출처를 확인할 수 있습니다.
클로드 3의 워터마크 기술은 텍스트 내 단어 선택이나 구문 구조에 미세한 통계적 편향을 부여하는 방식으로 작동합니다. 예를 들어, 특정 단어의 사용 빈도를 조절하거나 문장 부호의 배치를 미묘하게 변경하는 등, 사람이 인지하기 어려운 수준의 패턴을 삽입하는 것입니다. 이는 텍스트의 의미나 가독성에 영향을 주지 않으면서도, AI가 생성한 콘텐츠임을 식별할 수 있는 디지털 지문을 남기는 효과를 가집니다. 앤트로픽은 이러한 워터마크가 콘텐츠의 진위 여부를 판단하는 데 도움이 될 것으로 기대하고 있습니다.
이러한 AI 텍스트 워터마크 기술은 딥페이크(deepfake)나 가짜 뉴스 확산 등 AI 오용 문제를 해결하려는 광범위한 노력의 일환입니다. AI 생성 콘텐츠의 투명성을 높여 사회적 신뢰를 구축하고, 책임감 있는 AI 사용 환경을 조성하는 데 기여할 수 있습니다. 하지만 이 기술이 완벽하지 않다는 점도 인지해야 합니다. 텍스트를 편집하거나 변형하는 과정을 거치면 워터마크가 손상되거나 제거될 가능성이 있으며, 이는 기술의 한계로 지적됩니다. 따라서 워터마크는 하나의 도구일 뿐, AI 콘텐츠의 진위를 판별하는 유일한 수단으로 보기는 어렵습니다.