AI 글쓰기가 보편화되면서, 단순히 문법적으로 올바른 것을 넘어 조직의 고유한 목소리(voice)와 편집 기준을 충족하는지 평가하는 것이 중요해졌습니다. 이러한 요구에 맞춰, AI가 작성한 초안의 스타일을 로컬에서 결정론적으로 검사할 수 있는 오픈소스 도구 'writing-eval'이 매제스틱 랩스(Majestic Labs)에 의해 공개되었습니다. 이 도구는 AI 생성 콘텐츠가 기업의 브랜드 가이드라인이나 특정 저자의 스타일을 얼마나 잘 따르는지 측정하는 데 중점을 둡니다.
'writing-eval'은 참조 문서를 분석하여 재사용 가능한 스타일 프로필을 구축합니다. 예를 들어, 특정 작가의 게시물 디렉토리를 입력하면 해당 작가의 글쓰기 스타일 프로필을 생성할 수 있습니다. 이후 AI가 작성한 초안(Markdown 또는 일반 텍스트 파일)을 이 프로필과 비교하여 명확성, 가독성, 문장 리듬, 어휘, 그리고 감지된 글쓰기 패턴의 차이점을 구체적인 증거와 함께 보고서로 제공합니다. 모든 과정은 CPU에서 로컬로 실행되며, 외부 호스팅 모델을 호출하거나 소스 자료를 업로드하지 않으므로 데이터 보안과 일관된 결과 도출이 가능합니다. 또한, 대규모 언어모델(LLM) 에이전트와 연동하여 자동화된 스타일 검사 워크플로우를 구축할 수도 있습니다.
이 프로젝트는 AI 생성 콘텐츠의 일관된 평가라는 난제를 해결하려는 시도입니다. AI가 만든 글은 문법적으로 완벽하더라도 조직의 목소리나 선호하는 구조, 편집 제약을 놓칠 수 있습니다. 'writing-eval'은 이러한 기대치를 측정 가능한 프로세스로 전환하여, 프롬프트, 모델, 참조 코퍼스 또는 규칙 세트 변경 후에도 동일한 검사를 반복 실행하며 개선 또는 퇴보 여부를 확인할 수 있게 합니다. 이는 AI 워크플로우에서 '허용 가능한 작업'에 대한 회사 자체의 정의를 구축하는 데 중요한 역할을 하며, AI 시대에 기업 콘텐츠의 품질과 일관성을 유지하려는 팀에게 필수적인 도구가 될 것으로 보입니다.