AI가 생성하는 콘텐츠가 늘어나면서 품질 관리의 중요성이 커지고 있습니다. 특히 대규모 언어모델(LLM)로 만들어진 위키 페이지의 경우, 사람이 모든 내용을 검수하기 어렵다는 문제가 있습니다. 이에 한 개발자가 타입세이프(TypeSafe)의 판정 모델 제브(Jev)를 활용해 LLM 위키의 불량 페이지를 자동으로 선별할 수 있는지 실험했습니다.
제브(Jev)는 자연어 질문에 보정된 확률 값을 반환하는 모델로, '이 페이지에 결함이 있는가?'와 같은 질문에 0에서 1 사이의 점수를 부여합니다. 개발자는 비공개 및 공개 LLM 위키 두 곳에 제브를 적용하여 불량 페이지 선별 능력을 측정했습니다. 그러나 실험 결과, 제브는 기대했던 역할을 수행하지 못했습니다. 비공개 위키는 결함 페이지 비율이 약 44%로 너무 높아 선별의 의미가 없었고, 공개 위키는 심각한 결함이 6.5%에 불과했지만 자잘한 흠은 거의 모든 페이지에 있어 점수로 유의미하게 걸러낼 신호가 부족했습니다. 이는 마치 돌이 너무 많거나 거의 없는 쌀에서 조리질이 무의미한 것과 같은 상황입니다.
이번 실험은 특정 도구의 성능 자체보다는, 도구가 유용하게 활용될 수 있는 '맥락'의 중요성을 보여줍니다. 제브와 같은 선별 도구는 결함이 '어디에나' 있지도 '아무 데도' 없지도 않은, 즉 중간 정도의 결함이 섞여 있을 때 가장 큰 가치를 발휘합니다. 따라서 어떤 선별 도구를 도입하기 전에 해당 데이터의 결함 기저율(baseline rate)을 정확히 파악하는 것이 필수적입니다. 이 교훈은 AI 생성 콘텐츠의 품질 관리를 고민하는 모든 이들에게 중요한 시사점을 제공합니다. 제브 모델 자체는 다양한 지식 업무에서 여전히 유용할 수 있으며, 적절한 환경에서 활용될 때 그 진가를 발휘할 것입니다.