최근 텔루비안(Telluvian)이 대규모 언어모델(LLM)의 환각(hallucination) 현상을 실시간으로 탐지하고 점수를 매기는 API를 출시했습니다. 이 API는 사용자가 호출한 LLM의 각 토큰(token)에 대해 환각 가능성 점수를 제공함으로써, AI가 생성하는 정보의 신뢰성을 높이는 데 기여할 것으로 기대됩니다. 특히, GPT나 클로드(Claude)와 같은 주요 LLM들이 내부 상태를 공개하지 않는 '블랙박스(black-box)' 모델임에도 불구하고, 텔루비안의 API는 이들 모델에도 적용될 수 있다는 점이 특징입니다.
텔루비안의 접근 방식은 '화이트박스 프록시(white-box proxy) 모델'을 활용하는 것입니다. 이는 오픈소스 경량 모델(open-weight model)인 젬마-4(Gemma-4)를 프록시 모델로 사용하고, 이 모델의 내부 활성화(activation) 상태를 분석하여 환각 여부를 판단하는 방식입니다. 텔루비안은 GPT-5.4 나노(Nano)의 수십만 개 입출력 쌍 데이터셋을 통해 환각 여부를 학습시켰으며, 검증 세트에서 95% 이상의 정확도를 보였습니다. 이 API는 사용자가 기존 LLM API 호출 시 URL과 API 키만 변경하면, 원래 응답과 함께 토큰별 환각 점수를 추가 필드로 제공합니다. 예를 들어, 특정 숫자가 잘못되었을 경우 해당 숫자 토큰에 높은 환각 점수를 부여하는 식입니다.
이러한 방식은 LLM 자체를 판별 모델로 사용하는 기존 접근 방식의 한계를 극복합니다. 기존 방식은 두 개의 대규모 LLM을 동시에 실행해야 하므로 비용이 많이 들고, 응답이 모두 생성된 후에야 검증이 가능해 실시간성이 떨어지는 단점이 있었습니다. 반면 텔루비안은 경량 프록시 모델을 사용하고 추론(inference) 최적화를 통해 비용을 크게 절감했으며, 토큰이 생성되는 즉시 환각 점수를 제공하여 실시간으로 의심스러운 부분을 감지할 수 있게 합니다. 이는 AI의 신뢰성을 중요하게 여기는 기업이나 서비스 제공자에게 매우 유용한 도구가 될 것이며, AI가 생성하는 정보의 검증 과정을 효율화하는 데 중요한 역할을 할 것으로 보입니다.