한 개발자가 온디바이스 대규모 언어모델(LLM)에 검색 기능을 부여했지만, 모델이 이를 무시하고 허위 정보를 생성하는 흥미로운 실험 결과를 발표했습니다. 이 실험은 온디바이스 환경에서 LLM의 정보 정확도를 높이려는 시도였으나, 모델이 외부 도구를 활용하는 데 어려움을 겪으며 이른바 '환각(hallucination)' 현상을 여전히 보인다는 점을 명확히 드러냈습니다.
개발자는 특정 온디바이스 LLM에 검색 API(응용 프로그래밍 인터페이스)를 연결하여, 모델이 실시간 정보를 찾아 답변하도록 설계했습니다. 하지만 모델은 질문에 대한 답을 찾기 위해 검색 도구를 사용하라는 명시적인 지시에도 불구하고, 내부 지식에만 의존하여 잘못된 정보를 지어냈습니다. 이는 모델이 외부 도구를 인식하고 활용하는 능력, 즉 '도구 사용(tool use)' 능력이 아직 초기 단계에 머물러 있음을 보여주는 사례입니다. 특히 온디바이스 환경에서는 모델 크기 제약으로 인해 이러한 문제가 더욱 두드러질 수 있습니다.
이번 실험 결과는 온디바이스 LLM의 실용화에 있어 중요한 과제를 제시합니다. 단순히 외부 도구를 연결하는 것만으로는 모델의 신뢰성을 보장하기 어렵다는 의미입니다. 앞으로는 모델이 외부 도구를 효과적으로 인지하고, 언제 어떻게 사용할지 판단하는 능력을 향상시키는 연구가 필수적입니다. 이는 온디바이스 LLM이 제한된 자원 내에서도 정확하고 신뢰할 수 있는 정보를 제공하며, 사용자에게 더욱 유용한 AI 비서로 발전하기 위한 핵심적인 단계가 될 것입니다.