대화형 대규모 언어모델(LLM) 에이전트들이 웹 검색에 점점 더 의존하고 있지만, AI 에이전트의 웹 검색 전 과정은 아직 제대로 이해되지 않고 있습니다. 최근 발표된 연구는 챗GPT(ChatGPT), 클로드(Claude), 그록(Grok), 딥시크(DeepSeek) 등 주요 대화형 플랫폼 4곳의 웹 검색 방식을 처음으로 분석했습니다. 이 연구는 실제 사용자 상호작용(인비보)과 API를 통한 통제된 실험(인비트로)을 결합하여 AI 에이전트가 언제 웹 검색을 시작하고, 어떤 전략으로 질의를 만들며, 검색 결과를 어떻게 답변으로 변환하는지 심층적으로 파고들었습니다.
연구 결과에 따르면, 웹 검색을 호출하는 AI 에이전트의 결정은 플랫폼과 모델에 따라 상당한 차이를 보였습니다. 흥미로운 점은 웹 검색을 더 자주 호출한다고 해서 반드시 답변 품질이 더 좋아지는 것은 아니라는 사실입니다. 또한, 대화형 에이전트들은 복잡한 질의 전략을 사용하며, 각 플랫폼의 특정 검색 엔진은 선호하는 도메인에서 검색 결과를 반환하는 경향이 있었습니다. 예를 들어, 특정 플랫폼은 뉴스 기사를, 다른 플랫폼은 학술 자료를 더 많이 참조하는 식입니다. 마지막으로, AI 답변이 대부분 검색 결과에 기반하고 있었지만, 일부 주장은 출처가 명시되지 않은 검색 결과에 의존하고 있어 정보의 귀속(attribution)과 신뢰성(reliability)에 대한 우려를 낳았습니다.
이번 연구 결과는 미래 AI 에이전트와 대화형 검색에 최적화된 웹 검색 도구를 설계하는 데 중요한 시사점을 제공합니다. AI 에이전트 개발자들은 검색 호출 시점, 질의 전략, 결과 필터링 방식 등을 더욱 정교하게 설계하여 답변의 정확성과 신뢰성을 높여야 할 것입니다. 또한, 사용자들은 AI 에이전트가 제공하는 정보의 출처를 항상 확인하고 비판적으로 수용하는 태도가 필요하다는 점을 시사합니다. 궁극적으로는 AI가 정보를 탐색하고 활용하는 방식에 대한 투명성을 높여야 AI의 신뢰도를 향상시킬 수 있을 것입니다.
