대규모 언어모델(LLM)이 생성한 학술 문헌 검토(literature review)가 여전히 사람의 개입 없이는 학술 출판 기준을 충족하기 어렵다는 연구 결과가 나왔습니다. LLM의 컨텍스트 창(context window) 크기가 문헌 검토의 품질에 미치는 영향을 평가한 이번 연구는 AI가 학술 글쓰기를 지원하는 역할에 대한 중요한 시사점을 제공합니다.
Muhammad Ali Chaudhry 외 연구진은 Semantic Scholar와 Arxiv의 연구 자료를 바탕으로 AI가 생성한 20개의 문헌 검토를 단문 및 장문 컨텍스트 설정으로 나누어 평가했습니다. 두 명의 연구자가 15가지 차원에서 평가한 결과, 컨텍스트 창이 길어질수록 LLM이 더 광범위한 정보를 통합하고 일관성을 유지하는 경향을 보였습니다. 그러나 동시에 내용 반복, 중요한 연구의 누락, 그리고 종합적인 분석보다는 단순한 설명에 치우치는 문제점도 더욱 두드러지게 나타났습니다.
이 연구는 AI가 생성한 문헌 검토가 기본적인 개요를 제공하는 데는 유용하지만, 그 결과물이 반드시 해당 분야 전문가의 비판적인 평가와 정교한 수정 과정을 거쳐야 함을 명확히 보여줍니다. 이는 LLM이 학술 연구 과정에서 강력한 보조 도구가 될 수 있지만, 인간 전문가의 깊이 있는 지식과 판단을 완전히 대체할 수는 없다는 점을 시사합니다. 향후 연구에서는 다양한 LLM과 미세조정(fine-tuned) 모델을 통합하고, 인간의 전문성과 AI의 역량을 결합하는 하이브리드 접근 방식이 필요할 것으로 보입니다.
