최근 연구에 따르면, 이른바 '페이퍼 밀(paper mill)'이라 불리는 가짜 학술 논문 제작 공장에서 대량 생산되는 저품질 논문들이 대규모 언어모델(LLM)의 학습 데이터를 오염시키기 시작했습니다. 이러한 논문들은 주로 연구 실적을 부풀리려는 목적으로 만들어지며, 피어 리뷰(peer review) 과정을 우회하거나 조작하여 학술지에 게재되는 경우가 많습니다. 문제는 이러한 가짜 정보들이 LLM이 세상의 지식을 습득하는 주요 원천 중 하나가 되면서, LLM 기반의 검색 결과나 정보 요약의 신뢰성에 심각한 영향을 미칠 수 있다는 점입니다.
페이퍼 밀은 주로 중국, 러시아 등지에서 조직적으로 운영되며, 연구자들에게 돈을 받고 가짜 논문을 대신 작성해줍니다. 이들은 실제 연구 데이터 없이 통계 조작, 이미지 변조, 표절 등 다양한 수법을 동원해 그럴듯한 논문을 만들어냅니다. 이렇게 생산된 논문들은 학술 데이터베이스에 축적되고, 결국 구글(Google)이나 마이크로소프트(Microsoft) 같은 빅테크 기업들이 LLM을 훈련할 때 사용하는 방대한 웹 데이터셋에 포함됩니다. LLM은 학습 데이터의 양이 많을수록 성능이 향상되지만, 데이터의 질이 낮으면 '환각(hallucination)' 현상처럼 잘못된 정보를 사실처럼 제시할 위험이 커집니다.
이러한 현상은 단순히 학술계의 문제를 넘어, 일반 사용자에게도 직접적인 영향을 미칠 수 있습니다. LLM 기반의 검색 엔진이나 챗봇이 가짜 논문을 학습하여 생성한 정보는 잘못된 의학적 조언, 왜곡된 과학적 사실, 편향된 사회적 견해 등으로 이어질 수 있기 때문입니다. 이는 AI 기술의 신뢰성을 저해하고, 정보 소비자들이 올바른 판단을 내리는 데 방해가 될 수 있습니다. 따라서 AI 개발사들은 학습 데이터의 출처를 더욱 엄격하게 검증하고, 학술계는 페이퍼 밀에 대한 강력한 제재와 함께 피어 리뷰 시스템을 강화하는 등 다각적인 노력이 시급합니다.