최근 주요 인공지능(AI) 연구소들이 대규모 언어모델(LLM) 훈련에 필요한 방대한 텍스트 데이터를 확보하기 위해 수십만 권의 책을 대량으로 구매하고, 심지어 페이지를 찢어 스캔하는 극단적인 방법을 동원하고 있는 것으로 알려졌습니다. 이는 AI 모델의 성능을 좌우하는 고품질 데이터의 중요성을 보여주는 동시에, 데이터 확보 경쟁이 얼마나 치열한지를 단적으로 드러냅니다.
이러한 현상은 오픈AI(OpenAI), 구글(Google), 메타(Meta) 등 선두 AI 기업들이 더욱 강력하고 정확한 AI 모델을 만들기 위해 고군분투하고 있음을 시사합니다. 특히, 저작권 보호 기간이 만료되지 않은 최신 서적이나 특정 분야의 전문 서적은 AI 훈련 데이터로서 가치가 높지만, 합법적으로 대량 확보하기 어려운 실정입니다. 이에 일부 연구소들은 책을 구매한 뒤 제본을 훼손하고 페이지를 분리하여 고속 스캐너로 디지털화하는 방식을 택하고 있으며, 이는 기존의 저작권 논란을 더욱 증폭시킬 수 있습니다.
이러한 데이터 확보 방식은 AI 개발의 윤리적, 법적 문제뿐만 아니라, AI 모델의 편향성(bias) 문제와도 직결될 수 있습니다. 특정 출판물이나 장르에 치우친 데이터는 AI 모델이 학습하는 정보의 다양성을 제한하고, 결과적으로 사회적 편견을 재생산하거나 특정 관점에만 치우친 답변을 생성할 위험이 있습니다. 따라서 AI 연구소들은 단순히 데이터를 많이 모으는 것을 넘어, 데이터의 질과 다양성을 확보하는 데 더욱 신중을 기해야 할 것입니다. 이러한 움직임은 앞으로 저작권자와 AI 개발사 간의 새로운 협력 모델이나 데이터 라이선싱 시장의 등장을 촉진할 수도 있습니다.