yozm.tech
피드로 돌아가기
Google News: AI when:1dHOTAI 재작성

AI 기업들, 고서적 구매 후 파괴하는 이유

최근 AI 기업들이 희귀 고서적을 대량으로 구매해 스캔 후 파기하는 사례가 늘고 있습니다. 이는 대규모 언어모델(LLM) 학습에 필요한 방대한 양질의 텍스트 데이터를 확보하기 위함으로, 저작권 문제와 데이터 희소성 문제를 동시에 해결하려는 전략입니다. 하지만 이로 인해 역사적 가치가 있는 서적들이 영구히 소실될 수 있다는 우려가 커지고 있습니다.

7시간 전·2026.08.17·읽기 2

최근 인공지능(AI) 기업들이 대규모 언어모델(LLM) 학습에 필요한 데이터를 확보하기 위해 희귀 고서적을 대량으로 구매한 뒤, 디지털화하고 원본을 파기하는 사례가 늘고 있어 논란이 되고 있습니다. 이는 저작권이 만료된 고서적에서 양질의 텍스트 데이터를 얻어 모델 성능을 향상시키려는 목적으로 분석됩니다.

AI 기업들은 저작권 문제가 없는 고품질 데이터를 찾기 위해 수십 년에서 수백 년 된 고서적에 주목하고 있습니다. 이들은 경매나 중고 서점 등을 통해 대량의 책을 구매한 뒤, 고속 스캐너로 디지털 이미지와 텍스트를 추출합니다. 이 과정에서 책이 손상되거나 아예 파기되는 경우가 많으며, 일부 기업은 스캔 후 원본을 폐기하는 것을 당연시하고 있습니다. 이는 디지털 데이터의 가치를 원본 서적의 물리적 가치보다 우선시하는 경향을 보여줍니다. 이러한 방식은 저작권 침해 논란을 피하면서도, 웹 크롤링 데이터보다 훨씬 정제되고 문학적 가치가 높은 텍스트를 확보할 수 있다는 장점 때문에 확산되고 있습니다.

이러한 현상은 AI 기술 발전을 가속화하는 긍정적인 측면도 있지만, 동시에 심각한 문화유산 훼손 문제를 야기합니다. 희귀 고서적은 단순한 정보의 집합이 아니라, 역사적, 문화적, 예술적 가치를 지닌 유물입니다. 원본이 파괴되면 그 안에 담긴 물리적 특성, 필사본의 흔적, 종이의 질감 등 디지털화할 수 없는 고유한 정보들이 영구히 사라지게 됩니다. 이는 미래 세대가 과거를 연구하고 이해하는 데 필요한 중요한 자료를 잃게 되는 결과를 초래할 수 있습니다. AI 개발과 문화유산 보존 사이의 균형점을 찾는 것이 시급한 과제로 떠오르고 있습니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
4/10
보통
4점인가

문제는 명확하나, 고서적 확보 및 전문 스캔 장비, 데이터 가공에 필요한 자본과 전문성이 1인 창업자에게는 큰 진입 장벽입니다.

문제 / 미충족 수요

AI 학습용 고품질, 저작권 자유 텍스트 데이터의 확보가 어렵고, 이로 인해 귀중한 고서적이 훼손될 위험이 있습니다.

한국 시장
국내 불명한국 역시 고문헌 디지털화 수요가 있으나, 접근성 및 저작권 만료 여부 확인이 쉽지 않을 수 있습니다.
수익 모델

B2B 데이터 판매, 데이터 가공 서비스 · 돈 내는 주체: 대규모 언어모델(LLM)을 개발하는 AI 기업, 연구기관, 학술기관

1인 실현 가능성
2/5

고서적 구매 및 전문적인 스캔 장비, 데이터 정제 기술이 필요하여 1인 창업자가 시작하기에는 초기 자본과 전문성이 요구됩니다.

진입 지점 (Wedge)

특정 분야의 저작권 만료된 한국어 고문헌을 디지털화하고, AI 학습용으로 가공하여 판매하는 서비스

이번 주 첫 실험

한국 내 저작권 만료된 고문헌 목록을 조사하고, 디지털화 비용 및 수요를 파악하기 위한 시장 조사 진행

Original source
이 글은 Google News: AI when:1d의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기