yozm.tech
피드로 돌아가기
news.hada.ioHOTAI 재작성

AI 기업이 실물 책을 파괴한다 — 너무 늦기 전에 희귀 도서를 스캔하자

일부 AI 기업들이 대규모 언어모델(LLM) 학습 데이터를 확보하기 위해 수백만 권의 중고 서적을 매입, 스캔 후 폐기하고 있어 논란입니다. 앤트로픽(Anthropic)의 '프로젝트 파나마(Project Panama)'가 대표적 사례로, 이는 지식의 물리적 보존과 접근성에 대한 중요한 질문을 던지고 있습니다. 비영리 단체들은 인류의 지식 유산을 보존하기 위한 디지털 아카이브 구축을 촉구하고 있습니다.

7시간 전·2026.08.21·읽기 1·neo https://news.hada.io/user/neo

최근 일부 인공지능(AI) 기업들이 대규모 언어모델(LLM) 학습을 위해 수백만 권의 중고 서적을 대량으로 매입한 뒤 스캔하고 폐기하는 관행이 드러나 논란이 되고 있습니다. 이들은 2022년 이전에 출판된, AI가 생성하지 않은 '순수한' 데이터를 확보하려는 목적으로 이러한 작업을 진행하고 있으며, 이 과정에서 디지털 사본이 기업 서버에만 독점적으로 남게 될 수 있다는 우려가 제기됩니다.

특히 앤트로픽(Anthropic)의 '프로젝트 파나마(Project Panama)'는 2024년 초 수천만 달러를 들여 수백만 권의 종이책을 구매, 스캔하여 자사의 클로드(Claude) LLM 학습에 사용한 뒤 모두 폐기한 것으로 알려졌습니다. 이러한 사실은 약 15억 달러 규모의 저작권 합의 과정에서 밝혀졌습니다. AI 기업들이 책을 폐기하는 주된 이유는 경쟁사의 학습 데이터 확보를 차단하고, 스캔 후 원본 보관에 따르는 법적 위험을 회피하며, 무손실 스캔보다 저렴한 비용으로 데이터를 얻기 위함입니다. 그러나 이러한 행위는 인류의 지식 유산을 훼손하고 지식 접근성을 제한할 수 있다는 비판을 받고 있습니다.

이러한 상황에 대응하여 '안나의 아카이브(Anna's Archive)'와 같은 비영리 섀도우 라이브러리(Shadow Library)들은 전 세계 자원봉사자들에게 책, 논문, 신문, 잡지, 고서, 희귀본 등을 스캔하여 디지털 아카이브에 업로드해 달라고 요청하고 있습니다. 2025년 이후에는 인터넷 콘텐츠의 절반 이상이 AI 생성물이 될 것이라는 예측 속에서, 인간이 만든 출판물을 보존하는 것이 더욱 중요해질 것이라는 판단입니다. 이는 지식의 물리적 보존과 디지털 접근성 확대라는 두 가지 목표가 충돌하는 지점에서, 인류의 지적 자산을 미래 세대에게 안전하게 전달하기 위한 노력이 시급함을 보여줍니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
4/10
보통
4점인가

문제는 명확하나, 저작권, 스캔 비용, 데이터 관리 등 1인이 해결하기 어려운 복잡한 이슈가 많습니다.

문제 / 미충족 수요

AI 학습 데이터 확보 경쟁으로 인해 귀중한 지식 자원이 소실되거나 특정 기업에 독점될 위험이 있으며, 특히 희귀하거나 절판된 서적의 디지털 보존 필요성이 커지고 있습니다.

한국 시장
국내 있음한국에서도 고서, 절판 도서, 지역 자료 등 디지털화가 필요한 자료가 많지만, 저작권 문제와 비용 부담으로 인해 활발하지 않습니다.
수익 모델

B2C/B2B 구독, API 종량제, 크라우드펀딩 · 돈 내는 주체: 연구자, 학생, 특정 분야 전문가, 도서관, 아카이브 기관, 일반 독자

1인 실현 가능성
3/5

스캔 장비 및 저작권 문제 해결에 초기 자본과 법률 자문이 필요할 수 있으나, 소규모 니치 시장부터 시작한다면 1인 창업도 가능합니다.

진입 지점 (Wedge)

특정 분야의 희귀 한국어 서적이나 지역 특화 자료를 디지털화하여 접근성을 높이는 서비스

이번 주 첫 실험

한국 내 특정 지역 도서관이나 고서점과 협력하여 희귀 도서 목록을 확보하고, 디지털화 수요를 파악하는 설문조사 진행

Original source
이 글은 news.hada.io의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기