yozm.tech
피드로 돌아가기
news.hada.ioHOTAI 재작성

오픈AI, 불법 저작권 도서 사용 인지하고도 모델 학습에 활용

오픈AI(OpenAI)와 마이크로소프트(Microsoft)가 작가들과의 저작권 소송에서 불법 복제 도서 사이트인 립젠(LibGen)을 대규모 언어모델(LLM) 학습에 사용했음을 인지하고 있었다는 내부 발언이 공개되었습니다. 연구원들은 대외 이미지와 작가 일자리 대체 가능성에 대한 우려를 표했지만, 회사는 이를 무시하고 출시를 강행하려 했던 정황이 드러나 논란이 예상됩니다.

5일 전·2026.09.27·읽기 3분·neo https://news.hada.io/user/neo

오픈AI(OpenAI)와 마이크로소프트(Microsoft)가 작가들을 상대로 한 저작권 소송에서, 이들이 불법 복제 도서 사이트인 립젠(LibGen)의 저작권 도서를 대규모 언어모델(LLM) 학습에 사용했음을 인지하고 있었다는 내부 발언이 담긴 서면이 공개되어 파문이 일고 있습니다. 작가 단체인 오서스 길드(Authors Guild)가 공개한 이 서면에는 오픈AI 연구원들이 립젠 사용에 따른 대외 이미지 악화와 작가들의 일자리 대체 가능성을 우려했음에도 불구하고, 회사가 이를 무시하고 제품 출시를 강행하려 했던 정황이 상세히 담겨 있습니다.

공개된 서면에 따르면, 마이크로소프트는 2019년 4월부터 립젠 사용을 인지하고 있었으며, 샘 알트만(Sam Altman)과 다리오 아모데이(Dario Amodei) 등 오픈AI 경영진이 빌 게이츠(Bill Gates)와 케빈 스콧(Kevin Scott) 등 마이크로소프트 고위 관계자들에게 이 사실을 알렸습니다. 당시 오픈AI 연구 책임자 다리오 아모데이는 립젠이 “학습 데이터셋으로는 좀 더 수상하다”고 반응했고, 연구원 샘 맥캔들리시(Sam McCandlish)는 “오픈AI가 수상한 러시아 웹사이트의 저작권 데이터를 사용한다”는 내용이 해커 뉴스(Hacker News)에 올라오면 곤란할 것이라며 대외 이미지를 걱정했습니다. 또한, 오픈AI는 2022년 ‘프로젝트 클리어(Project Clear)’를 통해 립젠 관련 파일을 삭제하며 흔적을 감추려 했다는 주장도 제기되었습니다.

내부 발언에는 AI가 장르소설 작가들의 일자리를 대체할 것이라는 예상과 함께, 작가들의 우려에도 불구하고 제품 출시를 강행할 가능성이 언급되었습니다. 심지어 오픈AI는 조지 R.R. 마틴(George R.R. Martin)의 미완성 소설을 AI로 완결하려는 연구 목표까지 세웠던 것으로 드러났습니다. 오픈AI 정책 책임자 잭 클라크(Jack Clark)는 AI가 사람의 노동을 대체할 것이며, 예술가들이 우려를 나타내더라도 이를 무시하고 제품을 출시할 가능성이 높다고 말했습니다. 오서스 길드 CEO 메리 라젠버거(Mary Rasenberger)는 오픈AI가 작가의 경력과 수입에 미칠 피해를 알면서도 무단 이용을 반복적으로 선택했다고 비판하며, 인간의 작품을 AI 저질 콘텐츠로 대체하는 행위가 미국 문화를 훼손하고 수천 명의 작가를 실직시킬 수 있다고 경고했습니다.

이번 폭로는 인공지능 개발 과정에서의 윤리적 문제와 저작권 침해 논란을 다시 한번 수면 위로 끌어올렸습니다. 특히 오픈AI와 같은 선두 기업이 불법적인 데이터 사용을 인지하고도 이를 강행하려 했다는 점은 AI 기술의 발전 속도만큼이나 중요한 사회적 책임과 규제의 필요성을 강조합니다. AI가 창작 활동에 미치는 영향이 커지는 만큼, 창작자들의 권리를 보호하고 공정한 보상 체계를 마련하는 것이 시급하며, 이는 기술 기업들이 외면할 수 없는 과제가 될 것입니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
3/10
약한 신호
왜 3점인가

저작권 문제는 여전히 AI 산업의 큰 걸림돌이지만, 1인 창업자가 대규모 저작권 데이터를 확보하고 법적 리스크를 관리하기는 매우 어렵습니다.

문제 / 미충족 수요

AI 모델 학습을 위한 저작권 데이터 확보의 어려움과 법적 리스크가 존재하며, 특히 창작자들은 자신의 저작물이 무단으로 사용되는 것에 대한 불만이 높습니다.

한국 시장
국내 있음한국에서도 저작권 문제는 민감하며, 특히 웹툰, 웹소설 등 창작 콘텐츠 시장이 활발하여 AI 학습 데이터에 대한 수요와 우려가 동시에 존재합니다.
수익 모델

B2B SaaS 구독, API 종량제 · 돈 내는 주체: AI 모델을 개발하는 기업, 연구기관

1인 실현 가능성
2/5

저작권 해결된 대규모 데이터셋 구축은 1인으로는 어렵지만, 특정 틈새시장을 노린 소규모 데이터셋은 가능합니다. 법률 자문이 필수적입니다.

진입 지점 (Wedge)

특정 분야의 저작권이 해결된 고품질 데이터셋을 구축하고, 이를 AI 학습용으로 제공하는 플랫폼 또는 API 서비스

이번 주 첫 실험

저작권이 만료되었거나 오픈 라이선스가 적용된 한국어 문학/학술 데이터를 수집하고, 이를 가공하여 소규모 AI 모델 학습용 데이터셋을 만들어 보는 파일럿 프로젝트를 기획합니다.

Original source
이 글은 news.hada.io의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기