yozm.tech
피드로 돌아가기
The VergeHOTAI 재작성

Mathematicians want proof OpenAI didn’t use their work

OpenAI의 수학 분야 AI 성과를 두고 연구자들의 불만이 커지고 있습니다. 뉴욕대 수학 교수에 이어 또 다른 수학자가 OpenAI가 비공개 연구를 무단으로 학습 데이터에 사용했을 가능성을 제기하며, 불투명한 데이터 사용 정책에 대해 '부정직하다'고 비판했습니다. OpenAI는 사용자 데이터의 직접적인 사용은 부인하지만, 비식별화된 데이터의 간접적인 영향은 배제하지 않아 논란이 계속되고 있습니다.

5시간 전·2026.09.10·읽기 1·Robert Hart

최근 OpenAI가 수학 분야에서 놀라운 성과를 발표하며 학계의 주목을 받았지만, 동시에 훈련 데이터 사용의 투명성 문제로 거센 비판에 직면했습니다. 뉴욕대학교 수학 교수 트리스탄 벅마스터(Tristan Buckmaster)가 OpenAI의 코덱스(Codex) 사용이 모델 개선에 기여했는지 의문을 제기한 데 이어, 수학자 안드레아스 톰(Andreas Thom)도 자신의 비공개 연구가 OpenAI의 대규모 언어모델(LLM) 학습에 사용되었을 가능성을 제기하며 '부정직한' 태도라고 비난했습니다.

톰 교수는 OpenAI가 대대적으로 발표한 10가지 수학적 성과 중 하나인 '비-소픽 군(non-sofic groups)' 연구가 자신의 전문 분야와 밀접하게 관련되어 있으며, OpenAI가 해당 결과가 자신과 가보르 쿤(Gábor Kun)의 이전 연구에 크게 기반하고 있음을 인정했다고 밝혔습니다. 그는 챗GPT(ChatGPT)와의 상호작용이 훈련 데이터에 포함되었거나 추론 과정에 접근 가능했는지 OpenAI 연구진에게 문의했지만, 돌아온 답변은 챗봇 대화의 직접적인 접근 여부만 다룰 뿐, 방대한 훈련 데이터 풀에 포함되었는지에 대한 명확한 설명이나 증거를 제공하지 않았습니다. 톰 교수는 OpenAI가 자신들의 기술에 대해 '놀랍도록 상세한 이해'를 보였다는 점에 주목하며, 이는 당시 가장 명확하거나 유망한 해결책이 아니었음에도 불구하고 자신들의 기법을 사용했다는 점에서 의혹을 더했습니다.

OpenAI는 나비에-스토크스(Navier-Stokes) 방정식 해결과 관련해서도 '특정 사용자 데이터는 사용하지 않았다'고 부인하면서도, '비식별화된(de-identified) 사용자 데이터가 모델 개선에 기여했을 가능성은 배제할 수 없다'는 모호한 입장을 보였습니다. 톰 교수는 이러한 '비식별화'가 이름만 제거할 뿐 수학적 아이디어의 지적 내용을 제거하지는 않는다고 지적하며, 동의나 적절한 공개, 출처 표기 없이 비공개 연구가 모델 개선에 사용되어 사용자들과의 출판 경쟁에 활용된다면 '윤리적으로 옹호할 수 없다'고 강조했습니다. 이러한 논란은 수학계에 OpenAI에 대한 불신을 키우고 있으며, 연구자들이 대규모 기술 기업과의 경쟁을 우려해 연구 결과를 더욱 비밀스럽게 다루게 될 수 있다는 우려를 낳고 있습니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
2/10
약한 신호
2점인가

AI 학습 데이터 투명성은 중요한 문제이나, 1인 창업자가 OpenAI와 같은 거대 기업의 데이터 정책에 직접적인 영향을 미치기는 어렵습니다. 간접적인 서비스 기회는 있으나 복잡성이 높습니다.

문제 / 미충족 수요

AI 모델 훈련 데이터의 출처 투명성 부족은 지적 재산권 침해 및 연구 윤리 문제를 야기하며, 연구자들이 AI 기업과의 경쟁을 우려해 연구 결과를 공개하기 꺼리게 만듭니다.

한국 시장
국내 있음한국에서도 AI 학습 데이터 저작권 및 윤리 문제는 지속적으로 제기되고 있으며, 관련 법규 및 가이드라인 정립이 필요한 상황입니다.
수익 모델

B2B SaaS 구독 · 돈 내는 주체: AI 모델 개발 기업, 학술 연구 기관, 데이터 제공 연구자(보상 모델의 경우)

1인 실현 가능성
2/5

데이터 출처 검증 및 보상 시스템 구축에 기술적, 법률적 복잡성이 따르며, 데이터 확보에 어려움이 있을 수 있습니다.

진입 지점 (Wedge)

특정 분야의 비공개 연구 데이터를 안전하게 공유하고 AI 학습에 활용할 수 있도록 돕는 '데이터 기여 및 보상 플랫폼'을 구축합니다.

이번 주 첫 실험

수학, 물리 등 특정 학술 분야의 연구자 10명을 대상으로 비공개 연구 데이터 공유에 대한 니즈와 우려 사항을 인터뷰합니다.

Original source
이 글은 The Verge의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기