오픈AI(OpenAI)가 개발한 챗GPT(ChatGPT)의 웹 크롤러인 GPT봇(GPTBot)이 미국 연방정부 웹사이트를 무단으로 스캔한 정황이 포착되어 논란이 일고 있습니다. 이는 AI 모델 훈련을 위한 데이터 수집 과정에서 발생할 수 있는 잠재적인 보안 및 윤리적 문제를 다시 한번 수면 위로 끌어올렸습니다.
워싱턴 포스트(The Washington Post) 보도에 따르면, 미 연방정부 기관들은 GPT봇의 접근을 인지하지 못했으며, 일부 기관은 웹사이트 접근 기록에서 GPT봇의 활동을 확인했습니다. GPT봇은 웹사이트 콘텐츠를 수집하여 챗GPT와 같은 대규모 언어모델(LLM)의 훈련 데이터로 활용하는데, 이는 민감한 정부 정보가 AI 모델에 포함될 수 있다는 우려를 낳고 있습니다. 오픈AI는 웹사이트 운영자가 GPT봇의 접근을 차단할 수 있는 방법을 제공하고 있지만, 많은 정부 기관이 이를 알지 못했거나 적용하지 않았던 것으로 파악됩니다.
이번 사건은 AI 개발 기업들이 데이터 수집의 투명성과 책임감을 높여야 할 필요성을 강조합니다. 특히 정부 기관이나 민감한 정보를 다루는 웹사이트의 경우, AI 크롤러의 접근에 대한 명확한 정책과 기술적 통제 장치가 필수적입니다. 사용자들은 AI 모델이 어떤 데이터를 기반으로 학습되었는지 알 권리가 있으며, 기업들은 이러한 정보를 공개하고 통제권을 제공함으로써 신뢰를 구축해야 할 것입니다. 또한, 각국 정부는 AI 크롤링에 대한 명확한 가이드라인과 규제를 마련하여 잠재적 위협으로부터 국가 안보와 개인 정보를 보호해야 할 시점입니다.