AI의 무분별한 콘텐츠 스크래핑에 대한 우려가 커지는 가운데, 한 블로거가 자신의 개인 블로그를 구글 검색 색인에서 완전히 삭제하는 데 성공해 주목받고 있습니다. 이 블로거는 AI 학습용 데이터 수집을 막기 위해 의도적으로 검색 엔진 노출을 포기했으며, 여러 단계를 거쳐 3개월 만에 구글 검색 결과에서 블로그를 지울 수 있었습니다. 이는 개인 웹사이트 운영자들이 자신의 콘텐츠 통제권을 되찾으려는 시도의 한 단면을 보여줍니다.
블로거는 처음에는 robots.txt 파일에 모든 봇의 접근을 차단하는 지시(User-agent: *와 Disallow: /)를 추가했지만, 몇 주가 지나도 색인 제외 효과가 없었습니다. 이후 웹 페이지 HTML에 <meta name="robots" content="noindex, nofollow" /> 태그를 삽입했으나, 이 태그를 읽어야 할 구글봇(Googlebot)까지 차단된 상태여서 문제가 해결되지 않았습니다. 결국, 구글봇이 noindex 지시를 읽을 수 있도록 robots.txt에서 구글봇에 한해 접근을 허용(Allow: /)하고, 다른 봇들은 계속 차단하는 방식으로 설정을 변경했습니다. 이 과정을 다른 주요 검색 엔진 봇에도 동일하게 적용하며 각 검색 엔진에서 색인이 삭제되는 것을 확인한 뒤 해당 봇의 허용 항목을 제거했습니다. 최종적으로 구글 색인에서 블로그가 완전히 삭제되기까지는 마지막 설정 변경 후 최소 3개월이 걸렸습니다.
이번 사례는 AI 시대에 개인 콘텐츠 소유자들이 자신의 데이터를 보호하기 위해 어떤 노력을 하는지 보여주는 동시에, 검색 엔진 봇의 작동 방식에 대한 중요한 시사점을 던집니다. 단순히 robots.txt로 모든 접근을 막는다고 해서 색인에서 즉시 제외되는 것이 아니며, noindex 지시를 봇이 읽을 수 있도록 특정 봇의 접근을 일시적으로 허용해야 한다는 점은 많은 웹마스터에게 새로운 정보가 될 수 있습니다. 또한, 공개된 인터넷 콘텐츠의 스크래핑을 완전히 막기는 어렵지만, 적어도 검색 엔진을 통한 노출을 차단함으로써 AI 학습 데이터로 활용될 가능성을 줄이려는 시도는 앞으로 더욱 확산될 것으로 예상됩니다. 이는 검색 엔진 최적화(SEO)를 넘어 '검색 엔진 비최적화(De-SEO)'라는 새로운 관점을 제시하며, 콘텐츠 통제권에 대한 논의를 심화시킬 것입니다.