한 개발자가 코먼크롤(CommonCrawl) 데이터를 기반으로 구글(Google) 인덱스의 1%에 해당하는 규모의 웹 검색 엔진을 개발해 공개했습니다. 이 검색 엔진은 40억 개에 달하는 웹 페이지와 3,350만 개의 도메인을 색인(index)했으며, 기존의 풀텍스트(full-text) 검색 방식을 채택하여 사용자들에게 새로운 검색 경험을 제공합니다. 이는 거대 기업이 주도하는 검색 시장에 개인 개발자의 도전이라는 점에서 주목할 만합니다.
개발자는 웹 크롤링(crawling)과 신경망 임베딩(neural embedding)을 활용한 기존 시도들에서 영감을 얻었지만, 직접 크롤링 대신 방대한 코먼크롤 코퍼스(corpus)를 활용하는 전략을 택했습니다. 코먼크롤은 수십억 개의 웹 페이지 데이터를 무료로 제공하는 비영리 프로젝트입니다. 개발자는 이 데이터를 파이프라인(pipeline)을 통해 처리한 후, 고전적인 풀텍스트 검색 인덱스에 저장하여 검색 엔진을 구축했습니다. 현재 아랍어, 중국어, 영어, 프랑스어, 독일어, 일본어, 한국어 등 다양한 언어를 지원하며, 전용 서버를 활용해 대규모 데이터를 처리하고 있습니다.
이러한 개인 개발자의 시도는 검색 시장의 독점 구조에 대한 대안을 모색한다는 점에서 의미가 큽니다. 구글이 지배하는 검색 시장에서 개인이나 소규모 팀이 접근하기 어려운 인프라와 데이터 문제를 코먼크롤과 같은 공개 데이터를 통해 해결할 수 있음을 보여주기 때문입니다. 이는 사용자들에게 더 다양한 검색 옵션을 제공하고, 특정 기업의 알고리즘 편향성에서 벗어난 검색 결과를 기대할 수 있게 합니다. 또한, 특정 틈새시장이나 전문 분야에 특화된 검색 엔진 개발 가능성을 열어줄 수 있습니다.