AI 에이전트와 RAG(검색 증강 생성) 파이프라인 개발자를 위한 강력한 오픈소스 웹 크롤러인 '바퀴벌레 크롤러(Cockroach Crawler)'가 최근 공개되어 주목받고 있습니다. 이 도구는 웹사이트 전체 크롤링, 자바스크립트(JavaScript) 렌더링, PDF 파싱, 그리고 CSS, XPath, 정규표현식(regex) 기반의 구조화된 데이터 추출 등 복잡한 웹 데이터 수집 기능을 하나의 타입스크립트(TypeScript) 패키지로 통합하여 제공합니다.
바퀴벌레 크롤러는 AI 모델에 무제한적인 브라우저나 네트워크 클라이언트 접근 권한을 부여하지 않으면서도 필요한 웹 데이터를 안전하게 수집할 수 있도록 설계되었습니다. 너비 우선 탐색(BFS), 깊이 우선 탐색(DFS), 최적 우선 탐색(best-first) 등 다양한 크롤링 전략을 지원하며, 수집된 데이터는 마크다운(Markdown), JSON, JSONL 형식의 '증거 기록(evidence records)'으로 변환되어 제공됩니다. 특히, 유튜브(YouTube)와 같은 플랫폼에서 개발자 API 키 없이도 데이터를 검색할 수 있는 경로를 제공하며, 크롤링 예산(페이지, 바이트, 깊이, 리디렉션, 동시성, 시간 제한)을 설정하여 통제된 범위 내에서 데이터를 수집할 수 있습니다.
이 크롤러의 핵심 강점은 모든 반환되는 기록에 대해 '검사 가능한 경계(inspectable boundary)'를 제공한다는 점입니다. 이는 AI 에이전트가 웹에서 정보를 수집할 때 발생할 수 있는 보안 및 통제 문제를 해결하는 데 중점을 둡니다. 일반적인 웹 크롤링 플랫폼과 달리, 바퀴벌레 크롤러는 쿠키 추출, 숨겨진 자격 증명 재사용, 로그인/캡차/페이월 우회, robots.txt 정책 무시 등의 기능을 제공하지 않아, 데이터 수집의 투명성과 통제 가능성을 높입니다. 이러한 접근 방식은 연구, 콘텐츠 인벤토리, QA 시스템, 감사 추적 등 다양한 분야에서 AI 에이전트의 신뢰성과 책임성을 확보하는 데 중요한 역할을 할 것으로 기대됩니다.