최근 'RagIndex'라는 흥미로운 웹 애플리케이션이 공개되어, RAG(Retrieval-Augmented Generation, 검색 증강 생성) 기술의 새로운 가능성을 제시하고 있습니다. 이 애플리케이션은 사용자의 브라우저 내에서 모든 RAG 프로세스를 처리하며, 특히 임베딩(embedding) 과정 없이도 관련성 높은 정보를 검색하고 대규모 언어모델(LLM)에 전달하는 독특한 방식을 채택했습니다. 이는 데이터 프라이버시를 극대화하고 백엔드 서버 의존도를 없애는 혁신적인 접근으로 평가됩니다.
RagIndex는 BM25 렉시컬 검색 알고리즘과 시맨틱 재순위화(rerank)를 결합하여 작동합니다. 먼저, 사용자가 업로드한 문서(PDF, TXT, DOCX 등)를 '자식 청크(Child Chunks)'인 개별 문장 단위로 인덱싱하여 정밀한 검색 기반을 마련합니다. 이후 질문이 들어오면 BM25를 통해 관련성 높은 문장들을 1차로 찾아내고, 이 문장들을 포함하는 '부모 청크(Parent Chunks)'인 완전한 단락을 LLM에 전달하여 넓은 맥락을 유지합니다. 여기서 중요한 점은 임베딩 없이도 시맨틱 재순위화를 통해 검색된 결과의 실제 의미론적 관련성을 0-5점으로 평가하고 재정렬하여, 동의어나 유사 표현까지 효과적으로 처리한다는 것입니다. 모든 API 키와 데이터 처리는 사용자의 브라우저 내 IndexedDB에 저장되고 실행되므로, 외부 서버로 데이터가 유출될 염려가 없습니다.
이러한 클라이언트 측 RAG 구현은 여러 면에서 중요한 의미를 가집니다. 첫째, 민감한 정보를 다루는 기업이나 개인 사용자에게 탁월한 데이터 프라이버시를 제공합니다. 모든 데이터가 로컬에서 처리되므로 보안 침해 위험이 현저히 낮아집니다. 둘째, 백엔드 인프라 구축 및 유지보수 비용 없이 정적 웹 서버만으로 구동 가능하여 개발 및 배포가 매우 간편합니다. 이는 특히 소규모 개발팀이나 1인 창업자에게 큰 장점이 될 수 있습니다. 셋째, 임베딩 모델에 대한 의존성을 줄여 복잡성과 비용을 절감하면서도, BM25와 시맨틱 재순위화의 조합으로 충분히 효과적인 검색 증강 성능을 보여준다는 점에서 RAG 기술의 새로운 방향성을 제시합니다. 향후 다양한 온디바이스(on-device) AI 애플리케이션 개발에도 영감을 줄 수 있을 것으로 기대됩니다.