최근 발표된 '멀티모달 CoLRAG-TF' 연구는 복잡한 PDF 문서에서 정보 검색 증강 생성(RAG)의 난제를 해결할 새로운 아키텍처를 제시했습니다. 이 시스템은 이질적인 PDF 컬렉션 내의 멀티모달 콘텐츠, 전문 용어, 그리고 흩어진 증거를 통한 다단계 추론(multi-hop reasoning)의 어려움을 극복하는 데 초점을 맞춥니다. 특히 텍스트 임베딩, BM25 키워드 매칭, 지식 그래프 트리플 필터링, 이미지 기반 유사성 등 네 가지 축을 통합하여 강력한 검색 성능을 보여줍니다.
CoLRAG-TF는 43개의 일본 재난 교훈 PDF에서 추출한 2,403개의 블록으로 멀티모달 인덱스를 구축했습니다. 이 과정에는 하이브리드 광학 문자 인식(OCR) 파이프라인과 대규모 언어모델(LLM) 기반 캡션 생성이 활용되었습니다. 특히 11,414개의 OpenIE 트리플(주어-술어-목적어 관계)을 추출하여 FAISS에 인덱싱함으로써, 서브-초(sub-second) 단위의 트리플 조회와 관련성 신호의 계층적 전파를 가능하게 했습니다. HippoRAG2에서 영감을 받은 '거친 것에서 미세한 것'으로의 검색기(볼륨 → 챕터 → 블록)는 검색 공간을 좁히고, 베이지안 최적화를 통해 트리플 축이 검색 품질을 지배하도록 가중치를 설정했습니다.
이러한 트리플 필터링 기반의 멀티모달 융합은 시끄럽고 이질적인 PDF에서 구조화된 추론을 가능하게 하는 핵심 요소로 작용합니다. 457쌍의 벤치마크 평가에서 CoLRAG-TF는 0.9909의 검색 재현율(Retrieval Recall)을 달성했으며, 단일 단계 질의 대비 다단계 답변 유사성에서 71.6%의 향상을 보였습니다. 또한 비전 LLM을 활용한 이미지-투-레슨 파이프라인은 시각적 입력에도 이 접근 방식이 적용될 수 있음을 입증했습니다. 이는 재난 도메인을 넘어 다양한 복잡 문서 환경에서 RAG 시스템의 성능을 비약적으로 향상시킬 수 있는 일반적인 프레임워크를 제공한다는 점에서 큰 의미를 가집니다.