대규모 언어모델(LLM)은 비정형 문서에서 엔티티와 관계를 추출하는 데 능숙하지만, 그 결과물은 종종 비일관적이라는 문제가 있었습니다. 문서마다 다른 유형의 어휘가 사용되거나, 동일 인물이 여러 이름으로 나타나거나, 관계가 중복되는 등의 오류가 발생해 지식 그래프(Knowledge Graph)의 품질을 저해했습니다. 이러한 문제를 해결하기 위해, 형식 온톨로지(formal ontology)에 맞춰 검증된 지식 그래프를 생성하는 새로운 추출 계층이 개발되었습니다.
이 시스템은 카프카(Kafka)를 통해 문서 메타데이터를 수집하고, PDF, 스프레드시트, 오피스 문서, 이미지 등 다양한 형식의 콘텐츠를 처리합니다. 핵심은 온톨로지 기반 추출 방식으로, Qwen3.5-9B 모델을 활용해 온톨로지에 맞춰 미세조정(fine-tuning)합니다. 특히, 임베딩 유사성(embedding similarity)을 통해 관련 온톨로지 조각을 실시간으로 검색하여 추출 프롬프트에 주입함으로써, 기존의 정적 도메인 슬라이스 방식 대비 카탈로그 오버헤드를 약 94% 줄였습니다. 추출된 결과는 결정론적 정제, 청크(chunk) 병합, 관계 재확인, 그리고 모델 추론이 필요 없는 6가지 중복 제거 알고리즘을 포함한 정교한 파이프라인을 거쳐 최종적으로 지식 그래프로 변환됩니다.
이러한 접근 방식은 정보 검색의 정확도를 획기적으로 개선했습니다. 정보기관(intelligence corpora) 데이터에 대한 평가 결과, 검색 재현율(search recall)이 약 70%에서 95%로 향상되었으며, 잘못된 병합(false merges)은 발생하지 않았습니다. 또한, 원본 텍스트가 한 글자 잘리는 버그부터 엔티티의 체계적인 중복에 이르기까지 7가지 유형의 품질 결함을 수정했습니다. 이 기술은 LLM이 생성하는 정보의 신뢰성과 유용성을 크게 높여, 기업이나 연구 기관이 방대한 비정형 데이터를 효율적으로 지식화하고 활용하는 데 중요한 기반을 제공할 것입니다.