다양한 문서 형식과 언어를 통합적으로 처리하는 다국어 문서 인텔리전스 프레임워크 'xberg'가 공개되어 주목받고 있습니다. 이 프레임워크는 PDF, 이미지, 스프레드시트, 오디오, URL, 아카이브는 물론 소스 코드에 이르기까지 101가지 포맷과 371가지 코드 언어를 지원하며, 입력된 데이터를 깔끔한 텍스트, 표, 메타데이터, 구조화된 데이터로 변환해줍니다. 포맷 감지부터 광학 문자 인식(OCR), 정보 추출까지 하나의 코어에서 처리하여 여러 라이브러리를 조합해야 했던 기존의 복잡한 파이프라인 구성의 필요성을 없앤 것이 특징입니다.
xberg는 강력한 기능들을 통합 제공합니다. 웹 수집 기능은 URL을 통해 단일 문서를 추출하거나 링크를 따라 크롤링(crawlberg 엔진 사용)할 수 있으며, 오디오/비디오 전사 기능은 MP3, M4A, WAV 등 다양한 오디오/비디오 트랙을 위스퍼(Whisper ONNX) 모델로 음성을 텍스트로 변환합니다. 또한, .zip, .tar 등 아카이브 파일 내 중첩된 문서까지 재귀적으로 추출하며, 테서랙트(Tesseract), 패들OCR(PaddleOCR) 등 다양한 OCR 백엔드를 선택하고 폴백 체인 및 신뢰도 점수를 활용할 수 있습니다. 특히, 머신러닝 기반의 레이아웃 모델(PP-DocLayout-V3, RT-DETR)과 표 구조 모델(TATR, SLANet)을 통해 문서의 읽기 순서와 셀 그리드를 복원하여 깔끔한 마크다운(Markdown) 형식으로 변환하는 기능은 문서 이해도를 크게 높여줍니다. 한국어 HWP/HWPX 파일의 텍스트 추출도 지원하여 국내 사용자들에게도 실용적입니다.
이 프레임워크는 개발자들이 문서 처리 시스템을 구축하는 데 드는 시간과 노력을 획기적으로 줄여줄 것으로 기대됩니다. 복잡한 문서 파싱 및 정보 추출 과정을 단일화하고 자동화함으로써, 개발자들은 핵심 비즈니스 로직에 더 집중할 수 있게 됩니다. 또한, 임베딩, 검색, 개체명 인식(NER), 키워드 추출, 요약, 번역, 개인 식별 정보(PII) 마스킹 등 다양한 보강(Enrichment) 기능을 제공하여 문서 인텔리전스 애플리케이션 개발의 폭을 넓힙니다. 로컬 또는 호스팅 대규모 언어모델(LLM)을 활용한 스키마 기반의 구조화된 데이터 추출 기능은 프롬프트 엔지니어링 없이도 원하는 형식의 JSON 데이터를 생성할 수 있어, 문서 기반의 인공지능(AI) 서비스 개발에 강력한 도구가 될 것입니다.