Jina AI가 스캔 문서와 PDF에서 텍스트, 표, 수식을 추출하여 마크다운(Markdown) 형식으로 변환하는 새로운 광학 문자 인식(OCR) 모델 'jina-ocr-v1'을 발표했습니다. 이 모델은 34억 개의 파라미터를 가지고 있으며, DeepSeek-OCR을 기반으로 정확도와 처리 속도를 크게 개선했습니다. 특히 저가형 GPU 환경에서도 효율적인 성능을 발휘하도록 최적화되어, 문서 처리의 접근성을 높일 것으로 기대됩니다.
jina-ocr-v1의 핵심 기술 중 하나는 'FastMTP(Fast Multi-Token Prediction)'입니다. 이는 다음 토큰을 여러 개 미리 예측하고 검증하는 방식으로, 출력 결과의 내용 변경 없이 생성 시간을 단축합니다. 예를 들어, NVIDIA L4 GPU 환경에서 최대 1.95배 빨라졌으며, CUDA 그래프 적용 시에는 최대 1.17배 향상된 속도를 보였습니다. 또한, 텍스트뿐만 아니라 수식의 정확성과 표의 구조까지 학습하여 olmOCR-Bench에서 83.4점을 기록, 기존 모델보다 높은 정확도를 입증했습니다. A100 GPU 1대에서 32개의 요청을 동시에 처리했을 때 초당 2.57페이지를 처리하며, 14개 시스템 중 가장 높은 처리량을 기록하기도 했습니다. 이 모델은 Jina Reader와 API를 통해 이용하거나 직접 호스팅할 수 있으며, 영어와 중국어를 지원합니다. 가중치는 비상업적 이용을 조건으로 하는 CC BY-NC 4.0 라이선스로 공개되었습니다.
이러한 발전은 대규모 언어모델(LLM) 기반의 문서 처리 비용을 절감하고 효율성을 높이는 데 중요한 의미를 가집니다. 특히 저가형 하드웨어에서도 고성능 OCR을 구현할 수 있게 됨으로써, 더 많은 개발자와 기업이 복잡한 문서 처리 기능을 자사 서비스에 통합할 수 있는 기회를 제공합니다. 문서 디지털화, 정보 추출, 데이터 분석 등 다양한 분야에서 활용될 수 있으며, 특히 방대한 양의 스캔 문서나 PDF를 다루는 산업에서 생산성 향상에 기여할 것입니다. 오픈소스 가중치 공개는 연구 및 개발 커뮤니티의 활성화에도 긍정적인 영향을 미칠 것으로 보입니다.