최근 법률 분야 검색에 최적화된 경량 임베딩 모델인 '그린리프 로우 임베드 타이니(GreenLeaf Law Embed Tiny)'가 발표되어 주목받고 있습니다. 이 모델은 단 0.6B(6억)개의 매개변수만을 사용하면서도, 대규모 법률 임베딩 벤치마크(MLEB)에서 75.11%, MTEB(Law, v1)에서 64.38%의 뛰어난 성능을 달성하며 10억 매개변수 미만 모델 중 최고 수준의 경쟁력을 보여주었습니다. 이는 자원 제약이 있는 환경에서도 고성능 법률 AI를 배포할 수 있는 가능성을 열었습니다.
그린리프 타이니 모델의 핵심은 두 단계로 이루어진 훈련 파이프라인에 있습니다. 첫째, 더 큰 교사(teacher) 모델의 지식을 컴팩트한 학생(student) 아키텍처로 증류(distillation)하여 효율성을 높였습니다. 둘째, 340만 쌍의 질의-문단(query-passage) 데이터셋과 15만 개의 수동 큐레이션된 법률 샘플을 활용한 도메인 특화 미세조정(fine-tuning) 및 하드 네거티브 마이닝(hard negative mining) 기법을 적용하여 법률 전문성을 강화했습니다. 또한, BF16, INT8, 바이너리 등 다양한 양자화(quantization) 수준을 지원하는 효율적인 추론(inference) 아키텍처를 통해 리소스가 제한된 환경에서도 유연하게 배포할 수 있도록 설계되었습니다.
이러한 경량 고성능 법률 임베딩 모델의 등장은 법률 서비스 시장에 큰 영향을 미칠 것으로 예상됩니다. 기존의 대규모 언어모델(LLM)은 뛰어난 성능에도 불구하고 높은 연산 비용과 자원 요구사항 때문에 실제 법률 현장에 적용하기 어려움이 있었습니다. 그린리프 타이니와 같은 모델은 이러한 장벽을 낮춰, 중소형 법률 사무소나 스타트업도 비용 효율적으로 법률 검색, 문서 분석, 계약 검토 등 다양한 AI 기반 서비스를 구축할 수 있게 합니다. 이는 법률 서비스의 접근성을 높이고, 법률 전문가들의 업무 효율성을 크게 향상시키는 계기가 될 것입니다.
