RDF 지식 그래프(Knowledge Graph, KG)의 데이터 유효성을 검증하는 핵심 기술인 SHACL(Shapes Constraint Language) 스키마는 전문 지식 없이는 작성하기 매우 어렵습니다. 이러한 기술적 장벽을 낮추기 위해 자연어 요구사항을 SHACL로 자동 변환하는 NL2SHACL(Natural Language to SHACL) 연구가 활발히 진행되고 있습니다. 하지만 이 분야에는 전용 벤치마크가 없어 모델 성능을 객관적으로 평가하기 어려웠고, 의미적으로 동일한 SHACL 스키마라도 표현 방식이 다를 수 있어 단순 문자열 비교 이상의 정교한 평가 방법이 필요했습니다.
이러한 문제 해결을 위해 위스콘신 대학교(University of Wisconsin) 연구진은 'NL2SHACL-Bench'라는 새로운 벤치마크 스위트를 발표했습니다. 이 벤치마크는 자연어 문장을 SHACL 스키마로 변환하는 모델의 성능을 측정하도록 설계되었으며, 특히 의미론적 동등성 평가에 중점을 둡니다. 연구팀은 NL2SHACL-Bench를 활용해 최신 대규모 언어모델(LLM) 네 가지를 평가했습니다. 그 결과, LLM은 구문적으로 유효한 SHACL 스키마를 생성하는 데는 높은 능력을 보였지만, 복잡한 논리적 및 구조적 패턴에 대한 의미론적으로 동등한 제약 조건을 생성하는 데는 여전히 어려움을 겪는 것으로 나타났습니다.
이번 NL2SHACL-Bench의 등장은 NL2SHACL 분야의 발전을 측정하고 가속화하는 중요한 기반을 마련했다는 점에서 의미가 큽니다. 지식 그래프는 AI 시대에 데이터의 구조와 관계를 명확히 정의하는 데 필수적인 기술로 부상하고 있으며, SHACL은 그 정확성을 보장하는 핵심 도구입니다. 이 벤치마크를 통해 LLM이 복잡한 데이터 모델링 요구사항을 얼마나 정확하게 이해하고 SHACL로 변환하는지 객관적으로 평가할 수 있게 됨으로써, 도메인 전문가들이 직접 SHACL 스키마를 작성하지 않고도 고품질의 지식 그래프를 구축할 수 있는 길이 열릴 것으로 기대됩니다. 이는 궁극적으로 지식 그래프 기술의 대중화와 확산에 크게 기여할 것입니다.
