새로운 연구에서 셀 데이터가 없거나 신뢰하기 어려울 때, 오직 테이블의 열(컬럼) 헤더 정보만을 활용하여 데이터의 의미를 해석하고 품질을 평가하는 설명 가능한 AI 프레임워크가 발표되었습니다. 이 ‘헤더 중심 프레임워크’는 대규모 지식 그래프(Knowledge Graph, KG)를 구축하기 전, 원천 데이터의 메타데이터 품질을 사전에 확보하는 데 중점을 둡니다. 이는 지식 그래프의 전반적인 신뢰성을 높이는 데 필수적인 단계입니다.
이 프레임워크는 헤더를 39가지의 해석 가능한 ‘FinalFormat’ 유형으로 분류하며, 이를 위해 엄선된 어휘 자원(lexical resources)을 활용합니다. 각 유형이 할당되면 누락된 데이터, 중복, 도메인 위반, 잘못된 데이터 유형, 시간 불일치 등 다양한 데이터 품질 문제(Data Quality Issues, DQIs)를 감지하는 검증 규칙이 활성화됩니다. 이러한 감지 결과는 ‘HeadersIQ’라는 경량화된 데이터 소스 수준의 품질 지표로 집계됩니다. 이 기술은 UCI, Kaggle 등 약 12만 개의 헤더 컬럼을 포함하는 이질적인 벤치마크 데이터셋에서 평가되었으며, 실제 노이즈가 많은 메타데이터에서도 광범위한 실용적 적용 가능성을 보여주었습니다.
이 헤더 중심 프레임워크는 데이터 통합 및 지식 그래프 구축 과정에서 초기 단계의 데이터 품질 문제를 선제적으로 해결할 수 있게 합니다. 특히 셀 데이터 접근이 어렵거나 데이터 자체에 노이즈가 많아 활용하기 어려울 때, 헤더 정보만으로도 유의미한 품질 평가와 의미론적 해석을 가능하게 한다는 점에서 중요합니다. 이는 데이터 과학자나 개발자들이 복잡한 데이터셋을 다룰 때 시간과 노력을 크게 절감하고, 최종적으로 더 정확하고 신뢰할 수 있는 지식 시스템을 구축하는 데 기여할 것입니다.