최근 인공지능(AI)은 수학, 의학, 재료 과학 등 다양한 과학 분야에서 획기적인 발전을 돕고 있습니다. 이러한 AI 발전의 핵심 동력 중 하나는 AI 모델의 성능을 평가하고 향상시키는 데 사용되는 새로운 평가 데이터셋입니다. 하지만 기존의 과학기술(STEM) 분야 데이터셋은 최신 AI 모델들이 이미 대부분의 온라인 데이터를 학습하여 성능이 포화 상태에 이르렀고, 질문 형식이나 답변 정확도에도 여러 한계가 있었습니다.
이러한 문제점을 해결하기 위해 241명의 도메인 전문가들이 참여하여 'Expert-validated STEM QA'라는 고품질의 전문가 검증 STEM 데이터셋(N=398)을 구축했습니다. 이 데이터셋은 물리학, 화학, 생물학, 수학 분야를 아우르며, 균형 잡힌 분류 체계 설계, 품질 중심의 질문 기여자 검증, 여러 차례의 전문가 검토 및 수정 과정을 거쳐 높은 신뢰도를 확보했습니다. 특히, 실제 과학자들이 AI를 사용하는 방식과 유사한 검증 가능한 질의응답(QA) 형식으로 제작되어 기존의 객관식 질문 형식의 한계를 극복했습니다. 이 데이터셋으로 최신 AI 모델들을 테스트한 결과, 25% 미만의 낮은 성능을 보여 기존 데이터셋의 한계를 명확히 드러냈습니다. 또한, 별도의 비공개 데이터셋(N=2,000)으로 후속 훈련을 진행했을 때 오픈소스 모델의 성능이 기준 모델 대비 15% 향상되어, 이 데이터셋이 모델 훈련에 유용하게 활용될 수 있음을 입증했습니다.
'Expert-validated STEM QA' 데이터셋의 공개는 AI 연구 커뮤니티에 중요한 기여를 할 것으로 보입니다. 기존 데이터셋의 한계로 인해 정체되었던 AI 모델의 과학 분야 성능 향상에 새로운 돌파구를 제공할 수 있기 때문입니다. 특히, 전문가의 지식을 체계적으로 담아낸 고품질 데이터는 AI가 실제 과학 문제 해결에 더욱 효과적으로 활용될 수 있는 기반을 마련하며, 궁극적으로 과학 연구의 속도를 높이고 새로운 발견을 촉진하는 데 기여할 것입니다. 연구팀은 이 데이터셋의 일부를 AI 연구 커뮤니티에 오픈소스로 공개했습니다.