재료 과학 분야의 대규모 언어모델(LLM)이 결정 구조와 같은 복잡한 질문에 답할 때, 과연 모델이 해당 구조를 이해하고 논리적으로 추론하는 것일까요, 아니면 단순히 학습 데이터에서 본 내용을 그대로 암기하여 읊는 것일까요? 기존의 정확도(accuracy) 측정 방식으로는 이러한 근본적인 질문에 답하기 어려웠습니다. 구조에 대한 설명 자체가 정답을 포함하는 경우가 많아, LLM이 단순히 '베끼기'만 해도 정답을 맞출 수 있기 때문입니다.
이러한 한계를 극복하기 위해 'CARAT'라는 새로운 연구 방법론이 제안되었습니다. CARAT는 질문과 정답을 8가지 다른 관점에서 고정하고, 각 구조적 관계를 GraphSpace라는 도구를 통해 명확하게 정의합니다. 또한, 미세조정(fine-tuning), 답변 마스킹(answer masking), 증거 주입(evidence injection), 쌍을 이룬 추론(paired inference) 등의 기법을 적용하여 LLM의 행동을 세밀하게 분석합니다. 연구 결과, 가장 어려운 벤치마크 가족(families)에서 '접지된(grounded) 뷰'는 단순한 수식 입력보다 17.3점 높은 성능을 보였습니다. 이는 LLM이 단순히 텍스트를 암기하는 것을 넘어, 구조적 증거를 기반으로 추론할 때 더 나은 결과를 낼 수 있음을 시사합니다.
CARAT 연구는 LLM의 진정한 이해도를 측정하는 데 중요한 통찰을 제공합니다. 특히, 모델이 특정 정보를 단순히 인용하는 것이 아니라, 해당 정보를 활용하여 새로운 상황에 적용하고 추론하는 능력을 갖추도록 훈련하는 것이 중요함을 보여줍니다. 이는 재료 과학뿐만 아니라 다양한 과학 분야에서 LLM을 활용하여 새로운 지식을 발견하고 문제를 해결하는 데 있어, 모델의 '암기'를 넘어선 '이해'를 이끌어내는 방법론적 토대를 마련할 것으로 기대됩니다. 궁극적으로, 이 연구는 LLM이 단순한 정보 검색 도구를 넘어 진정한 과학적 조력자가 될 수 있는 길을 제시합니다.