최근 연구에 따르면, 대규모 언어모델(LLM)을 특정 분야에 맞게 미세조정(fine-tuning)할 때 필요한 고품질 합성 데이터가 다양성 부족으로 인해 '모드 붕괴(mode collapse)' 현상을 겪는다는 문제가 제기되었습니다. 이는 LLM에 직접 프롬프트를 주거나 특정 시나리오에 맞춰 데이터를 생성할 경우, 모델이 가장 흔한 패턴에만 집중하여 실제 전문가 대화의 다양한 전략과 의사결정을 제대로 반영하지 못하기 때문입니다.
이 문제를 해결하기 위해, 연구진은 생성 흐름 네트워크(Generative Flow Networks, GFlowNet)를 활용한 새로운 합성 데이터 생성 방법을 제안했습니다. GFlowNet은 핵심 상호작용 특징(예: 혼란 에피소드 역학, 비계 지시 균형)에 대한 가우시안 혼합 분포(Gaussian mixture density)를 사용하여 잠재적인 대화 구조를 학습하도록 훈련됩니다. 이를 통해 GFlowNet은 훈련 데이터에 존재하는 전문가 전략의 유병률(prevalence)에 비례하여 데이터를 샘플링할 수 있으며, 이는 기존의 강화 학습(reinforcement learning)이나 종단 간(end-to-end) LLM 기반 방식보다 충실도, 모드 커버리지(mode coverage), 그리고 진정성 측면에서 더 나은 균형을 제공하는 것으로 나타났습니다.
이러한 GFlowNet 기반 접근 방식은 튜터링(tutoring) 및 정서적 지원(emotional support) 대화라는 두 가지 구조적으로 다른 도메인에서 그 효과가 입증되었습니다. 특히, GFlowNet으로 생성된 합성 대화 데이터를 사용하여 훈련된 분류기(classifier)는 세 가지 다운스트림 결과 예측 작업에서 경쟁적인 합성 기준선보다 더 강력한 훈련 신호를 제공했습니다. 이는 GFlowNet이 훈련 데이터를 단순히 복사하지 않으면서도 실제와 같은 다양한 전문가 대화 데이터를 생성할 수 있음을 의미하며, 적응형 AI 애플리케이션 개발에 있어 매우 중요한 진전을 가져올 수 있습니다.