최근 발표된 연구에 따르면, 배포된 대규모 언어모델(LLM)의 행동을 감시하는 활성화 프로브(activation probe)를 훈련할 때, 합성 데이터의 양보다 데이터의 다양성, 즉 '커버리지(coverage)'가 훨씬 더 중요한 요소로 작용하는 것으로 나타났습니다. 이 연구는 프로브가 얼마나 많은 합성 대화 샘플을 필요로 하는지에 대한 기존의 의문을 해소하며, 효율적인 LLM 모니터링 시스템 구축의 새로운 방향을 제시합니다.
연구팀은 '고위험 상황', '개인에게 해로운 답변', '사용자 지시 불이행'이라는 세 가지 모니터링 개념에 대해 10개에서 590개의 합성 샘플을 사용하여 학습 곡선을 분석했습니다. 그 결과, '고위험 상황'이나 '해로운 답변'과 같은 개념은 80개 정도의 샘플만으로도 충분히 학습되는 반면, '사용자 지시 불이행'과 같은 복잡한 개념은 훨씬 더 많은 샘플이 필요하다는 것을 발견했습니다. 이는 각 모니터링 개념이 요구하는 데이터의 '종류'가 다르기 때문이며, 특히 한 종류의 데이터가 다른 종류의 데이터를 얼마나 잘 포괄하는지(transfer)가 학습 효율을 결정하는 핵심 요인으로 밝혀졌습니다. 즉, 데이터의 '난이도'보다는 '다양성'이 프로브의 학습 필요량을 결정한다는 것입니다.
이 연구는 LLM의 안전성과 신뢰성을 확보하기 위한 모니터링 시스템 개발에 중요한 통찰을 제공합니다. 특히, 복잡하고 미묘한 LLM의 오작동을 감지하기 위해서는 단순히 많은 양의 합성 데이터를 생성하기보다, 다양한 시나리오와 유형을 포괄하는 데이터를 전략적으로 구성하는 것이 중요함을 시사합니다. 이는 제한된 자원으로 LLM 모니터링 시스템을 구축해야 하는 개발자들에게 데이터 생성 및 활용 전략에 대한 실질적인 가이드라인을 제공할 수 있습니다.