대규모 언어모델(LLM)을 특정 사용자의 선호도에 맞춰 개인화하는 것은 모델의 활용도를 높이는 중요한 과제입니다. 기존에는 주로 집단적인 품질 향상에 초점을 맞췄지만, 진정한 개인화를 위해서는 개별 사용자의 미묘한 취향과 스타일을 반영하는 것이 필수적입니다. 이 과정에서 DPO(Direct Preference Optimization)와 같은 선호도 학습(preference learning) 프레임워크가 활용되는데, 연구에 따르면 DPO의 개인화 성능은 '선호도 쌍(preference pair)'을 어떻게 선택하느냐에 따라 크게 달라지는 것으로 나타났습니다.
기존 DPO 방식은 주로 '가능도 기반 극단값(likelihood-based extremes)'과 같은 휴리스틱(heuristic) 기준에 의존하여 선호도 쌍을 선택했습니다. 이는 최적화 과정과 실제 사용자 효용(user utility) 간의 연결고리가 약해 개인화 성능 저하로 이어질 수 있다는 한계가 있었습니다. 최근 연구는 이러한 문제를 해결하기 위해 개인화된 선호도 학습을 '기하학적으로 정렬된 최적화 문제(geometry-aligned optimization problem)'로 재정의했습니다. 특히, 사용자 효용의 기울기(gradient)와 DPO 업데이트 방향 간의 1차 상호작용을 분석하여, 선호도 마진이 효용 기울기와 방향적으로 정렬될 때 DPO 업데이트가 오류 수정 신호에서 강화 학습과 유사한 업데이트로 전환됨을 발견했습니다. 이는 선호도 쌍 선택이 개인화를 촉진할지 방해할지를 결정하는 기하학적 결정임을 시사합니다.
이러한 통찰을 바탕으로 연구진은 GAP-DPO(Geometry-Aligned Preference DPO)라는 반복 알고리즘을 제안했습니다. GAP-DPO는 유틸리티를 인지하고 기하학적으로 정렬된 선호도 쌍 선택을 수행하며, 에포크(epoch)별 재생성을 통해 분포 변화(distribution shift)를 제어합니다. 개인화된 텍스트 생성 벤치마크 실험 결과, GAP-DPO는 기존 DPO 변형 모델들에 비해 스타일 충실도(stylistic fidelity), 선호도 정렬(preference alignment) 및 생성 품질(generation quality)을 일관되게 향상시키는 것으로 나타났습니다. 이는 기울기 정렬(gradient alignment)이 개인화된 선호도 최적화를 위한 통합 원칙이며, 선호도 쌍 선택이 단순한 전처리 단계가 아니라 최적화 기하학의 본질적인 구성 요소임을 입증하는 결과입니다. 이 연구는 LLM 개인화 기술의 발전에 중요한 기여를 할 것으로 기대됩니다.
