사람들은 저마다 다른, 때로는 상충하는 가치관을 가지고 있기 때문에, 단 하나의 AI 모델로는 모든 사용자를 만족시킬 수 없습니다. 이러한 한계를 극복하기 위해 '다중 목표 직접 선호 최적화(Multi-Objective Direct Preference Optimization, MODPO)'와 같은 기술을 활용하여, 경쟁하는 목표들 사이의 균형을 다르게 조절할 수 있는 '조절 가능한 다중 목표 정렬(Steerable Pluralistic Alignment)' 모델에 대한 연구가 활발히 진행되고 있습니다.
이 연구는 크게 두 가지 핵심 질문에 답하고자 합니다. 첫째, 하나의 모델이 두 가지 목표를 동시에 개선할 수 있는 경우는 언제인가? 둘째, 각 상충 관계(trade-off)마다 별도의 모델을 학습시키지 않고도 어떻게 다양한 상충 관계를 효과적으로 다룰 수 있는가? 연구팀은 HelpSteer와 UltraFeedback에서 가져온 7가지 목표 쌍을 분석했으며, 인간이 주석을 단 데이터의 경우 사전 학습 측정값이 목표의 정렬 또는 충돌 여부를 예측하는 데 유용했지만, AI가 주석을 단 데이터에서는 응답 길이와 반복성이 보상 모델 점수를 왜곡할 수 있음을 발견했습니다. 또한, 더 넓은 범위의 상충 관계를 다루기 위해 가장 가까운 학습 모델을 선택하거나 모델 매개변수를 병합하는 방법이 도움이 되지만, 직접 학습시키는 것만큼 일관된 성능을 보이지는 않았습니다.
이러한 연구 결과는 다양한 사용자 선호도를 충족하는 조절 가능한 AI 모델을 구축하는 데 실질적인 지침을 제공합니다. 단순히 하나의 최적화된 모델을 만드는 것을 넘어, 사용자가 자신의 필요에 맞춰 AI의 행동을 조절할 수 있는 유연성을 제공하는 것이 중요해지고 있습니다. 이는 AI가 더욱 개인화되고, 특정 상황에 최적화된 응답을 제공할 수 있도록 발전하는 방향을 제시하며, 궁극적으로 AI의 활용성과 사용자 만족도를 크게 높일 수 있을 것으로 기대됩니다.
