최근 혼합 전문가(Mixture-of-Experts, MoE) 모델은 대규모 언어모델(LLM)의 효율성을 높이는 핵심 기술로 주목받고 있습니다. MoE 모델은 입력 토큰(token)마다 특정 전문가(expert) 그룹을 선택적으로 활용하는데, 이때 어떤 전문가를 선택할지 결정하는 '라우팅(routing)' 방식이 전체 모델의 성능과 효율성에 큰 영향을 미칩니다. 새로운 연구는 개별 토큰의 라우팅 규칙을 고정한 채로, 여러 토큰의 전문가 선택 간의 상호 의존성을 조절하여 MoE 모델의 효율을 극대화하는 '계층적 코퓰라-검벨-탑-K(Hierarchical Copula-Gumbel-Top-K, CGA)' 라우팅 기법을 제시했습니다.
CGA는 두 가지 핵심 메커니즘을 통해 전문가 활용을 정교하게 제어합니다. 첫째, 관련성이 높은 토큰 그룹 내에서는 '교환 가능한 가우시안 코퓰라(exchangeable Gaussian copula)'를 사용하여 전문가 선택의 양의 상관관계를 유도합니다. 이는 특정 그룹의 토큰들이 유사한 전문가를 선택하게 함으로써, 전문가 세트의 일관성(coherence)을 높여 효율적인 처리를 가능하게 합니다. 둘째, 서로 다른 그룹 간에는 '조정 가능한 반대 구성(tunable antithetic construction)'을 도입하여 음의 의존성을 조절합니다. 이는 특정 전문가에게 부하가 집중되는 것을 방지하고, 전체 전문가 네트워크에 걸쳐 부하를 고르게 분산시키는 데 기여합니다. 이 모든 과정에서 각 토큰의 개별적인 라우팅 규칙은 변하지 않으므로, 기존 MoE 모델의 기본 동작을 유지하면서도 효율성을 높일 수 있습니다.
이 기술의 가장 큰 의미는 MoE 모델의 핵심 과제 중 하나인 '전문가 부하 분산(expert load balancing)'과 '전문가 활용 일관성(expert utilization coherence)'을 동시에 제어할 수 있는 새로운 방법을 제시했다는 점입니다. 기존 MoE 모델은 라우팅 과정에서 전문가 부하가 불균형해지거나, 특정 전문가가 과도하게 활용되는 문제가 발생할 수 있었습니다. CGA는 이러한 문제를 해결하기 위해 두 가지 '의존성 조절 다이얼(dependence dials)'을 제공하며, 이를 통해 모델의 성능 저하 없이 전문가 활용의 효율성을 높일 수 있습니다. 특히, 기본 모델을 변경하지 않고 작은 컨트롤러(controller)를 통해 학습 및 적용이 가능하다는 점에서 기존 MoE 모델에 쉽게 통합될 수 있는 잠재력을 가집니다.