전문가 혼합(MoE) 대규모 언어모델(LLM)이 추론(inference) 과정에서 생성하는 라우팅(routing) 정보가 학습 데이터의 개인정보를 유출할 수 있는 새로운 위험 요소로 지목되었습니다. 기존에는 모델의 출력 결과물에서 개인정보 유출 가능성을 주로 다뤘지만, 이번 연구는 모델의 내부 계산 과정을 보여주는 라우터 원격 측정(telemetry) 데이터가 멤버십 추론(membership inference) 공격에 활용될 수 있음을 밝혀냈습니다.
연구팀은 라우터 정보를 활용한 멤버십 추론 공격 기법을 개발하여 세 가지 MoE 아키텍처와 세 가지 데이터 도메인에 걸쳐 실험했습니다. 그 결과, 라우터 원격 측정 데이터는 기존의 강력한 출력 기반 공격보다 멤버십 추론 공격의 성공률(1% 오탐율(FPR) 기준 참탐율(TPR))을 2.7%p에서 최대 9.4%p까지 향상시키는 것으로 나타났습니다. 이러한 정보 유출은 전체 미세조정(fine-tuning), 라우터 동결 훈련, 로라(LoRA), 명령어 튜닝(instruction tuning) 등 다양한 학습 방식에서 일관되게 발생했으며, 심지어 제한된 라우터 정보나 단일 섀도우 모델(shadow model)만으로도 관찰되었습니다. 이는 라우터 자체가 데이터를 기억하는 것이 아니라, 미세조정 과정에서 은닉 표현(hidden representation)에 멤버십 정보가 주입되고 라우터가 이를 노출하는 투영(projection) 역할을 하기 때문입니다.
이번 연구 결과는 MoE 모델을 운영할 때 라우터 원격 측정 데이터가 단순히 운영 효율성 분석을 넘어 새로운 개인정보 보호 취약점이 될 수 있음을 시사합니다. 특히, 민감한 데이터를 사용하여 미세조정된 MoE 모델의 경우, 라우터 로그나 모니터링 데이터에 대한 접근 통제 및 익명화(anonymization) 등 추가적인 보안 조치가 필요하다는 점을 강조합니다. 이는 MoE 모델의 광범위한 활용을 앞두고 개발자와 운영자 모두에게 중요한 고려 사항이 될 것입니다.