최근 발표된 한 연구 논문은 AI 모델의 해석 가능성을 평가할 때 널리 사용되는 코사인 유사도와 같은 척도가 양자화(quantization)된 모델에서는 오해를 불러일으킬 수 있다고 경고했습니다. 모델을 경량화하는 과정인 양자화 후에도 해석 아티팩트(interpretability artifacts)가 잘 보존되는지 확인하기 위해 코사인 유사도 등을 사용하는데, 이러한 척도들이 '노이즈 플로어(noise floor)'를 고려하지 않으면 잘못된 결론을 내릴 수 있다는 주장입니다.
논문 저자 프라나브 바시니(Pranav Varshney)는 '해석에 필요한 수치 없이 보고된 통계는 증거가 아니다'라는 명제를 제시하며, AI 안전성(AI safety) 분야의 구체적인 관행을 비판했습니다. 기존 연구들은 전체 정밀도(full-precision) 가중치로 보정된 해석 아티팩트를 양자화된 가중치에 적용한 후, 코사인 유사도, 상관관계, AUROC 같은 스케일 불변 통계량(scale-invariant statistics)을 통해 변화가 없다고 인증해왔습니다. 그러나 이러한 통계량은 자체적인 노이즈 플로어, 즉 측정 오차로 인해 발생할 수 있는 최소한의 변동성을 보고하지 않아 문제가 됩니다. 예를 들어, Qwen2.5-1.5B-Instruct 모델에서 활성화(activations)의 클래스 분리도(class separation) $\rho$를 측정한 결과, 추정기의 두 독립적인 실행이 샘플링만으로 0.978~0.994의 코사인 유사도를 보였습니다. 이는 0.996이라는 높은 코사인 유사도 수치만으로는 전체 정밀도와 양자화된 거부 방향(refusal directions) 간의 보존 여부를 판단할 수 없음을 의미합니다. 특히 INT4 양자화에서는 방향이 실제로 회전했으며, 이러한 변화가 추정기 자체의 노이즈 수준을 초과하는 것으로 나타났습니다. 반면 INT8에서는 움직임이 감지되지 않았지만, 이는 동등성을 의미하는 것은 아니라고 저자는 강조합니다.
이 연구는 AI 모델의 경량화와 해석 가능성 평가에 있어 중요한 시사점을 제공합니다. 모델을 효율적으로 배포하기 위해 양자화는 필수적이지만, 이 과정에서 모델의 의사결정 방식이나 안전 관련 기능이 손상될 수 있습니다. 단순히 높은 코사인 유사도만으로 '해석 가능성이 보존되었다'고 판단하는 것은 위험하며, 이는 AI 시스템의 오작동이나 예상치 못한 행동으로 이어질 수 있습니다. 연구팀은 스케일 불변 통계량이 전이된 결정 변수(decision variable)의 '이동(translation)'과 '감쇠(attenuation)'를 구분할 수 없다는 점도 지적했는데, 이 두 현상은 완전히 다른 해결책을 요구합니다. 따라서 모델 해석 가능성을 평가할 때는 노이즈 플로어를 함께 보고하고, 양자화된 모델 내에서 측정된 '분할-반쪽 널(split-half null)'과 비교하는 등 보다 엄격한 기준이 필요하다는 것이 이 논문의 핵심 메시지입니다. 이는 AI 안전성 연구와 실제 AI 시스템 배포에 있어 신뢰성을 높이는 데 기여할 것입니다.
