최근 연구에 따르면 대규모 언어모델(LLM)이 생성한 텍스트를 동적 시스템(Dynamical System, DS)으로 모델링하여 구별할 수 있다는 사실이 밝혀졌습니다. 이는 토큰 임베딩(token embedding)을 블랙박스 동적 시스템의 궤적으로 간주하고, 두 시스템의 예측 잔차(prediction residuals)를 비교함으로써 LLM의 응답을 분류하는 방식입니다. 이러한 동적 접근 방식은 경험적으로 성공적인 결과를 보여왔지만, 왜 작동하는지, 토큰 시퀀스 길이에 따라 얼마나 잘 확장되는지, 그리고 임베딩 모델 간에 얼마나 전이될 수 있는지에 대한 이론적 이해는 부족했습니다.
모하메드 아크루트(Mohamed Akrout)와 댄 윌슨(Dan Wilson) 연구진은 이러한 질문에 답하기 위해 분류 작업을 두 확률적 선형 동적 시스템 간의 이진 가설 검정(binary hypothesis test)으로 공식화했습니다. 연구 결과, 두 동적 시스템의 정상 주변 분포(stationary marginal distributions) 간의 전체 변동 거리(total variation distance)는 동역학이 상당히 다를 때조차도 임의로 작을 수 있음을 보여주었습니다. 이는 토큰 동역학을 무시하는 어떤 분류기도 근본적인 정확도 한계(accuracy floor)를 가질 수 있음을 의미합니다. 또한, 동적 시스템 기반 분류의 오분류 확률(misclassification probability)이 시퀀스 길이 L에 따라 지수적으로 감소하며, 이 감소는 두 동적 시스템 간의 스펙트럼 거리(spectral distance)를 포착하는 동적 식별 가능성(dynamical discriminability) $\delta^2$에 의해 결정됨을 입증했습니다.
이 연구는 임베딩 모델 간의 교차 일반화(cross-embedding generalization)도 다루었습니다. 연구진은 임베딩 모델 간의 근사적인 얽힘 조건(approximate intertwining condition)을 도입하고, 얽힘 맵(intertwining map)의 가장 작은 특이값(singular value)을 통해 전이 가능한 식별 가능성(transferable discriminability)의 하한을 설정했습니다. 이러한 결과들은 동적 시스템 기반 분류의 경험적 성능을 설명하며, 동적 시스템을 모델링하기 위해 AI를 사용하는 일반적인 접근 방식과 달리, AI 시스템을 분석하기 위해 동적 시스템 이론을 활용하는 추가 연구의 필요성을 제기합니다. 이는 LLM의 내부 작동 방식을 이해하고, 더 나아가 특정 LLM의 출력을 식별하거나 조작된 콘텐츠를 탐지하는 데 중요한 이론적 기반을 제공할 수 있습니다.