AI 모델의 내부 작동 방식을 이해하려는 노력은 인공지능 연구의 중요한 축입니다. 특히 희소 오토인코더(sparse autoencoder, SAE)를 통해 모델의 내부 표현이 얼마나 분해 가능하고 특정 기능에 집중되는지가 모델의 역공학(reverse-engineering) 난이도를 예측하는 지표로 여겨져 왔습니다. 하지만 이러한 ‘표현의 단순성’이 실제로 모델의 내부 계산 회로(causal circuit)를 더 작고 다루기 쉽게 만드는지에 대한 의문이 제기되어 왔습니다.
최근 Adam Elimadi의 연구는 이 질문에 직접적으로 답하기 위해 적대적 훈련(adversarial training)을 활용했습니다. 연구팀은 GPT-2 Small 모델을 기반으로, 표준 훈련 방식과 적대적 훈련 방식을 적용하여 동일한 간접 객체 식별(indirect object identification) 작업을 수행하도록 했습니다. 적대적 훈련을 거친 모델은 내부 표현이 더 단순하고, SAE 기능이 특정 작업에 덜 관여하는 경향을 보였습니다. 그러나 실제 내부 회로의 크기를 비교한 결과, 흥미로운 패턴이 발견되었습니다. 85% 미만의 정확도(faithfulness)에서는 표준 훈련 모델이 더 작거나 비슷한 회로 크기를 보였지만, 90% 또는 95%와 같은 높은 정확도에서는 적대적 훈련을 거친 모델이 훨씬 적은 수의 연결(edge)로 동일한 동작을 재현할 수 있었습니다.
이 연구 결과는 AI 모델의 '표현의 단순성'과 '회로 크기'가 단순한 비례 관계가 아니라, 특정 정확도 임계값에 따라 달라진다는 것을 보여줍니다. 즉, 모델의 내부 표현이 더 깔끔하고 설명하기 쉽다고 해서 항상 더 효율적인 내부 구조를 갖는 것은 아니며, 높은 수준의 충실도(faithfulness)를 요구할 때 비로소 그 이점이 드러날 수 있다는 의미입니다. 이는 AI 모델의 설명 가능성(explainability) 연구와 모델 최적화(optimization) 전략 수립에 중요한 함의를 제공하며, 앞으로 AI 시스템을 설계하고 평가하는 방식에 영향을 미칠 것으로 예상됩니다.
