최근 흥미로운 실험 결과가 공개되었습니다. GPT-5.5 Pro가 문제를 푸는 추론 과정의 첫 1%만을 중국의 대규모 언어모델(LLM)인 Qwen3.8 A95B에 미리 주입(prefill)했더니, Qwen이 스스로 생성한 최종 답변의 표현이 GPT의 방식에 더 가까워지는 현상이 관찰되었습니다. 이는 모델이 특정 추론 방식을 접했을 때, 단순히 내용뿐 아니라 표현 방식까지 영향을 받을 수 있음을 보여주는 사례입니다.
이 실험은 과학/기술, 일반 문제, 합성 퍼즐 등 45개 문제에서 진행되었으며, Qwen의 답변에서 GPT의 단어와 구절이 겹치는 중복 점수가 16.79%에서 34.97%로 크게 상승했습니다. 이는 정답률을 측정한 것이 아니라, 답변의 문체나 어조, 사용 어휘의 유사성을 평가한 결과입니다. 특히 Qwen은 이전 실험에서 클로드 오푸스(Claude Opus) 4.8의 추론을 넣었을 때는 답변에 큰 변화가 없었으나, 이번 GPT 추론에서는 모든 범주에서 유의미한 변화를 보였습니다. 반면, 같은 조건에서 딥시크(DeepSeek) V4 플래시와 잉클링(Inkling)은 변화가 작았고, 키미(Kimi) K3는 원래 GPT와 표현이 가장 많이 겹쳤지만, 추론 주입 후 증가 폭은 Qwen보다 작았습니다.
이러한 결과는 Qwen이 GPT-5.5 Pro 또는 유사한 GPT 모델의 출력으로 학습했을 가능성을 강하게 시사합니다. 모델이 다른 강력한 모델의 추론 방식을 모방하는 것을 넘어, 그 모델의 출력 스타일까지 흡수할 수 있다는 점은 대규모 언어모델 학습 방식과 지식 전이(knowledge transfer) 연구에 중요한 함의를 가집니다. 이는 모델의 학습 출처를 추론하는 새로운 방법론이 될 수 있으며, 향후 모델 개발 및 평가에 있어 '추론 과정'의 중요성을 더욱 부각시킬 것으로 보입니다.