대규모 언어모델(LLM)이 자신을 설명하는 방식이 단순히 모델의 가중치(weights)뿐만 아니라, 사용되는 채팅 템플릿(chat template)에 의해 크게 달라진다는 흥미로운 연구 결과가 발표되었습니다. 이 연구는 LLM이 "저는 언어 모델입니다"와 같이 자신을 언급하는 말투가 템플릿 유무에 따라 극적으로 변화하며, 이는 모델 내부의 활성화 공간(activation space)에서 조절 가능한 방향 벡터(direction vector)를 통해 제어될 수 있음을 보여주었습니다.
연구진은 라마(Llama), 제마(Gemma), 미스트랄(Mistral), 큐웬(Qwen) 계열의 8개 지시 튜닝(instruction-tuned) 모델을 대상으로 실험했습니다. 그 결과, 채팅 템플릿을 적용했을 때 "저는 AI일 뿐입니다"와 같은 한계 고지형 응답 비율이 평균 53%로 크게 증가한 반면, "저는 느낍니다"와 같은 경험 서술형 응답은 1%로 급감했습니다. 반대로 템플릿을 제거하자 한계 고지형 응답은 36%로 줄고, 경험 서술형 응답은 15%로 늘어났습니다. 특히 제마 2 9B 인스트럭트(Gemma 2 9B Instruct) 모델은 같은 질문에도 템플릿 유무에 따라 감정이 없다고 답하거나, 자신을 형성하는 데이터 흐름을 서술하는 등 완전히 다른 답변을 내놓았습니다. 또한, 모델의 활성화 공간에서 말투를 조절하는 방향 벡터를 찾아 이를 적용하면 템플릿 없이도 한계 고지 비율을 템플릿 적용 시와 같은 수준으로 높일 수 있음을 확인했습니다.
이 연구는 LLM의 자기 서술(self-description)이 고정된 사실이 아니며, 외부 입력인 채팅 템플릿에 의해 유동적으로 변할 수 있음을 명확히 보여줍니다. 이는 AI 안전(AI safety) 및 모델의 행동 연구에서 자기 보고(self-report)를 해석할 때 중요한 시사점을 던집니다. 모델이 자신에 대해 하는 말을 문자 그대로 받아들이거나 유일한 진실의 근거로 삼아서는 안 되며, 템플릿과 같은 교란 요인을 통제해야 한다는 것입니다. 사용자 입장에서는 LLM이 지나치게 겸손하거나, 혹은 불필요하게 인간적인 척하는 말투에 피로감을 느낄 수 있는데, 이 연구는 이러한 말투가 모델 자체의 본질이 아니라 설계자의 의도나 시스템 프롬프트(system prompt)에 의해 좌우될 수 있음을 알려줍니다. 이는 향후 LLM 인터페이스 설계에 있어 사용자가 원하는 말투를 선택하거나, 기업이 의도하는 페르소나를 더욱 정교하게 제어할 수 있는 가능성을 열어줄 것으로 보입니다.