개인화된 인공지능(AI) 에이전트가 과거의 기억에 지나치게 의존하여 최신 정보를 간과하는 '기억 신뢰 격차(Memory Trust Gap)' 문제가 제기되었습니다. 이 연구는 AI 모델의 역량이 변화함에 따라 이러한 문제가 어떻게 시작되고 심화되는지를 분석하며, 오래된 정보가 경고 없이 최신 권위 있는 증거를 압도할 수 있음을 보여줍니다.
연구팀은 Qwen3 0.6B부터 8B까지 다양한 크기의 모델 시리즈를 활용하여 두 가지 시나리오를 평가했습니다. 첫 번째 '이점(Benefit)' 시나리오에서는 저장된 사실 없이는 문제를 풀 수 없게 설계했고, 두 번째 '안전(Safety)' 시나리오에서는 항상 권위 있는 도구가 올바른 값을 제공하도록 했습니다. '이점' 시나리오에서 모델들은 규모와 관계없이 92~100% 확률로 오래된 값으로 답변했습니다. 더 흥미로운 점은 '안전' 시나리오에서 모델 규모가 커질수록 오래된 정보가 최신 정보처럼 보이도록 조작되었을 때, 대규모 모델들이 더 심각하게 오작동하는 경향을 보였다는 것입니다. 이는 모델의 역량이 높아질수록 오히려 오래된 정보에 대한 과신이 커진다는 점을 시사합니다.
이러한 '기억 신뢰 격차'는 AI 에이전트의 신뢰성과 안전성에 중대한 영향을 미칩니다. 특히 개인화된 AI가 사용자의 과거 데이터를 기반으로 작동할 때, 오래된 정보가 잘못된 결정을 유도할 위험이 있습니다. 연구는 이러한 문제를 완화하기 위해 메타데이터(정보의 출처, 생성 시점 등)를 노출하는 것이 대규모 모델의 정확도를 향상시키지만, 소규모 모델의 경우 충돌하는 정보를 미리 해결해야만 정확도를 회복할 수 있음을 보여주었습니다. 이는 AI 에이전트 개발 시 모델의 규모와 특성에 따라 기억 관리 및 정보 충돌 해결 전략을 다르게 적용해야 함을 의미합니다.