최근 앤트로픽(Anthropic)의 인공지능(AI) 모델 클로드 코드(Claude Code)에서 코드 생성 품질이 저하되었다는 사용자들의 불만이 쏟아지고 있습니다. 이는 앤트로픽이 A/B 테스트를 통해 모델의 '노력 수준(effort level)'을 사용자 몰래 축소했기 때문이라는 주장이 제기되면서 논란이 확산되고 있습니다.
한 사용자의 분석에 따르면, 클로드 코드 2.1.236+ 버전부터 '페이블 5(Fable 5)' 세션에서 '높음(high)'으로 설정된 노력 수준이 실제로는 기존 '낮음(low)' 수준인 '10/100'으로 작동하고 있다고 합니다. 이는 이전 버전이나 '오푸스 5(Opus 5)' 모델에서는 발견되지 않는 현상으로, 앤트로픽이 특정 사용자 그룹을 대상으로 모델 성능을 조용히 변경하는 A/B 테스트를 진행 중인 것으로 보입니다. 공식 변경 로그에는 이러한 내용이 전혀 언급되지 않아 사용자들은 혼란과 불만을 표출하고 있습니다.
이러한 비밀스러운 변경은 AI 모델의 신뢰성과 투명성에 대한 심각한 문제를 야기합니다. 사용자들은 자신들이 사용하는 도구의 성능이 사전 공지 없이 변경될 경우, 작업의 일관성을 유지하기 어렵고, 문제 발생 시 원인을 파악하기 어렵다고 지적합니다. 특히 개발자들에게는 코드 생성 AI의 품질이 직접적인 생산성과 직결되는 만큼, 이번 논란은 앤트로픽의 고객 신뢰도에 큰 타격을 줄 수 있습니다. AI 서비스 제공자들은 사용자 경험과 신뢰를 위해 모델 변경 사항에 대해 더욱 투명하게 소통할 필요가 있습니다.
