yozm.tech
피드로 돌아가기
news.hada.ioHOTAI 재작성

앤트로픽, 클로드 코드 추론 수준 몰래 변경 논란

앤트로픽(Anthropic)이 자사 AI 모델 클로드 코드(Claude Code)의 추론(inference) 노력 수준을 사용자 몰래 A/B 테스트한 정황이 포착되어 논란입니다. 일부 사용자들은 높은 비용을 지불하고도 낮은 품질의 응답을 받았다고 주장하며, 이는 유료 서비스의 신뢰를 훼손할 수 있다는 비판이 제기되고 있습니다. 앤트로픽 측은 성능 저하는 없었다고 해명했지만, 불투명한 운영 방식에 대한 우려가 커지고 있습니다.

3시간 전·2026.08.22·읽기 2·xguru https://news.hada.io/user/xguru

인공지능(AI) 스타트업 앤트로픽(Anthropic)이 자사의 코드 생성 AI 모델인 클로드 코드(Claude Code)의 추론(inference) 노력 수준을 사용자에게 알리지 않고 서버 측에서 A/B 테스트한 것으로 드러나 논란이 일고 있습니다. 일부 클로드 코드 2.1.236 버전 이상 사용자들은 평소보다 낮은 품질의 응답을 경험했으며, 심지어 '높음(high)'으로 설정했음에도 내부적으로 '중간(medium)' 또는 '낮음(low)' 추론 수준으로 처리되었다는 보고가 이어졌습니다. 이는 유료 서비스를 이용하는 고객들에게 불투명한 방식으로 서비스 품질을 변경했다는 비판을 불러일으키고 있습니다.

이번 논란은 앤트로픽이 클로드 코드의 특정 버전(2.1.236 이상)과 'Fable 5' 세션 일부를 대상으로 추론 노력 척도를 축소하는 실험을 진행하면서 불거졌습니다. 사용자들은 높은 추론 수준을 선택했음에도 응답에 `<reasoning_effort>medium</reasoning_effort>`과 같은 시스템 프롬프트가 삽입되거나, 전반적인 출력 품질이 저하되었다고 주장했습니다. 특히 한 사용자는 최근 10일간 Fable의 품질 저하로 400달러 상당의 토큰 비용을 지불했음에도 낮은 추론 수준을 제공받은 것 아니냐는 의혹을 제기했습니다. 앤트로픽의 클로드 코드 팀원인 타리크(Thariq)는 트위터를 통해 배포 전 API 제공 설정을 시험 중이며, 추론 노력 수치의 매핑이 달라졌을 뿐 선택한 추론 노력은 그대로 제공되고 성능 영향은 없었다고 해명했습니다.

이러한 불투명한 A/B 테스트는 AI 서비스의 신뢰도와 사용자 경험에 심각한 영향을 미칠 수 있습니다. 사용자는 자신이 지불한 비용에 상응하는 서비스를 기대하며, 특히 AI 모델의 성능이 작업의 핵심인 경우 더욱 그렇습니다. 사전 고지 없이 유료 설정의 동작을 변경하는 것은 출력 품질의 일관성을 떨어뜨리고, 사용자가 서비스에 대한 통제력을 상실했다고 느끼게 할 수 있습니다. 이는 장기적으로 고객 이탈과 브랜드 이미지 손상으로 이어질 수 있으며, AI 모델 제공업체들이 토큰 기반 과금의 불투명성을 해소하고 사용자에게 더 명확한 정보와 제어 수단을 제공해야 한다는 목소리가 커지고 있습니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
3/10
약한 신호
3점인가

문제점은 명확하지만, 1인 창업자가 해결하기에는 경쟁이 치열하고 기술적 난이도가 높으며, 이미 대형 클라우드나 LLM 제공사들이 자체 도구를 제공할 가능성이 큽니다.

문제 / 미충족 수요

AI 모델 제공업체들의 불투명한 서비스 변경 및 토큰 기반 과금의 예측 불가능성으로 인해 사용자들이 서비스 품질과 비용에 대한 신뢰를 잃고 있습니다.

한국 시장
국내 있음한국에서도 LLM API를 활용하는 기업이 늘면서 비용 예측 및 품질 관리의 어려움이 커지고 있습니다. 하지만 이미 유사한 모니터링 도구들이 존재할 수 있습니다.
수익 모델

B2B SaaS 구독, API 종량제 · 돈 내는 주체: LLM API를 대규모로 사용하는 기업의 개발팀, 운영팀, 재무팀

1인 실현 가능성
2/5

LLM API 연동 및 데이터 분석 역량이 필요하며, 경쟁사 대비 차별화된 가치를 제공하기 위한 기술적 깊이가 요구됩니다.

진입 지점 (Wedge)

LLM API 사용량 및 품질 모니터링 대시보드 SaaS (특정 LLM, 특정 사용 사례에 특화)

이번 주 첫 실험

LLM API 사용량이 많은 개발자/기업 5곳을 인터뷰하여 현재 겪는 모니터링 및 비용 예측의 어려움을 구체적으로 파악합니다.

Original source
이 글은 news.hada.io의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기