앤트로픽(Anthropic)의 대규모 언어모델(LLM) 클로드 오푸스 5.5(Claude Opus 5.5)가 출시된 지 얼마 되지 않아 성능이 하향되었다는 사용자들의 불만이 제기되고 있습니다. 이러한 의혹에 대한 객관적인 검증을 위해 '리버너프(Livenerf)'라는 독립 벤치마크 프로젝트가 시작되었습니다. 이 프로젝트는 원시 API가 아닌 실제 구독 환경, 즉 클로드 코드(Claude Code) 구독을 통해 오푸스 5.5를 매일 같은 문제로 평가하며 장기적인 성능 변화를 추적합니다.
리버너프는 '출시 후 모델이 나빠지는가'라는 단 하나의 질문에 집중하며, 앤트로픽이 양자화(quantization)나 더 작은 모델 사용 등으로 성능을 낮춘다는 의혹을 검증합니다. 이를 위해 프롬프트, CLI 버전, 추론 설정 및 채점기를 고정하고 응답 원문과 토큰 사용량을 기록해 측정 조건의 영향을 최소화합니다. 특히 항상 정답이거나 오답인 문제 대신 정답 여부가 오가는 78개 문항을 선정하여, 모델의 미묘한 성능 변화를 더 잘 탐지할 수 있도록 설계했습니다. 이 문항들은 GPQA 다이아몬드, MMLU-Pro 등 고난도 문제에서 선별되었으며, 오푸스 5(Opus 5)도 함께 측정하여 공통 환경의 변화와 오푸스 5.5만의 변화를 구분합니다. 현재는 초기 기준선 데이터를 수집 중이며, 30일간의 데이터를 바탕으로 10월 말경 첫 변화 판정이 나올 예정입니다.
이러한 독립적인 벤치마크는 LLM 개발사들이 모델 업데이트 시 성능 변화에 대해 투명하게 공개하지 않는 상황에서 사용자들의 불확실성을 해소하는 데 중요한 역할을 합니다. 특히 API가 아닌 실제 구독 환경의 CLI(명령줄 인터페이스)를 측정한다는 점에서, 일반 사용자들이 체감하는 성능 변화를 더 정확하게 반영할 수 있습니다. 모델의 성능 저하는 사용자 경험 악화는 물론, 이를 기반으로 서비스를 구축하는 개발자들에게도 예측 불가능한 문제를 야기할 수 있기 때문에, 리버너프와 같은 객관적인 검증 노력은 LLM 생태계의 신뢰도를 높이는 데 기여할 것입니다.