앤트로픽(Anthropic)의 최신 대규모 언어모델(LLM) 클로드 오푸스(Claude Opus) 5.5가 출시된 지 얼마 되지 않아, 일부 사용자들 사이에서 모델 성능이 출시 초기에 비해 저하되었다는 이른바 '너프(nerf)' 의혹이 제기되었습니다. 이러한 의혹은 대규모 언어모델 시장에서 흔히 나타나는 현상으로, 모델 제공사들이 비용 절감이나 최적화를 위해 출시 후 모델을 변경할 수 있다는 우려에서 비롯됩니다. 이에 '닌자호크(ninjahawk)'라는 개발자가 '리브너프(livenerf)'라는 오픈소스 프로젝트를 시작하여, 클로드 오푸스 5.5의 성능 변화를 장기적이고 결정론적인 방식으로 측정하고 있습니다.
리브너프는 모델이 출시된 이후 조용히 성능이 저하되는지 여부를 탐지하기 위한 작고 반복적인 벤치마크 도구입니다. 이 프로젝트는 클로드 오푸스 5.5가 2026년 9월 22일에 출시된 시점부터 측정을 시작하여, 초기 성능을 기준선(baseline)으로 삼고 매일 모델의 응답을 기록합니다. 특히, 샘플링 매개변수나 '사고(thinking)' 과정을 제어할 수 없는 모델의 특성을 고려하여, 프롬프트(prompt) 고정, CLI(명령줄 인터페이스) 버전 고정, 채점자(grader) 고정 등 다른 모든 요소를 결정론적으로 만들어 통계적 편향을 최소화했습니다. 이 벤치마크는 영국 AI 보안 연구소(UK AI Security Institute)의 오픈소스 평가 프레임워크인 '인스펙트(Inspect)'를 기반으로 하며, 앤트로픽 자체의 오류 막대(error bar) 추가 방식론을 따릅니다. 총 2,336개의 GPQA 다이아몬드, MMLU-Pro, 경쟁 수학, AIME 2025-26 질문을 스크리닝하여, 오푸스 5.5가 때때로 정답을 맞히는 78개의 질문을 패널로 선정했습니다. 이 패널은 10일 동안 하루에 한 번씩 전체 패널을 실행하여 약 7.5점의 정확도 변화를 감지할 수 있습니다.
이러한 장기적인 성능 모니터링은 대규모 언어모델의 투명성을 높이고, 모델 제공사와 사용자 간의 신뢰를 구축하는 데 중요한 의미를 가집니다. 사용자들이 모델의 성능 저하를 '느낌'에 의존하는 것이 아니라, 객관적인 데이터를 통해 변화를 확인할 수 있게 됨으로써, 모델 제공사들은 성능 유지에 대한 책임감을 더 느끼게 될 것입니다. 또한, 이 프로젝트는 모델의 정확도뿐만 아니라 출력 토큰(output token) 수의 변화도 측정하여, 모델이 '덜 생각하는' 경향이 있는지 여부도 파악하려 합니다. 이는 모델의 '노력(effort)' 수준이 조용히 변경될 경우, 정확도 변화보다 먼저 나타날 수 있는 중요한 지표이기 때문입니다. 궁극적으로 리브너프는 대규모 언어모델 생태계에서 모델 성능 변화에 대한 객관적인 기준을 제시하고, 사용자들에게 더 나은 정보와 통제권을 제공하는 데 기여할 것으로 기대됩니다.