최근 인공지능(AI) 모델들이 빠르게 발전하고 있지만, 예고 없는 성능 저하, 즉 '너프(nerf)' 현상으로 인해 개발자들이 어려움을 겪는 경우가 많습니다. 모델 제공사들이 업데이트를 진행하면서 특정 기능의 성능이 이전보다 떨어지는 현상이 발생하는데, 이를 명확히 알려주지 않아 개발 과정에 혼란을 초래하곤 합니다. 이러한 문제를 해결하기 위해 '너프트래커(Nerftracker)'라는 서비스가 등장했습니다.
너프트래커는 주요 AI 모델에 동일한 코딩 작업들을 정기적으로 부여하고, 각 모델의 작업 결과물과 소요 시간, API 비용, 토큰 사용량 등을 상세히 추적합니다. 예를 들어, '앵그리버드(Angry Birds) 스타일의 슬링샷 게임'을 자체 물리 엔진으로 구현하는 과제를 여러 모델에 수행하게 하고, 데스크톱 및 모바일 플레이 가능 여부, 타워 히트 여부, 폭탄 새 구현 등 세부적인 기준에 따라 성능을 평가합니다. 이를 통해 GPT-6 아스트라(Astra), 클로드 코드(Claude Code), 제미니 플래시(Gemini Flash) 등 다양한 모델들의 성능 변화를 시각적으로 비교하고, 어떤 모델이 언제 '너프'되었는지 사용자에게 명확하게 보여줍니다.
이 서비스는 AI 모델을 활용하는 개발자들에게 매우 유용합니다. 모델 제공사들이 성능 저하를 공식적으로 발표하지 않는 상황에서, 너프트래커는 독립적인 검증을 통해 개발자들이 실제 작업에 가장 적합하고 안정적인 모델을 선택할 수 있도록 돕습니다. 이는 개발 생산성을 높이고, 예측 불가능한 모델 성능 변화로 인한 프로젝트 지연이나 비용 낭비를 줄이는 데 기여할 것입니다. 궁극적으로는 AI 모델 시장의 투명성을 높이고, 모델 제공사들이 더욱 책임감 있는 업데이트를 하도록 유도하는 효과도 기대할 수 있습니다.