AI 에이전트의 성능을 시각적인 '데모'가 아닌 실제 '평가(evals)' 기록으로 검증하는 새로운 접근 방식의 스킬 저장소 'skills'가 공개되어 주목받고 있습니다. 이 저장소는 각 AI 에이전트 스킬에 대한 회귀 평가(regression eval) 추적 기록을 핵심 아티팩트로 제공하며, 이를 통해 개발자들이 스킬의 실제 성능과 신뢰도를 투명하게 파악하고 개선할 수 있도록 돕습니다. 이는 기존의 보여주기식 데모 위주 검증 방식에서 벗어나, 데이터 기반의 객관적인 성능 검증을 지향한다는 점에서 의미가 큽니다.
'skills' 저장소는 현재 'world-cup-picks-report'라는 월드컵 경기 예측 보고서 생성 스킬을 예시로 제공하고 있습니다. 이 스킬은 2026년 월드컵 결과를 예측하는 보고서를 생성하며, 그 성능은 'Anthropic' 기반의 대규모 언어모델(LLM) 심사위원(judge)을 활용한 회귀 평가를 통해 지속적으로 검증됩니다. 개발자들은 이 평가 대시보드를 통해 스킬의 주요 지표와 시간 경과에 따른 회귀 추세, 그리고 모든 작업 및 시도 기록을 상세히 확인할 수 있습니다. 또한, 'npx skills add' 명령어를 통해 스킬을 설치하거나, 클로드 코드(Claude Code) 마켓플레이스를 통해 추가하여 사용할 수 있습니다.
이러한 '평가 기반' 접근 방식은 AI 에이전트 개발 및 활용에 있어 여러 중요한 함의를 가집니다. 첫째, 스킬의 신뢰성과 재사용성을 크게 향상시킬 수 있습니다. 개발자들은 검증된 평가 기록을 통해 특정 스킬이 얼마나 안정적이고 정확하게 작동하는지 객관적으로 판단할 수 있게 됩니다. 둘째, 스킬 개선 과정의 투명성을 높입니다. 새로운 코드 변경이 스킬 성능에 어떤 영향을 미치는지 회귀 평가를 통해 즉시 확인하고, 그 결과를 새로운 기준선(baseline)으로 설정하여 지속적으로 품질을 관리할 수 있습니다. 궁극적으로 이는 AI 에이전트 생태계 전반의 품질 표준을 높이고, 더욱 견고하고 신뢰할 수 있는 AI 애플리케이션 개발을 촉진할 것으로 기대됩니다.