알리바바(Alibaba)가 AI 에이전트의 스킬(Skill) 품질을 측정하고 개선하기 위한 오픈소스 도구인 '스킬업(skill-up)'을 공개했습니다. 이 도구는 에이전트 스킬의 회귀 테스트(regression testing)를 자동화하여, 개발자들이 AI 에이전트의 기능이 의도대로 작동하는지 반복적으로 검증하고 발전시킬 수 있도록 돕습니다. 이는 AI 에이전트 개발 과정에서 발생하는 오류를 줄이고 안정성을 확보하는 데 중요한 역할을 합니다.
스킬업의 핵심은 '평가-진화 루프(Eval-to-Evolution Loop)'입니다. 개발자는 선언적 YAML 파일을 통해 평가 환경, 에이전트 엔진, 모델, 그리고 테스트 케이스를 정의할 수 있습니다. 스킬업은 Qoder CLI, Claude Code, Codex 등 다양한 에이전트 엔진을 지원하며, 규칙 기반(rule_based), 스크립트(script), 에이전트 저지(agent_judge) 등 유연한 평가 전략을 제공합니다. 특히 '스킬어퍼(skill-upper)'라는 자체 AI 에이전트 스킬을 통해 자연어 대화로 평가를 생성하고, 실패 원인을 진단하며, 자동으로 테스트 케이스를 수정하거나 확장하여 스킬업을 재실행하는 과정을 반복함으로써 스킬의 품질을 지속적으로 향상시킬 수 있습니다.
이러한 스킬업은 기존의 비체계적인 AI 에이전트 평가 방식을 대체하여, 재사용 가능한 CLI 워크플로우를 제공합니다. 이는 개발자들이 수작업으로 진행하던 평가 및 개선 작업을 자동화하여 시간과 노력을 절감하게 합니다. 또한, 앤트로픽(Anthropic) 스타일의 evals.json 호환성을 유지하면서도 더 풍부한 저지 기능과 CI(Continuous Integration) 친화적인 명령, 구조화된 보고서를 제공하여 AI 에이전트 개발 생태계 전반의 효율성과 신뢰도를 높이는 데 기여할 것으로 보입니다. 결과적으로 스킬업은 AI 에이전트의 복잡성이 증가함에 따라 필수적인 품질 관리 도구로 자리매김할 잠재력을 가지고 있습니다.