AI 애플리케이션(AI 앱) 개발의 가장 큰 난제 중 하나는 비결정론적 특성으로 인한 신뢰성 확보와 지속적인 성능 개선입니다. 이러한 문제를 해결하기 위해 AI 평가 시스템의 레퍼런스 구현체인 '웨이파인더(Wayfinder)'가 공개되어 AI 엔지니어들에게 실질적인 도움을 줄 것으로 기대됩니다. 웨이파인더는 AI 앱이 개발 단계부터 프로덕션 환경에 이르기까지 어떻게 진화하고 평가되어야 하는지에 대한 포괄적인 접근 방식을 제시합니다.
웨이파인더는 AI 기반 항공편 검색 애플리케이션을 예시로, 다양한 평가 기법들을 단계별로 적용하는 과정을 보여줍니다. 여기에는 규칙 기반 평가(Rule-Based Evaluation), 인간 평가(Human Evaluation), LLM-as-a-Judge(대규모 언어 모델 기반 평가), 온라인 평가(Online Evaluation) 및 실험 비교(Experiment Comparison)가 포함됩니다. 특히, 랭스미스(LangSmith)와의 통합을 통해 사용자 상호작용 추적 및 명시적 피드백 수집, 자동화된 품질 점수 부여 등 실제 운영 환경에서의 평가를 지원합니다. 이 프로젝트는 'AI 엔지니어링 기초 — AI 평가' 아티클 시리즈와 함께 개발되어, 각 평가 기법의 개념과 실제 구현을 동시에 학습할 수 있도록 구성되었습니다.
웨이파인더의 등장은 AI 앱 개발 생태계에 중요한 의미를 가집니다. AI 앱의 개선 여부, 최신 변경 사항으로 인한 회귀(regression) 발생 여부, 유용성이나 근거성 같은 주관적인 품질 평가 방법, 수동 검토를 넘어선 평가 확장성, 그리고 AI 앱을 프로덕션에 자신 있게 배포하는 방법 등 AI 엔지니어들이 직면하는 핵심 질문에 대한 실용적인 해답을 제시하기 때문입니다. 이는 AI 앱의 안정적인 배포와 지속적인 발전을 가능하게 하여, 궁극적으로 사용자에게 더 나은 AI 경험을 제공하는 데 기여할 것입니다.