AI 에이전트의 신뢰성 확보는 개발자들의 오랜 숙제였습니다. 특히 실제 서비스 환경(production)에서 발생하는 미묘한 오류들은 샘플링 기반의 평가(sampled evals)로는 놓치기 쉬웠습니다. 이러한 문제를 해결하기 위해 오픈소스 AI 에이전트 신뢰성 플랫폼 '테서리(Tessary)'가 등장했습니다. 테서리는 모든 프로덕션 트레이스(trace)를 모니터링하여 샘플링 방식으로는 놓칠 수 있는 문제들을 감지하고, 그 근본 원인을 파악할 수 있도록 돕습니다.
테서리는 오픈텔레메트리(OpenTelemetry) 표준을 활용하여 AI 에이전트의 모든 실행 과정을 추적합니다. 수집된 트레이스는 저렴한 분류기(classifier)를 통해 실시간으로 분석되며, 문제가 감지되면 '발견(finding)'으로 기록됩니다. 특히 개인 식별 정보(PII)는 저장 전에 자동 제거되어 보안을 강화합니다. 관련성이 높은 발견들은 하나의 '케이스(case)'로 묶여 개발자가 효율적으로 문제를 검토할 수 있도록 돕습니다. 또한, 테서리는 연결된 깃허브(GitHub) 저장소의 코드까지 분석하여 오류의 근본 원인(root cause)을 찾아내고, 이를 한 문장 요약과 함께 제공하여 문제 해결 시간을 단축시킵니다. 사용자는 클라우드 버전(Tessary Cloud)을 무료로 사용하거나, 도커(Docker)를 이용해 자체 호스팅(self-host)할 수도 있습니다.
테서리의 등장은 AI 에이전트 개발 및 운영 방식에 중요한 변화를 가져올 수 있습니다. 기존에는 AI 에이전트의 성능 평가에 막대한 비용과 시간이 소요되거나, 샘플링으로 인해 실제 서비스에서의 치명적인 오류를 놓치는 경우가 많았습니다. 테서리는 모든 트레이스를 저비용으로 모니터링함으로써 이러한 한계를 극복하고, 개발자들이 AI 에이전트의 안정성을 크게 향상시킬 수 있도록 지원합니다. 이는 AI 에이전트 기반 서비스의 신뢰도를 높여 사용자 경험을 개선하고, 궁극적으로 AI 기술의 상용화와 확산에 긍정적인 영향을 미칠 것으로 예상됩니다.