킬른 AI(Kiln AI)가 AI 에이전트의 강화 학습(RL) 및 평가 과정을 혁신할 수 있는 오픈소스 프레임워크 'Seahaven'을 발표했습니다. 이 프레임워크는 AI 에이전트가 상호작용할 수 있는 현실적인 가상 세계를 구축하는 데 중점을 두며, 특히 수많은 에이전트 실행을 효율적이고 재현 가능하게 관리하는 데 필요한 복잡한 문제를 해결합니다. '트루먼 쇼'의 가상 도시 이름을 딴 Seahaven은 개발자가 에이전트의 도구와 환경을 쉽게 정의하고, 독립적인 인스턴스에서 병렬로 실행하며, 각 실행의 모든 상태 변화를 기록하여 정확한 평가를 가능하게 합니다.
Seahaven의 핵심 기능은 실제 시스템과 거의 구별할 수 없는 가상 환경을 재현하는 능력입니다. AI 도구 호출, REST API, 샌드박스 SQL, 검색 등 다양한 형태의 상호작용을 모의(mock)할 수 있으며, 각 세계 인스턴스는 자체 독립적인 SQLite 데이터베이스를 가집니다. 이를 통해 수백 개의 세계 인스턴스를 동시에 실행하고, 각 인스턴스는 'small_startup' 또는 'big_co'와 같은 고정된 초기 상태(fixture)에서 시작할 수 있어 평가의 일관성을 보장합니다. 또한, 동일한 초기 상태, 시간, 무작위 시드(random seed)를 사용하면 항상 동일한 실행 결과를 얻을 수 있어 재현성이 매우 높습니다. 에이전트가 변경한 모든 데이터베이스 행은 기록되어 평가에 활용됩니다.
이 프레임워크는 AI 에이전트 개발 및 평가의 효율성을 크게 향상시킬 것으로 기대됩니다. 기존에는 실제 운영 환경이나 수동으로 만든 모의 객체(mock object)로는 수천 번의 에이전트 실행을 독립적이고 재현 가능하게 테스트하기 어려웠습니다. Seahaven은 이러한 제약을 극복하고, 에이전트가 안전하게 실험하고 실패할 수 있는 환경을 제공합니다. 개발자는 파이썬(Python)으로 세계의 스키마와 도구만 작성하면 되며, Seahaven이 병렬 인스턴스, 재현성, 서비스 제공, 변경 로그 관리 등 복잡한 부분을 처리해줍니다. 이는 대규모 언어모델(LLM) 기반 에이전트의 개발 주기를 단축하고, 더욱 견고하고 신뢰할 수 있는 AI 시스템을 구축하는 데 기여할 것입니다.