AI 에이전트가 점점 더 복잡한 환경에 배포되면서, 이들의 행동을 이해하는 것이 매우 중요해지고 있습니다. 하지만 현재까지 AI 에이전트에 대한 행동 과학 연구는 대부분 수동으로 이루어져 많은 시간과 노력이 필요했습니다. 이러한 한계를 극복하기 위해 한국 연구진이 주도하여 개발한 멀티 에이전트 시스템 'AEROBAT'이 AI 에이전트 행동 과학 연구의 전 과정을 자동화하는 혁신적인 솔루션을 제시했습니다.
AEROBAT은 사용자가 특정 행동을 지정하면, 해당 행동에 대한 가설을 자동으로 생성하고, 이를 검증하기 위한 통제된 실험을 설계 및 실행합니다. 이후 행동 평가를 수행하고, 결과를 분석하며, 최종적으로 보고서까지 작성하는 일련의 연구 파이프라인을 완전히 자동화합니다. 연구팀은 12가지 목표 행동에 대해 AEROBAT을 활용하여 총 79개의 가설을 생성하고 검증했으며, 이를 위해 1,240개의 통제된 실험을 설계하고 23,512회의 시뮬레이션을 실행했습니다. 이 과정에서 일부 새로운 가설을 포함해 26개 가설에서 통계적으로 유의미한 증거를 발견하며, 자동화된 연구의 잠재력을 입증했습니다.
AEROBAT의 등장은 AI 에이전트의 행동을 이해하고 예측하는 방식에 큰 변화를 가져올 것입니다. 기존의 수동 연구를 보완하고 그 범위를 확장함으로써, 연구자들은 훨씬 더 많은 가설을 효율적으로 검증하고, 복잡한 AI 시스템의 예상치 못한 행동 패턴을 빠르게 식별할 수 있게 됩니다. 이는 AI의 신뢰성과 안전성을 높이는 데 기여할 뿐만 아니라, 새로운 AI 에이전트의 개발 및 최적화 과정에도 중요한 통찰력을 제공하여 AI 기술 발전의 속도를 가속화할 것으로 기대됩니다.
