기업용 AI 에이전트의 개발과 확장은 항상 실제 데이터 접근의 어려움에 부딪혀 왔습니다. 비즈니스 및 법적 제약으로 인해 기업 시스템, 데이터, 데이터베이스 스키마에 대한 접근이 제한되기 때문입니다. 이러한 문제를 해결하기 위해 '시뮬레이션을 통한 합성(Synthesis Through Simulation, STS)'이라는 새로운 데이터 합성 패러다임이 제안되었습니다.
STS는 대규모 언어모델(LLM) 에이전트가 시뮬레이션된 기업 환경 내에서 정책을 준수하는 API(응용 프로그래밍 인터페이스)를 실행하며 데이터를 생성하는 방식입니다. 이 접근 방식의 핵심은 데이터가 유효성을 정의하는 동일한 환경을 통해 생성되므로, 구조적 유효성이 본질적으로 보장된다는 점입니다. 또한, 유효성 강제와 데이터 분포 모델링을 분리하여 각각을 독립적으로 다룰 수 있게 합니다. STS의 핵심 구성 요소인 '제너럴리스트 포퓰레이터(Generalist Populator, GP)'는 도메인에 구애받지 않는 에이전트로, 데이터베이스 스키마에 접근하지 않고도 10개 환경에서 평균 0.88의 높은 주변 충실도와 100%의 제약 조건 충족률을 달성했습니다. 이는 기존 통계적 합성 방식이나 스키마 기반 에이전트가 가진 한계를 극복하는 중요한 성과입니다.
STS는 기업들이 민감한 실제 데이터에 대한 의존도를 낮추면서도 고품질의 합성 데이터를 대규모로 생성하여 AI 에이전트를 훈련하고 평가할 수 있는 길을 열어줍니다. 이는 특히 규제가 엄격하거나 데이터 보안이 중요한 산업에서 AI 도입을 가속화하는 데 크게 기여할 수 있습니다. 기업들은 이제 실제 시스템에 영향을 주지 않고도 다양한 시나리오를 시뮬레이션하고 에이전트의 견고성을 테스트할 수 있게 되어, AI 기술의 실제 적용 가능성을 한층 높일 수 있을 것으로 기대됩니다.