대규모 언어모델(LLM)을 활용한 자동화 시스템이 발전하면서, LLM, 외부 도구, 제어 로직을 유기적으로 연결하는 에이전트 워크플로우(agentic workflow)의 중요성이 커지고 있습니다. 하지만 이러한 고품질 워크플로우를 구축하는 작업은 여전히 수동으로 이루어지며, 상당한 전문 지식을 요구하는 복잡한 과정입니다.
최근 연구들은 과거 작업 해결 기록을 바탕으로 에이전트 워크플로우를 자동으로 생성하는 방안을 모색해왔습니다. 그러나 기존 방식은 주로 LLM 중심의 워크플로우를 생성하여 실제 도구 실행을 LLM 노드가 추상화하거나 시뮬레이션하는 데 그쳤습니다. 이는 생성된 워크플로우의 유용성과 안정성을 제한하는 요인이었습니다. 이러한 한계를 극복하기 위해 제안된 FlowScout은 실행 피드백(execution feedback)을 활용하여 도구가 통합된 에이전트 워크플로우를 과거 작업 기록으로부터 생성하는 프레임워크입니다. FlowScout은 워크플로우를 LLM 노드, 도구 호출 노드, 그리고 이들 간의 의존성 에지(dependency edge)로 구성된 방향성 그래프로 표현합니다. 먼저 과거 기록에서 공통적인 도구 조정 골격(tool coordination skeleton)을 추출하여 초기 워크플로우를 구축한 다음, 몬테카를로 트리 탐색(Monte Carlo tree search)과 실행 피드백을 통해 워크플로우 토폴로지(topology)를 정교하게 다듬습니다.
FlowScout은 네 가지 대표적인 작업 도메인에서 PM4Py, ReAct, AFlow 등 세 가지 기준 모델(baseline)과 비교 평가되었습니다. 실험 결과, FlowScout이 생성한 에이전트 워크플로우는 기준 모델 대비 도구 호출 정확도를 최소 92.69% 이상, 실행 품질을 최소 17.66% 이상 개선하는 것으로 나타났습니다. 또한, 반복 실행 시 성능 편차(performance variation)도 더 낮아 전반적인 안정성이 크게 향상되었습니다. 이는 LLM 기반 자동화 시스템이 실제 환경에서 더욱 신뢰성 있고 효율적으로 작동할 수 있음을 시사하며, 복잡한 작업을 자동화하는 데 있어 중요한 진전을 의미합니다.