대규모 언어모델(LLM) 기반 에이전트가 외부 도구를 사용할 때 발생하는 고질적인 문제인 느린 응답 속도를 획기적으로 개선하는 새로운 기술, '투기적 매크로 커밋(SMC: Speculative Macro Commit)'이 공개되었습니다. 이 기술은 모델 추론(inference) 시간뿐만 아니라, 도구 호출, 환경 변화, 관찰 등 연속적인 행동-관찰(action-observation) 과정에서 발생하는 지연을 줄이는 데 초점을 맞춥니다. SMC는 두 개의 계층으로 구성된 에이전트 시스템을 활용하여, 더 빠르고 효율적인 에이전트 작동을 가능하게 합니다.
SMC의 핵심은 '권위 있는 액터 모델(authoritative actor model)'과 '투기적 드래프터 모델(speculative drafter model)'이라는 두 가지 모델을 사용하는 데 있습니다. 크고 강력한 액터 모델이 공식적인 작업 경로를 생성하는 동안, 더 작고 빠른 드래프터 모델은 독립된 환경 스냅샷에서 미래의 행동 체인(action chain)을 지속적으로 예측하고 미리 실행합니다. SMC는 훈련 과정에서 반복적으로 나타나는 다중 행동 골격(multi-action skeletons)을 매크로 라이브러리에 저장하고, 런타임에 드래프터가 예측한 행동 체인과 일치하는지 확인합니다. 만약 액터 모델의 다음 도구 호출이 드래프터가 예측한 첫 번째 행동과 일치하면, SMC는 미리 실행된 나머지 드래프트 단계와 그에 따른 관찰 결과를 공식 경로에 한 번에 반영(commit)하여 여러 단계를 동시에 처리합니다. 연구진은 권위 있는 액터 모델로 Qwen3.5-27B INT4를, 투기적 드래프터 모델로 Qwen3.5-4B를 사용하여, 기존 순차 실행 방식 대비 최대 44.9%, 투기적 행동(Speculative Actions, SA) 기준선 대비 7.7%의 응답 시간(wall time) 단축 효과를 확인했습니다.
이 기술은 LLM 에이전트의 실용성을 크게 높일 잠재력을 가지고 있습니다. 현재 LLM 에이전트는 복잡한 작업을 수행하기 위해 여러 도구를 순차적으로 호출해야 하므로, 각 단계마다 발생하는 지연이 누적되어 전체 작업 시간이 길어지는 문제가 있습니다. SMC는 이러한 병목 현상을 해결하여 에이전트가 더 빠르고 유연하게 작동하도록 돕습니다. 이는 사용자 경험을 개선할 뿐만 아니라, 실시간 상호작용이 중요한 애플리케이션(예: 게임, 로봇 제어, 복잡한 데이터 분석)에서 LLM 에이전트의 활용 범위를 넓힐 수 있습니다. 궁극적으로 SMC는 LLM 에이전트가 실제 환경에서 더욱 효율적이고 신뢰할 수 있는 조력자가 될 수 있는 중요한 발판을 마련합니다.