최근 아카이브(arXiv)에 발표된 논문 'WMLLM: Predict-Then-Act World Modeling을 통한 자기 진화 최적화 에이전트'는 대규모 언어모델(LLM)을 활용하여 복잡한 블랙박스 최적화(black-box optimization) 문제 해결의 새로운 가능성을 제시했습니다. 이 연구는 LLM이 지닌 암묵적 지식(implicit knowledge)을 바탕으로, 비용이 많이 드는 실제 평가에 앞서 최적화 후보의 결과를 예측함으로써 탐색 효율성을 획기적으로 개선하는 데 초점을 맞춥니다.
WMLLM은 '예측-행동(predict-then-act)' 월드 모델링에 기반한 자기 진화 최적화 에이전트 프레임워크입니다. 이 에이전트는 먼저 유망한 최적화 방향을 예측한 다음, 이를 바탕으로 실제 후보를 생성하는 방식으로 작동합니다. 특히, 에이전트 기반의 다중 턴 개선(multi-turn refinement), 집단 기반 탐색(population-based search), 그리고 강화 학습(reinforcement learning) 기법을 결합하여 탐색 과정에서 암묵적 월드 모델과 최적화 전략을 동시에 정교하게 다듬습니다. 이러한 접근 방식은 기존의 직접적인 후보 생성이나 시행착오 방식이 겪는 낮은 샘플 효율성(sample efficiency) 문제를 극복합니다.
실험 결과, WMLLM은 블랙박스 최적화 작업, 특히 다목적 분자 최적화(multi-objective molecular optimization) 벤치마크에서 뛰어난 성능을 보였습니다. 제한된 평가 예산(evaluation budget) 내에서도 기존 최첨단(state-of-the-art) 방법론들을 능가하는 결과를 달성하며, 샘플 효율성과 최종 최적화 성능 모두에서 상당한 개선을 입증했습니다. 이는 LLM이 단순한 텍스트 생성 도구를 넘어, 복잡한 문제 해결을 위한 강력한 추론 및 최적화 도구로 진화할 수 있음을 시사합니다.