최근 멀티모달 GUI(그래픽 사용자 인터페이스) 에이전트가 디지털 작업 자동화의 유망한 패러다임으로 떠오르고 있습니다. 하지만 기존 모델들은 제한된 환경 지원, 취약한 작업 구성, 신뢰하기 어려운 보상 검증 등의 문제로 인해 실제 애플리케이션에 적용하기 어려웠습니다. 이러한 한계를 극복하기 위해 '비너스 팀(Venus Team)'은 모바일, 웹, 데스크톱 환경 전반에서 작동하는 범용 GUI 에이전트인 UI-Venus-2를 공개했습니다.
UI-Venus-2는 통합된 폐쇄 루프 추론-행동 프레임워크를 통해 다양한 환경에서 작동하도록 설계되었습니다. 특히 실제 배포를 위해 세 가지 핵심 영역을 확장했습니다. 첫째, 환경 지원을 170개 이상의 다국어 모바일 앱과 네이티브 데스크톱 운영체제로 대폭 확대했습니다. 둘째, 기능 기반 명령어 생성을 위한 심층 연구 파이프라인을 활용하여 작업 구성을 강화했습니다. 셋째, 시각적 키포인트와 다중 모델 투표를 사용하는 추적 수준 및 샘플 수준 평가자를 도입하여 훈련을 위한 신뢰할 수 있는 강화 학습(RL) 신호를 보장합니다. 또한, 중요한 작업 실행 시 통제된 작동을 보장하기 위한 안전 인식 메커니즘도 통합했습니다.
이러한 발전은 GUI 에이전트 분야를 더욱 일반화되고, 검증 가능하며, 자기 성찰적인 실제 애플리케이션으로 나아가게 할 것입니다. UI-Venus-2는 강력하고 효율적인 오픈소스 기반 모델로서, 개발자들이 다양한 디지털 환경에서 복잡한 작업을 자동화하는 데 필요한 도구를 제공합니다. 이는 사용자 경험을 혁신하고, 반복적인 수동 작업을 줄여 생산성을 크게 향상시킬 잠재력을 가지고 있습니다. 궁극적으로 AI가 인간의 디지털 상호작용을 보조하고 확장하는 새로운 가능성을 열어줄 것으로 기대됩니다.