본문으로 건너뛰기

[논문리뷰] UI-Venus-2 Technical Report

링크: 논문 PDF로 바로 열기

메타데이터

저자: Venus Team, Zhuohan Cai, Haoxing Chen, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • UI-Venus-2: Mobile, Web, Desktop 환경 전반에서 동작하도록 설계된 통합형 General-purpose Foundation GUI Agent입니다.
  • Closed-loop Reasoning–Action Framework: 인터페이스를 관찰(Observe)하고 의도를 추론(Reason)한 뒤, 환경의 피드백을 반영하여 액션을 실행(Execute)하는 순환적 상호작용 체계입니다.
  • MOPD (Multi-teacher On-policy Distillation): 서로 다른 도메인과 훈련 단계에서 얻은 지식을 통합하기 위해, 학생 모델의 샘플링 경로를 여러 교사 모델이 평가하여 학습하는 기법입니다.
  • SGV (Semantic Guided Verification): VLM as a Judge를 활용하여 에이전트의 실행 경로가 작업 목표와 의미적으로 일치하는지 평가하는 궤적 수준(Trace-level) 검증 메커니즘입니다.
  • Deep Research Pipeline: 공식 문서, 사용자 토론, 워크플로우 등 다양한 소스에서 앱 기능을 추출하여 실행 가능한 작업(Task)을 대규모로 자동 생성하는 시스템입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존 GUI 에이전트가 벤치마크 점수 향상에는 성공했으나, 실제 환경에서의 신뢰성(Dependability)과 범용성(Generalization) 측면에서 여전히 한계를 가지고 있다는 점을 지적합니다 [Figure 1]. 기존 연구들은 환경 커버리지의 부족, 태스크 생성의 취약성, 그리고 보상 신호(Reward Signal)의 불명확성이라는 세 가지 핵심적인 병목 현상을 겪고 있습니다. 특히, 기존의 보상 검증 방식은 표면적인 진행 상태만을 측정하거나 보상 해킹(Reward Hacking)에 취약하여 에이전트의 실질적인 학습을 저해하는 문제가 있습니다. 이러한 문제를 해결하기 위해 본 연구는 환경, 태스크 생성, 검증 단계를 통합적으로 스케일링하는 UI-Venus-2를 제안합니다 [Figure 2].

Figure 1: GUI 벤치마크 성능 비교

Figure 1 — GUI 벤치마크 성능 비교

Figure 2: 시스템 아키텍처 개요

Figure 2 — 시스템 아키텍처 개요

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 에이전트의 학습 효율과 성능을 극대화하기 위해 3단계 훈련 파이프라인을 제안합니다 [Figure 3]. 1단계는 대규모 데이터셋을 활용한 Multimodal Mid-Training, 2단계는 도메인별 데이터에 최적화된 Offline Reinforcement Learning, 3단계는 MOPD를 통해 도메인별 능력을 하나의 통합 모델로 병합하는 과정입니다. 특히 Structured Action-Aware Distillation을 도입하여 응답 중 실행(Execution)과 관련된 액션 토큰에 더 높은 가중치를 두어 학습의 효율성을 높였습니다.

정량적 성과로 UI-Venus-2-27B는 Mobile, Web, Desktop 등 다수의 GUI 벤치마크에서 기존의 강력한 베이스라인 대비 압도적인 성능 우위를 보였습니다. 특히 MobileWorld에서 50단계 이내 GUI 성공률 향상, VenusBench-CAPTCHA에서의 높은 Pass@1 정확도를 기록하며 복잡한 환경에서의 범용성을 입증했습니다 [Figure 1]. 또한, Trace-levelSample-level 검증 체계를 통해 훈련 과정의 신뢰도를 기존 모델 대비 비약적으로 개선했습니다.

4. Conclusion & Impact (결론 및 시사점)

본 논문은 UI-Venus-2를 통해 GUI 에이전트가 단편적인 액션 수행 단계를 넘어 범용적인 Computer Use 능력을 갖춘 기반 모델로 도약할 수 있음을 입증했습니다. 제안된 환경 스케일링 전략과 정밀한 검증 메커니즘은 실질적인 디지털 자동화 애플리케이션을 구현하려는 학계와 산업계에 중요한 이정표가 될 것입니다. 오픈소스 공개를 통해 GUI 에이전트 연구의 진입 장벽을 낮추고, 재현 가능한 강화학습 연구 환경을 제공함으로써 향후 자가 반영(Self-reflective) 에이전트 개발을 가속화할 것으로 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글