본문으로 건너뛰기

[논문리뷰] KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

링크: 논문 PDF로 바로 열기

메타데이터

저자: Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Know-Route-Act-Reflect: 본 논문에서 제안하는 4단계 실행 프레임워크로, 정보 수집(Know), 작업 분해 및 라우팅(Route), GUI 실행(Act), 그리고 사후 반성을 통한 지식 추출(Reflect)을 순차적으로 수행합니다.
  • GUIClaw: GUI 환경에서의 복잡한 작업 수행을 전담하는 경량화된 subagent로, Hybrid Action Space를 활용하여 시스템 내에서 효율적인 조작을 수행합니다.
  • Blackboard: 멀티 앱 워크플로우에서 서브태스크 간의 데이터 전달을 가능하게 하는 구조화된 메모리 공간입니다.
  • POMDP (Partially Observable Markov Decision Process): GUI 자동화 환경을 모델링하는 수학적 프레임워크로, 에이전트가 가려진 장치 상태(Hidden device state) 내에서 불완전한 관측값(Screenshot, History 등)만을 가지고 의사결정을 내려야 함을 의미합니다.
  • Experience-Attributable Memory: 과거 수행한 작업의 성공 및 실패 사례로부터 학습하여 향후 작업의 정확도와 효율성을 개선하는 정적인 정책 저장소입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존의 OpenClaw 계열 에이전트가 GUI 환경에서의 복잡한 작업 자동화 시 겪는 구조적 한계를 해결하고자 합니다. 기존 방식은 플랫폼 간의 호환성이 부족하고, 지속적인 학습을 통한 성능 향상 메커니즘이 부재하여 다양한 기기 환경에 적응하기 어렵다는 문제점이 있습니다. 또한 GUI 조작 시나리오에서 시각적 정보만으로는 전체 장치 상태를 파악하기 어려우며, 작업 후 경험을 재사용하지 않아 비효율적인 탐색이 반복되는 경향이 있습니다. 따라서 저자들은 "Know Deeply, Act Perfectly"라는 새로운 패러다임을 통해 사용자 경험을 축적하고 이를 실질적인 작업 효율로 전환하는 프레임워크를 제안합니다 [Figure 2].

Figure 2: KnowAct-GUIClaw 실행 루프

Figure 2 — KnowAct-GUIClaw 실행 루프

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 host agent와 GUI subagent 간의 역할을 명확히 분리하여, 지식 기반의 라우팅과 숙련된 스킬 재사용을 최적화하는 KnowAct-GUIClaw를 제안합니다. Know 단계에서는 경험 메모리를 활용하여 작업 맥락을 풍부하게 하고, Route 단계에서는 blackboard를 통해 서브태스크 간 입출력을 명확히 전달하며, Act 단계에서는 Hybrid Action Space (GUI primitives, skills, shortcuts)를 사용해 수행 효율을 극대화합니다 [Figure 4]. 마지막으로 Reflect 단계에서 과거 Trajectory를 스킬과 정책으로 변환하여 시스템의 자기 진화를 지원합니다. 실험 결과, KnowAct-GUIClawMobileWorld 벤치마크에서 64.1%의 성공률을 기록하여 Seed-2.0-ProGPT-5.5 등 기존 SOTA 모델을 능가하였습니다. 특히 Kimi-2.6 기반 모델은 기존 대비 성능 우위를 점했으며, Qwen3.5-35B-A3B 베이스 모델 사용 시 스킬 라이브러리 도입을 통해 성능이 16.2% 향상되는 결과를 보였습니다 [Figure 1].

Figure 1: MobileWorld 성공률 비교

Figure 1 — MobileWorld 성공률 비교

Figure 4: Blackboard 기반 실행 모델

Figure 4 — Blackboard 기반 실행 모델

4. Conclusion & Impact (결론 및 시사점)

본 연구는 GUI 자동화 에이전트가 단순히 현재 화면에 반응하는 단계를 넘어, 과거의 상호작용 경험을 체계적으로 구조화하여 재사용할 수 있음을 입증하였습니다. KnowAct-GUIClaw 프레임워크는 플랫폼 독립적인 확장성과 스스로 진화하는 메모리 시스템을 제공함으로써, 실제 모바일 및 데스크탑 환경에서의 개인화된 에이전트 개발에 중요한 전환점을 제시합니다. 이 연구는 LLM 기반 에이전트가 장기적으로 학습하고 적응하는 능력을 향상함으로써, 산업계의 개인화된 AI 비서 생태계 구축에 크게 기여할 것으로 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글