본문으로 건너뛰기

[논문리뷰] StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

링크: 논문 PDF로 바로 열기

메타데이터

저자: Yan Yang, Xiangru Jian, Ziyang Luo, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • State-Grounding: 화면의 픽셀 정보를 넘어 파일, 애플리케이션 백엔드, DOM 등 실제 프로그램 상태를 관찰하고 수정하는 핵심 설계 원칙입니다.
  • State-Addressable: 코드를 통해 타겟 아티팩트에 직접 접근하고 수정할 수 있는 작업 유형을 지칭합니다.
  • Finish Gate: 에이전트의 경로 기록을 참조하지 않고, 오직 실제 persisted artifact만을 독립적으로 검사하여 구조적 완결성을 검증하는 독립적인 모듈입니다.
  • GUI Subagent: 시스템 상태만으로 해결하기 어려운 시각적 상호작용이 필요한 경우에만 제한적으로 호출되는 별도의 에이전트입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존 컴퓨터 사용 에이전트가 화면의 Pixels 정보에만 의존할 때 발생하는 손실 정보 문제와 장기 작업(Long-Horizon Task)에서의 성능 한계를 해결하고자 합니다. 픽셀은 상태의 Lossy rendering 결과물이며, 서로 다른 상태가 동일한 화면을 출력할 수 있기 때문에 복잡한 장기 작업에서 에이전트의 판단 오류를 누적시킵니다. 기존 연구들은 주로 시각적 인지 능력 향상에 집중하였으나, 작업의 완결성은 Program State에 의해 결정되므로 근본적인 개선이 필요합니다 [Figure 3].

Figure 3: Pixel 채널과 State 채널의 비교

Figure 3 — Pixel 채널과 State 채널의 비교

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 StateAct라는 코드 우선(Code-first) 멀티 에이전트 프레임워크를 제안합니다 [Figure 2]. StateAct는 메인 에이전트가 Bash, Python 등을 통해 프로그램 상태를 직접 조작하도록 구성되며, 시각적 조작이 필수적인 1.1%의 단계에서만 GUI subagent를 위임합니다. 검증 단계에서는 Finish Gate를 통해 독립적으로 결과물을 확인하며, Context 관리 기술을 통해 장기 실행을 안정화합니다 [Figure 5]. 실험 결과, Claude Opus 4.8 기준 Binary Success를 20.6%에서 26.9%로, Mean Partial Success를 54.8%에서 61.6%로 향상시켰습니다 [Table 1]. 특히, 기존 스크린샷 기반 모델 대비 약 9배 낮은 비용으로 더 높은 성능을 달성하며 OSWorld 2.0에서 최고 수준의 효율성을 입증했습니다 [Figure 6].

Figure 2: StateAct의 전체 아키텍처 다이어그램

Figure 2 — StateAct의 전체 아키텍처 다이어그램

4. Conclusion & Impact (결론 및 시사점)

본 연구는 장기 컴퓨터 사용 작업에서 에이전트의 성능 병목이 '보는 것(Perception)'이 아닌 '생각하는 것(Reasoning)'으로 이동했음을 확인하였습니다. State-Grounding 원칙을 통해 상태 중심의 관찰과 검증이 에이전트의 신뢰성과 효율성을 동시에 높일 수 있음을 증명했습니다. 향후 연구는 프롬프트 수준의 구조적 검증을 넘어, 모델의 가치 판단(Value correctness)을 정밀하게 교정할 수 있는 새로운 아키텍처 발전에 기여할 것입니다.

Figure 1: StateAct의 성능 및 비용 효율성 비교

Figure 1 — StateAct의 성능 및 비용 효율성 비교

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글