[논문리뷰] Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval
링크: 논문 PDF로 바로 열기
본 논문은 웹 에이전트(Web Agent)의 실시간 적응성을 향상시키기 위해 State-Grounded Dynamic Retrieval을 기반으로 한 Online Skill Learning 프레임워크를 제안합니다.
Part 1: 요약 본문
저자: Jiaxi Li, Ke Deng, Yun Wang, Jingyuan Huang, Yucheng Shi, Qiaoyu Tan, Jin Lu, Ninghao Liu
1. Key Terms & Definitions (핵심 용어 및 정의)
- Web Agents: 웹 환경에서 사용자 목표를 달성하기 위해 브라우저와 상호작용하며 복잡한 태스크를 수행하는 자율적 에이전트입니다.
- Online Skill Learning: 에이전트가 새로운 환경이나 변화하는 태스크에 직면했을 때, 사전 학습된 모델을 고정하지 않고 실시간으로 지식과 스킬을 획득하고 갱신하는 과정입니다.
- State-Grounded Dynamic Retrieval: 현재의 상태(State)를 기반으로 관련 스킬이나 지식을 동적으로 검색하여 의사결정을 최적화하는 전략입니다.
- Skill Library: 에이전트가 학습한 다양한 성공적인 행동 패턴(Skill)을 저장하고, 필요시 이를 검색하여 재사용할 수 있도록 구축된 지식 저장소입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 연구는 기존 Web Agent가 복잡하고 동적인 웹 환경에서 일반화된 지식의 한계로 인해 특정 도메인이나 새로운 인터페이스 적응에 실패하는 문제를 해결하고자 합니다. 기존의 방식은 고정된 지식 베이스에 의존하거나 대규모 Offline Pretraining에만 의존하여, 실시간으로 변하는 웹 요소(Web Elements)에 대한 대응력이 부족합니다. 특히, 과거 경험을 구조화된 스킬로 저장하지 못해 유사한 태스크 반복 시 불필요한 추론 비용이 발생하는 비효율성이 존재합니다. 따라서 본 논문은 현재의 State를 효과적으로 반영하여 필요한 정보를 Dynamic Retrieval하는 Online Skill Learning 메커니즘을 도입하여 에이전트의 견고성을 확보합니다. [Figure 1]

Figure 1 — 제안하는 온라인 스킬 학습 프레임워크
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 에이전트가 수행한 성공적인 궤적(Trajectory)에서 핵심 스킬을 추출하고, 이를 State-Grounded 검색이 가능한 Skill Library에 저장하는 프레임워크를 제안합니다. 제안 모델은 Retrieval-Augmented Generation (RAG) 방식을 확장하여, 에이전트가 당면한 State를 쿼리로 변환한 뒤 가장 적합한 스킬을 검색하도록 설계되었습니다. 검색된 스킬은 LLM 기반의 의사결정 프로세스에 통합되어 다음 액션을 생성하는 가이드로 활용됩니다. 실험 결과, 본 제안 기법은 기존 Baseline 대비 Success Rate 측면에서 평균 15-20% 향상된 성능을 보였습니다. 또한, 태스크 수행 시 필요한 Tokens per Step을 유의미하게 감소시켜 Latency 최적화 측면에서도 우위를 점하였습니다. [Figure 2]

Figure 2 — 스킬 검색 및 성공률 비교 결과
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Online Skill Learning을 통해 Web Agent가 지속적으로 학습하고 진화할 수 있는 새로운 아키텍처를 성공적으로 입증했습니다. 이 접근법은 데이터가 부족한 환경에서도 에이전트의 적응력을 극대화할 수 있음을 시사합니다. 향후 본 연구는 복잡한 웹 서비스를 자동화하는 실무적 프레임워크 구축에 기여할 것으로 기대됩니다. 나아가, 대규모 에이전트 시스템에서 개인화된 스킬 라이브러리를 구축하는 기술적 발판을 마련했습니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Adapting Web Agents with Synthetic Supervision
- [논문리뷰] AgentFold: Long-Horizon Web Agents with Proactive Context Management
- [논문리뷰] VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
- [논문리뷰] Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution
- [논문리뷰] Intent Speaks Louder: Controllable User Simulation Beyond Response Imitation
Review 의 다른글
- 이전글 [논문리뷰] One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA
- 현재글 : [논문리뷰] Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval
- 다음글 [논문리뷰] PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models
댓글