[논문리뷰] VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
링크: 논문 PDF로 바로 열기
저자: Xiaohongshu Dots Studio, Evolvent AI
1. Key Terms & Definitions (핵심 용어 및 정의)
- VibeLifeBench: 일상생활 속 장기적(Multi-week) 과업을 수행하는 에이전트의 능력을 평가하기 위한 벤치마크 프레임워크입니다.
- Proactivity (주도성): 사용자의 직접적인 프롬프트가 없더라도, 변화하는 환경을 스스로 모니터링하고 적절한 시점에 행동하거나 침묵을 지키는 에이전트의 핵심 능력입니다.
- Mutation: 환경 내에서 외부의 알림 없이 발생하는 배경 변화(예: 항공편 지연, 피싱 메일 삽입)로, 에이전트가 이를 스스로 재탐색(Re-inspect)하여 대응해야 합니다.
- Long-horizon Coherence: 수주 이상 지속되는 과업 전체 기간 동안 에이전트가 초기 계획을 일관성 있게 유지하고, 제약 조건을 준수하는 능력을 의미합니다.
- Living World: 22개의 Mock Service가 실행되며 실시간으로 상태가 변하는 시뮬레이션 환경으로, 에이전트의 상태 추적 능력을 시험합니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 AI 에이전트 평가 벤치마크들이 대부분 정적이고 단기적인 과업에 치중되어 있어, 실제 일상생활의 복잡성을 제대로 측정하지 못한다는 문제를 제기합니다 [Table 1]. 현재의 벤치마크들은 주로 코딩이나 사무 업무에 국한되어 있으며, 에이전트가 환경 변화를 스스로 인지하고 장기적인 일정을 관리하는 능력을 평가하는 데 한계가 있습니다. 특히 실제 생활에서는 사용자의 명시적인 요청 없이도 스스로 상황을 판단하고 행동해야 하는 Proactivity가 필수적입니다. 저자들은 이러한 한계를 극복하기 위해 에이전트의 장기적 일관성, 환경 변화에 대한 대응력, 그리고 암묵적 제약 준수 능력을 평가할 새로운 프레임워크가 필요하다고 강조합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 10개 일상생활 도메인에서 200개의 Multi-week 과업으로 구성된 VibeLifeBench를 제안하며, 이를 위해 시뮬레이션 환경과 평가 파이프라인을 구축하였습니다 [Figure 1]. 저자들은 과업을 시간 흐름에 따른 4가지 이벤트(User message, World observation, Notification, Mutation)로 설계하여 에이전트가 Proactive하게 반응하도록 유도합니다 [Table 2]. 특히 1,483개의 Mutation을 통해 에이전트의 재탐색 능력을 정량적으로 측정합니다. 총 7개의 최신 모델(Claude Opus 5, GPT-5.5 등)을 평가한 결과, 가장 우수한 모델인 Claude Opus 5조차 avg@3 기준 32.5라는 낮은 점수를 기록했습니다 [Table 5]. 이는 현재의 강력한 언어 모델들이 단기적인 도구 사용에는 능숙하지만, 수주간 지속되는 변화하는 환경에서의 장기적인 일관성과 스스로 상황을 판단하는 주도성 면에서는 여전히 큰 간극을 보이고 있음을 시사합니다 [Figure 2].

Figure 1 — VibeLifeBench 전체 아키텍처 및 과업 구성

Figure 2 — 각 서비스별 과업 활용 분포
4. Conclusion & Impact (결론 및 시사점)
본 논문은 실생활 기반의 AI 에이전트 평가를 위한 고도의 장기적 벤치마크인 VibeLifeBench를 통해 에이전트 연구의 새로운 방향성을 제시합니다. 연구 결과, 현존하는 최첨단 모델들조차 실생활 환경에서의 장기적인 계획 유지 및 상황 대응 능력에서 저조한 성능을 보임을 확인하였습니다. 본 벤치마크는 향후 연구자들이 더 지능적이고 신뢰할 수 있는 개인 비서 에이전트를 개발하는 데 있어 중요한 기준점이 될 것입니다. 또한, 에이전트가 환경을 능동적으로 탐색하고 긴 주기를 가진 목표를 일관성 있게 수행할 수 있도록 유도하는 핵심 지표로 활용될 것으로 기대됩니다.

Figure 3 — 도메인별 과업 지표 분석
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] CEO-Bench: Can Agents Play the Long Game?
- [논문리뷰] WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces
- [논문리뷰] EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge
- [논문리뷰] BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts
- [논문리뷰] LongMINT: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems
Review 의 다른글
- 이전글 [논문리뷰] UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models
- 현재글 : [논문리뷰] VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
- 다음글 [논문리뷰] iFAN: Inference-Aware Learning for Plain Mask Transformers
댓글