본문으로 건너뛰기

[논문리뷰] EmbodiedMemory-Bench: Benchmarking Embodied Memory for Long-Horizon Embodied Tasks

링크: 논문 PDF로 바로 열기

저자: Lizhou Liang, Xinyu Zhong, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Qinfeng Li, Peng Li, Jintao Chen, Xuhong Zhang, Wenqi Zhang

1. Key Terms & Definitions

본 논문에서 다루는 핵심 용어 및 개념은 다음과 같습니다:

  • Embodied Memory: 에이전트가 변화하는 물리적 환경에서 작업을 수행하기 위해 시각적 관찰, 행동, 피드백 간의 인과적 연결을 포함하는 상호작용 기록을 유지하고 업데이트하는 능력입니다.
  • Long-Horizon Embodied Tasks: 물리적 3D 환경에서 장시간에 걸쳐 에이전트가 정보를 유지하고 지속적으로 업데이트해야 하는 복합적인 작업입니다.
  • Multimodal Large Language Models (MLLMs): 텍스트뿐만 아니라 이미지 및 비디오와 같은 다양한 양식의 정보를 처리하고 생성할 수 있도록 확장된 대규모 언어 모델입니다.
  • Success Rate (SR): 에이전트가 주어진 작업을 성공적으로 완료한 에피소드의 비율을 나타내는 주요 평가 지표입니다. 값이 높을수록 성능이 우수합니다.
  • Error Recurrence Rate (ERR): 에이전트가 이전 상호작용 기록을 통해 피할 수 있었던 실수를 반복하는 빈도를 측정하는 평가 지표입니다. 값이 낮을수록 성능이 우수합니다.
  • Spatial Memory: 객체의 위치와 상태를 Entity Graph 형태로 추적하며, 새로운 관찰 및 피드백에 따라 기록을 업데이트하여 최신 상태를 반영하는 메모리 유형입니다.
  • Event Memory: 에이전트의 행동, 환경 피드백, 인간의 수정 사항을 시간 순서대로 보존하며, 반복되는 패턴을 요약하여 관련 상황에서 재사용할 수 있도록 하는 메모리 유형입니다.
  • Scene Memory: 객체 및 상호작용을 해당 Scene과 연결하여, 다른 방에 있는 동일한 이름의 Entity 간 혼동을 방지하는 시각적 스냅샷 기반의 메모리 유형입니다.

2. Motivation & Problem Statement

본 논문은 현재 Embodied Agent들이 Long-Horizon Embodied Interaction 시 Memory를 안정적으로 유지하는 데 어려움을 겪는다는 핵심 문제를 제기합니다. 기존 연구들(Baseline)의 한계점은 주로 네 가지 주요 결함으로 분석됩니다: Weak Fine-grained Visual Memory, Unreliable Dynamic World-state Tracking, Failing to Record World State Revealed by Interaction Outcomes, 그리고 Limited Generalization from Prior Experience. 저자들은 EmbodiedBench의 실패 사례 100개를 분석한 결과, 이 네 가지 유형의 Memory Deficiencies가 전체 실패의 91%를 차지함을 밝히며, 특히 Fine-grained Visual Cues를 잊거나(35%), 환경 변화를 간과하거나(18%), 상호작용 결과로 드러난 World State를 기록하지 못하는(31%) 문제가 두드러집니다 [cite: 1, Figure 2]. 하지만 기존 Benchmarks는 이러한 Long-Horizon Embodied Interaction 과정에서 필요한 Memory Capabilities를 직접적으로 평가하지 못합니다. 대부분의 기존 Benchmarks는 단일 턴 질의응답(Single-turn Question-answering) Task를 채택하거나, Context 없이 에이전트에게 환경 탐색 및 Task 실행을 지시하여 Memory-centric한 평가에 부적합합니다 [cite: 1, Table 1]. 이러한 Gap을 해결하기 위해, 에이전트가 상호작용 기록으로부터 Memory를 구축하고 업데이트하여 후속 Task를 완료해야 하는 새로운 접근 방식의 필요성이 대두됩니다.

3. Method & Key Results

본 논문은 Embodied Memory 평가를 위한 새로운 벤치마크 EmbodiedMemory-Bench (EMem-Bench)와 효율적인 External Memory System인 Embodied-Memorizer (EMem)를 제안합니다. EMem-Bench는 2,554개의 대화형 에피소드로 구성되며, Passive Observation, Dynamic Tracking, Interaction Failure, Experience Generalization의 네 가지 Task Family로 나뉩니다 [cite: 1, Figure 3]. 각 Task Family는 특정 Memory Capability를 평가하도록 설계되어, 에이전트가 주어진 Multimodal Interaction History로부터 필요한 정보를 추출하고 Memory를 구성하여 환경에서 Task를 완료하도록 요구합니다. 제안하는 EMem 방법론은 Embodied Experience를 Spatial Memory, Event Memory, Scene Memory 세 가지 상호 보완적인 Memory로 조직하는 아키텍처를 가집니다 [cite: 1, Figure 6]. Spatial Memory는 객체의 위치와 상태를 추적하고, Event Memory는 행동과 피드백을 시간순으로 기록하며 규칙을 요약하고, Scene Memory는 시각적 스냅샷을 통해 객체와 상호작용을 Scene과 연결합니다. 또한, 저자들은 이러한 Memory들을 쓰고, 검색하고, 사용하는 방법을 학습한 8B 정책 (EMem-8B)을 개발했습니다.

실험 결과, 현재의 MLLMs와 Multimodal Memory Systems는 EMem-Bench에서 전반적으로 약하고 불균등한 성능을 보였습니다 [cite: 1, Table 2]. 가장 강력한 Proprietary Model인 Gemini-3-Flash조차 평균 SR 64.2%에 불과했으며, 대부분의 Open-source Models는 SR 45% 미만을 기록했습니다 [cite: 1, Table 2]. 반면, 제안된 EMem 시스템은 평가된 Memory System들 중 전반적으로 가장 우수한 성능을 달성하여, Proprietary Model인 GPT-5.4-mini의 평균 SR을 23.6 points 향상시키고, Open-source Model인 Mistral-Small-3.1-24B에서는 16.4 points 향상시켰습니다 [cite: 1, Table 2]. 특히, 학습된 EMem-8B 정책은 Backbone Model인 Qwen3-VL-8B 대비 20.6 points 더 높은 성능을 보였습니다 [cite: 1, Table 2]. Ablation Study를 통해 Spatial, Event, Scene Memory 세 가지 모두가 시스템 성능에 필수적이며, 각 Memory가 특정 Task Family(예: Dynamic Tracking은 Spatial Memory에 가장 크게 의존)에 중요한 역할을 함이 입증되었습니다 [cite: 1, Table 4]. 또한, 단순히 Raw Multimodal Context (Historical RGB Observations)를 증가시키는 것만으로는 Task 해결에 도움이 되지 않으며, 오히려 GPT-5.4-mini의 평균 SR을 36.6%에서 26.2%로 감소시키고 Latency를 크게 증가시킴을 보여, 효과적인 Memory에는 Task-Relevant Evidence의 Selective Retrieval이 필수적임을 시사합니다 [cite: 1, Table 3].

4. Conclusion & Impact

본 논문은 Embodied Agent의 Long-Horizon Interaction에서 필요한 Fine-grained Visual Memory, Dynamic World-state Tracking, Recording World State Through Interaction, Experience Generalization과 같은 핵심 Memory Capabilities를 평가하기 위한 새로운 벤치마크인 EMem-Bench를 소개합니다. 또한, Spatial, Event, Scene Memory를 통해 Multimodal Experience를 조직하고 에이전트가 이러한 Memory를 효과적으로 사용하도록 학습시키는 External Memory System인 Embodied-Memorizer (EMem)를 제안합니다. 실험 결과는 현재의 MLLMs가 장기적인 상호작용에 걸쳐 World State를 유지하고 재사용하는 데 여전히 어려움을 겪고 있음을 명확히 보여주었으며, EMem이 Memory-guided Behavior를 크게 개선함을 입증했습니다. 이 연구는 복잡하고 동적인 물리적 환경에서 보다 강력하고 지능적인 Embodied AI 에이전트를 개발하기 위한 중요한 방향을 제시합니다. EMem-Bench는 Embodied Memory 연구를 위한 표준화된 도구로 기능하며, EMem 시스템은 이러한 Memory Deficiencies를 해결하고 에이전트의 "Short-sighted Behavior"를 줄이는 데 기여할 수 있는 유망한 방법론을 제공합니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글