[논문리뷰] Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
링크: 논문 PDF로 바로 열기
메타데이터
저자: Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong
1. Key Terms & Definitions (핵심 용어 및 정의)
- Narrative Commitment Preservation (NCP): 이야기의 논리적 무결성, 세계관 상태(world-state), 그리고 작가적 목표(plot constraints)를 장기적인 호흡으로 유지해야 하는 과제.
- Fact Ledger: 이야기 내에서 확립된 사실들을 기록하고 추적하는 동적 데이터 구조.
- Reference Trajectory ($\mathcal{R}$): 이야기의 주요 이정표를 담은 순차적 시퀀스. 각 노드는 트리거 이벤트와 그에 따른 상태 변화를 포함함.
- Commitment Set ($\mathcal{C}$): 시스템이 반드시 준수해야 하는 강제적인 이야기 규칙들(Invariant, Ordering, Achievement).
- Auditing Procedure: LLM이 생성한 응답이 기존의 Fact Ledger와 Commitment를 위반하는지 실시간으로 검증하는 자동화된 프레임워크.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 최신 LLM 기반 Narrator Agent들이 유창한 스토리를 생성함에도 불구하고, 장기적인 이야기의 논리적 일관성과 제약 조건을 유지하는 데 심각한 취약성을 보인다는 문제를 제기한다. 기존 연구들은 주로 생성된 텍스트의 언어적 품질이나 사용자 선호도에 집중했을 뿐, 대화가 진행됨에 따라 발생하는 논리적 모순이나 규칙 위반을 효과적으로 평가하지 못했다 [Figure 1]. 저자들은 이러한 한계를 극복하고자 자유로운 사용자 개입(adversarial intervention)이 존재하는 상황에서도 이야기의 인과적 무결성을 보존하는 능력을 측정하는 체계적인 방법론이 필요하다고 주장한다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 100개의 영화 시놉시스를 기반으로 구축된 NCP-Bench를 제안하며, 이를 통해 Narrator Agent가 외부 Auditor의 감시 하에 Fact Ledger, Reference Trajectory, Commitment Set을 준수하는지 평가한다 [Figure 2]. 실험 결과, 최상위 모델인 GPT-5.2조차 20턴 이후의 생존률(survival rate)이 42%에 불과할 정도로 장기 일관성 유지에 어려움을 겪는 것으로 나타났다 [Figure 4]. 정량적 평가에서 Fact conflicts가 전체 실험의 40%~68%를 차지하여 LLM이 복잡한 인과 관계를 추론하는 데 큰 한계가 있음을 입증했다 [Table 1]. 또한, DeepSeek-V3.2는 Trajectory progress와 Satisfied commitment 지표에서 각각 15.40%, 13.42%를 기록하며 특정 지표에서 경쟁 모델 대비 비교 우위를 보였다 [Table 1]. 이러한 결과는 LLM의 높은 언어적 능력이 논리적 무결성을 보장하지 않음을 시사한다.
4. Conclusion & Impact (결론 및 시사점)
본 논문은 interactive narrative를 단순한 생성 과제가 아닌, 장기적인 제약 조건 충족(long-horizon constraint satisfaction) 문제로 재정의한다. 제안된 NCP-Bench는 AI Narrator의 논리적 견고성을 정량화할 수 있는 강력한 벤치마크를 제공하며, 향후 학계 및 게임 산업에서 일관성 있는 Agent 시스템을 구축하는 데 중요한 기준이 될 것이다. 연구 결과는 현재의 LLM이 정교한 서사 구축에는 강점이 있으나, 엄격한 논리적 인과 체계를 지키는 '게임 세계의 진실성'을 유지하는 데는 여전히 고도의 기술적 개선이 필요함을 시사한다.
Part 2: 중요 Figure 정보

Figure 1 — 대본과 상호작용 간의 괴리

Figure 2 — NCP-Bench 프레임워크 개요

Figure 4 — 모델별 생존률 추이
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information
- [논문리뷰] ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
- [논문리뷰] Novel Claim or Déjà Vu? Rethinking 'Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking
- [논문리뷰] WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting
- [논문리뷰] When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
Review 의 다른글
- 이전글 [논문리뷰] AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research
- 현재글 : [논문리뷰] Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
- 다음글 [논문리뷰] From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection
댓글