본문으로 건너뛰기

[논문리뷰] LLMs Get Lost in Evolving User Intent

링크: 논문 PDF로 바로 열기

메타데이터

저자: Jihoon Tack, Philippe Laban, Jennifer Neville, et al.

## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • Evolving User Intent: 대화가 진행됨에 따라 사용자의 의도가 점진적으로 공개(reveal), 수정(revision), 또는 전환(switch)되는 동적인 상태를 의미합니다.
  • Anchor Intent: 기존 단일 턴(single-turn) 벤치마크 문제에서 추출된 최종 의도로, 다중 턴 대화의 마지막 단계에서 모델이 반드시 해결해야 하는 목표 지점입니다.
  • Situated Simulation: 추출된 Anchor Intent를 기반으로 하여 이전 대화 맥락을 역추적(retrospective)으로 생성하고, 이를 통해 모델이 다중 턴 환경에서 의도 변화를 추적하는 능력을 평가하는 프레임워크입니다.
  • POMDP (Partially Observable Markov Decision Process): 사용자의 의도가 숨겨진 상태(latent state)로 존재하고, 모델은 대화 이력을 통해서만 이를 부분적으로 관측하여 대응하는 대화 구조를 지칭합니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 연구는 대부분의 LLM 평가가 정적인 단일 턴 질의응답 환경에 국한되어 있어, 실제 사용자와의 역동적인 상호작용 능력을 제대로 측정하지 못한다는 한계점을 지적합니다. 기존 벤치마크는 사용자의 의도가 처음부터 명확하게 제시되는 상황을 가정하지만, 실제 환경에서는 사용자가 정보를 점진적으로 공개하거나 중간에 의도를 수정 및 변경하는 경우가 빈번합니다. 특히, 모델이 정적인 평가에서는 높은 성능을 보일지라도 대화 도중 의도가 변화하는 상황에서는 이를 효과적으로 추적하지 못하고 성능이 급격히 저하되는 현상이 관찰되었습니다. 이를 확인하기 위해 저자들은 정적인 태스크를 동적인 대화형 태스크로 변환하는 평가 프레임워크를 제안합니다 [Figure 1].

Figure 1: 사용자 의도 변화에 따라 모델 성능이 어떻게 급격히 저하되는지 보여주는 예시 다이어그램

Figure 1 — 사용자 의도 변화에 따라 모델 성능이 어떻게 급격히 저하되는지 보여주는 예시 다이어그램

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 저자들은 검증 가능한 단일 턴 데이터셋(e.g., GSM8K, BIRD-SQL)의 정답을 최종 턴의 Anchor Intent로 설정하고, 대화의 이전 단계를 역방향으로 생성하는 Situated Simulation 프레임워크를 도입하였습니다. 이 방법론은 'Argument reveal', 'Argument revision', 'Function switch'라는 세 가지의 동적인 의도 변화 기법을 적용하여 모델의 추적 능력을 평가합니다 [Figure 2]. 주요 실험 결과, GPT 5.1, GPT 5.2, Gemini 3.1 Pro 등 주요 모델들조차 정적 환경 대비 동적 환경에서 상당한 성능 하락을 보였습니다. 특히 GSM8K 데이터셋에서 GPT 5.5 모델은 단일 턴 대비 7개 턴으로 구성된 진화형 의도 환경에서 약 18.7%의 성능 하락을 기록했으며, SWE-Bench와 같은 복잡한 도메인에서는 성능이 거의 0%에 가깝게 폭락하는 모습을 보였습니다 [Table 1]. 또한, 의도 변화가 많아질수록 성능이 단조적으로 감소하는 경향을 확인했습니다.

Figure 2: 논문에서 제안하는 3가지 핵심 의도 변화(Reveal, Revision, Switch)를 설명하는 구조도

Figure 2 — 논문에서 제안하는 3가지 핵심 의도 변화(Reveal, Revision, Switch)를 설명하는 구조도

Table 1: 다양한 모델의 Single-turn vs Evolve-turn 성능 비교를 나타내는 핵심 결과 표

Table 1 — 다양한 모델의 Single-turn vs Evolve-turn 성능 비교를 나타내는 핵심 결과 표

## 4. Conclusion & Impact (결론 및 시사점) 본 연구는 LLM 기반 에이전트가 의도 변화를 추적하는 능력에 있어 근본적인 기술적 격차가 존재함을 입증하였습니다. 현재의 모델들은 단순히 이전 맥락을 기억하는 수준을 넘어, 변화하는 의도에 맞춰 정보를 선택적으로 갱신하고 불필요한 정보를 제거하는 인지적 유연성이 부족한 것으로 나타났습니다. 이번 결과는 향후 에이전트 설계 시 단순한 문맥 길이 확장보다는, 변화하는 의도를 보다 정밀하게 모델링하고 관리할 수 있는 메커니즘 개발이 필수적임을 시사합니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글