[논문리뷰] The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
링크: 논문 PDF로 바로 열기
메타데이터
저자: Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman
1. Key Terms & Definitions (핵심 용어 및 정의)
- Handoff Tax: 모델 간 전환(Escalation 또는 Downshift) 시 발생하는 성능 손실과 비용 증가로 인한 비효율적인 cost-quality trade-off를 지칭합니다.
- Escalation: 낮은 성능의 LC(Low-Capability) 모델에서 높은 성능의 HC(High-Capability) 모델로 전환하는 과정입니다.
- Downshift: 고성능의 HC 모델에서 작업을 완료하기 위해 LC 모델로 전환하는 과정입니다.
- Raw Handoff: 이전 모델이 생성한 전체 trajectory를 그대로 수신 모델에 전달하는 기본 인터페이스 방식입니다.
- Traj-drop: 이전 모델의 trajectory 전달을 차단하고, 디스크에 기록된 작업 결과물(Working Tree)만을 보존하여 수신 모델이 시작하게 하는 인터페이스 방식입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 장기적인 작업(long-horizon tasks)을 수행하는 LLM Agent에서 모델 전환(Handoff)이 품질과 비용에 미치는 영향을 체계적으로 분석합니다. 기존의 Agent 생태계에서는 비용 절감과 품질 확보를 위해 상황에 따라 모델을 변경하지만, 수신 모델이 타 모델의 trajectory를 상속받을 때 발생하는 기술적·경제적 결과는 명확히 규명되지 않았습니다. 특히 타 모델의 '비원어민(non-native)' trajectory를 이어받는 것이 모델의 추론에 긍정적인 가이드가 될지, 혹은 잘못된 경로로 유도하는 부채(burden)가 될지에 대한 분석이 필요합니다. 이를 위해 저자들은 Claude 및 GPT 모델 패밀리를 활용하여 Escalation과 Downshift 방향에서의 전환 효율성을 평가합니다 [Figure 1].

Figure 1 — 모델 전환(Handoff)의 개요
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 SWE-bench Verified 데이터셋을 바탕으로 58,000개의 Agent run을 시뮬레이션하여 4가지 인터페이스(Raw, Compact_pre, Compact_suf, Traj-drop)를 비교 분석합니다 [Figure 2]. 주요 실험 결과는 다음과 같습니다.
- Escalation의 한계: Raw Escalation은 HC 모델 단독 실행 대비 품질 향상률이 50% 미만임에도 비용은 매우 높게 나타나는 Handoff Tax가 존재함을 확인했습니다.
- 인터페이스 최적화: Escalation 시 Traj-drop 인터페이스를 사용하면 불필요한 LC 컨텍스트 제거를 통해 품질 복구(QRec)가 최대 64%(Claude) 또는 84%(GPT)까지 개선됨을 보였습니다 [Table 1].
- Downshift의 효율성: 반대로 Downshift 상황에서는 Raw 인터페이스가 우수한 cost-quality trade-off를 제공하며, Traj-drop 적용 시 오히려 성능이 저하되는 방향성(Directional Duality)을 관찰했습니다 [Table 1].
- 비용 메커니즘: Raw Escalation은 HC 모델의 호출 비용을 증폭시키고, Traj-drop Downshift는 LC 모델이 놓친 맥락을 재구성하기 위해 더 많은 단계(step)를 수행하도록 유도하여 비용을 증가시킵니다 [Figure 4].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 모델 전환이 단순히 모델을 바꾸는 것을 넘어, '어떤 정보(trajectory)'를 전달할지에 대한 인터페이스 설계가 성능에 결정적임을 입증합니다. 연구 결과에 따르면, Escalation 시에는 불필요한 컨텍스트를 제거하는 것이, Downshift 시에는 성공적인 HC의 가이드를 보존하는 것이 효과적입니다. 이 발견은 향후 Agentic AI 프레임워크 설계 시 모델 라우팅 정책뿐만 아니라 Handoff 인터페이스를 최적화하는 전략적 접근이 필수적임을 시사합니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Dockerless: Environment-Free Program Verifier for Coding Agents
- [논문리뷰] Retrospective Harness Optimization: Improving LLM Agents via Self-Preference over Trajectory Rollouts
- [논문리뷰] SERA: Soft-Verified Efficient Repository Agents
- [논문리뷰] Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
- [논문리뷰] RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
Review 의 다른글
- 이전글 [논문리뷰] Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans
- 현재글 : [논문리뷰] The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
- 다음글 [논문리뷰] V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
댓글