본문으로 건너뛰기

[논문리뷰] CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

링크: 논문 PDF로 바로 열기

저자: Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Tool-Calling Agents: 외부 툴을 사용하여 도메인 특화 태스크를 수행하고, 장기적인(Long-horizon) 의사결정을 내리는 LLM 기반 에이전트.
  • Agentic Verification: 툴 호출의 타당성을 단계별로 검증하기 위해, 현재 상황과 툴 사용 맥락을 분석하여 구조화된 Rationale와 이진 라벨(valid/invalid)을 생성하는 절차.
  • CAST-Critic: 학습된 Critique 모델로, 현재 에이전트의 액션이 정보적 맥락 내에서 적절한지 판단하고 수정 피드백을 제공하는 모델.
  • Pass^k: 동일한 태스크를 k회 수행했을 때의 성공률을 측정하여, 모델의 일관성과 신뢰성(Reliability)을 평가하는 지표.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 장기적인 상호작용 환경에서 LLM 에이전트의 Reliability가 심각하게 저하되는 문제를 해결하고자 한다 [Figure 1]. 기존 에이전트는 복잡한 태스크 수행 중 사소한 실수로 인해 연쇄적인 실패를 경험하며, 일단 발생한 오류는 수정이 어려운 경우가 많다. 현재의 Prompt 기반 Critique 기법은 높은 Inference Latency를 초래하고, 기존 최적화 방식은 중간 액션에 대한 풍부한 지도(Supervision)를 제공하지 못해 신뢰성 있는 Verification Rationale를 생성하는 데 한계가 있다. 이를 위해 저자들은 Sparse한 결과값으로부터 액션 단위의 구조화된 지도 신호를 생성하고 이를 학습에 활용하는 CAST 프레임워크를 제안한다 [Figure 2].

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문이 제안하는 CAST는 크게 3단계의 데이터 생성 및 학습 파이프라인으로 구성된다 [Figure 2]. 첫째, 초기 정책 모델을 통해 수집된 Trajectory에서 Agentic Verification을 수행하여 액션 단위의 정밀한 Rationale를 생성한다. 둘째, 이 데이터를 바탕으로 CAST-Critic 모델을 학습시켜 정교한 평가 능력을 갖춘다. 마지막으로, 학습된 Critic의 피드백을 반영한 Critique-enriched Trajectory를 사용하여 최종 정책 모델인 CAST-Policy를 Fine-tuning한다.

실험 결과, CAST-Policy-4B는 In-domain(Retail) 태스크에서 Base Instruct 모델 대비 pass^122.6%, pass^412.94% 향상된 성능을 기록하였다 [Table 1]. 또한, 아웃오브도메인(Out-of-domain) 환경에서도 안정적인 일반화 성능을 보였으며, 특히 pass^4 지표에서 대형 모델인 Qwen3-32B의 최고 성능을 능가하는 반복적 신뢰성을 확보하였다 [Table 1]. 이는 CAST를 통해 학습된 에이전트가 더 효율적인 리소스로도 강력한 실전 신뢰성을 발휘함을 입증한다.

4. Conclusion & Impact (결론 및 시사점)

본 논문은 액션 단위의 구조화된 Critique 지도를 학습에 통합함으로써, 장기적인 태스크 수행 환경에서 LLM 에이전트의 신뢰성을 획기적으로 개선하였다. 제안된 프레임워크는 대규모 모델에 의존하지 않고도 높은 수준의 Reliability를 달성할 수 있음을 보여주며, 이는 향후 실시간 도메인 에이전트 시스템 구축에 있어 중요한 방법론적 토대를 제공한다. 특히 복잡한 비즈니스 프로세스 내에서 에이전트의 오작동을 방지하는 실질적인 해결책으로서 학계와 산업계 모두에 큰 시사점을 준다.


Part 2: 중요 Figure 정보

Figure 1: CAST의 신뢰성 향상 효과

Figure 1 — CAST의 신뢰성 향상 효과

Figure 2: CAST 프레임워크 파이프라인

Figure 2 — CAST 프레임워크 파이프라인

Figure 4: CAST-Critic 검증 성능 비교

Figure 4 — CAST-Critic 검증 성능 비교

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글