[논문리뷰] DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
링크: 논문 PDF로 바로 열기
저자: Shubham Gandhi, Saurabh Goyal, Kiran Kate, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Outcome-Blind Regime: 학습 신호가 전적으로 프로세스 기준(process criteria)에서 도출되며, ground-truth 성공 또는 gold-answer 신호에 접근할 수 없는 환경을 의미한다.
- Long-Horizon Agents: 수십 단계에 이르는 상호 의존적인(interdependent) 도구 호출(tool-calling)을 수행하며, 단일 스칼라 보상(single scalar reward)으로는 효과적인 Credit Assignment가 어려운 에이전트를 지칭한다.
- Dynamic Per-Trajectory Rubrics: 훈련 중에 정책의 진화하는 능력(evolving capability)을 추적하기 위해 각 롤아웃(rollout)에 대해 동적으로 생성되고 적응되는 평가 기준(evaluation criteria)을 의미한다.
- Rubric-Conditioned Step Credit: trajectory-level advantage를 루브릭 심사(rubric judgment)의 기준별 평결(per-criterion verdicts)에 따라 개별 스텝(steps)에 재할당(reallocate)하여 차등화된 per-step advantage를 생성하는 메커니즘이다.
- GRPO (Group Relative Policy Optimization): 트레이닝 그룹 내의 롤아웃(rollout) 보상(rewards)을 표준화하여 어드밴티지(advantage)를 형성하는 정책 최적화 기법이다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Programmatic Verifier가 없는 Long-Horizon Agent Domain에서 발생하는 Credit Assignment 문제와 Outcome-Blind Setting의 한계를 해결하고자 한다. 기존 강화 학습(Reinforcement Learning) 연구는 대부분 프로그래밍 방식의 Verifier(예: unit tests for code, exact-match for math)를 통해 신뢰할 수 있는 terminal reward를 얻는 RLVR(Reinforcement Learning from Verifiable Rewards) 방식을 활용하지만, 고객 지원이나 개방형 연구 에이전트와 같은 많은 실제 환경에서는 Ground-Truth Verifier가 존재하지 않는다. 이러한 Outcome-Blind Regime은 기존 Reward Literature에서 가정하는 것보다 훨씬 어려운 환경이다. 또한, 수십 단계에 걸쳐 진행되는 Long-Horizon Trajectory의 경우, 단일 Trajectory-level Scalar Reward를 모든 스텝에 균일하게 할당하는 것은 비효율적이며, 성공적인 Trajectory에도 불필요한 스텝이 있거나 실패한 Trajectory에도 대부분의 스텝이 올바른 경우 Credit Assignment가 오히려 해로울 수 있다. 기존 Step-level Credit Assignment 방법론들 또한 Terminal Verifier나 Gold Answer에 신호를 고정시키는 문제가 있어, Outcome-Blind Regime에서 Rubric-Derived Signal을 개별 스텝에 효과적으로 할당하는 Credit Assignment 방법론이 부재하다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 Outcome-Blind Long-Horizon Agent Training을 위해 DRACO (Distributing Rubric-based Advantage for Credit Optimization)를 제안한다. DRACO는 두 가지 핵심 구성 요소로 이루어져 있다 [cite: 1, Figure 1]. 첫째, Dynamic Per-Trajectory Rubrics는 고정된 루브릭 대신, 각 Trajectory에 대해 동적으로 루브릭을 생성하고 점수를 매긴다. Judge는 Task Instruction과 각 샘플링된 Rollout에서 기준(criteria)을 제안하고, 이 제안들을 병합(merge), 중복 제거(deduplicate)한 후, Discriminative Dropout을 적용하여 그룹 내에서 적어도 한 Rollout이 실패한 기준만 남긴다 [cite: 1, Figure 1]. 이렇게 생성된 루브릭은 Trajectory 완료 시점에 한 번 점수화되며, 보상 Ri는 (pi - fi) / (pi + fi)로 계산되어 Trajectory-level Reward로 활용된다. 둘째, Rubric-Conditioned Step Credit은 이 Trajectory-level Reward를 GRPO(Group Relative Policy Optimization) 내에서 개별 스텝에 재할당한다 [cite: 1, Figure 1]. 각 스텝 j의 Quality Qj는 해당 스텝을 인용한 통과/실패 기준의 비율 pj / (pj + fj)로 정의되며, Trajectory Advantage Ai의 부호에 따라 Step Weight wj가 Qj 또는 1-Qj로 결정된다. 최종적으로 Step j의 Advantage aj는 Ai * N * wj / (nj * sum(wk))로 계산되어, 루브릭 평결에 책임 있는 스텝에 집중된 차등화된 Per-step Advantage를 제공한다. 이 Credit Reallocation 규칙은 Total-Advantage Conservation 및 Sign Preservation과 같은 7가지 형식적 속성을 만족하며, 학습된 귀속 모듈(trained attribution module)을 도입하지 않고 Closed-Form으로 구현된다.
실험 결과, DRACO는 AppWorld 벤치마크에서 Qwen3.6-27B 모델을 사용하여 AppWorldTN TGC에서 85.3%를 달성하여 훈련되지 않은 기본 정책 대비 +15.9%p의 상당한 성능 향상을 보였다. 이는 Ground-Truth Reward로 훈련된 GRPO 대비 +5.3%p 높은 수치이다. 특히, Outcome-Aware Baseline인 SALT에 비해서도 AppWorldTN에서 +5.3 TGC 및 +11.3 SGC를 초과 달성했으며, Out-of-Domain τ-bench에서도 훈련 없이 +4.6 SR의 이득을 보였다. Ablation Study 결과, Dynamic Rubrics와 Step Credit의 조합이 성능 향상에 결정적인 역할을 하며, 각 구성 요소 단독으로는 그 효과가 미미함을 입증했다. 또한, Self-Judge (정책 모델이 자체 롤아웃을 평가하는 방식)를 사용했을 때도 AppWorldTN에서 81.1 TGC 및 62.7 SGC를 달성하여 Outcome-Aware Reference 성능을 능가하는 결과를 보여주었다. Dynamic Rubrics는 Static Rubrics가 빠르게 Saturate되는 경향과 달리, 훈련 과정 전반에 걸쳐 지속적으로 Discriminative한 Reward Signal을 제공했다 [cite: 1, Figure 4]. 또한, DRACO는 Base 모델보다 적은 Agent Turns로 더 높은 정확도를 달성하며, 효율성 측면에서도 우수함을 보였다 [cite: 1, Figure 2]. DRACO는 Rollout Termination Modes를 개선하여 에이전트가 더 일관되게 작업을 완료하도록 유도했다 [cite: 1, Figure 3].
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Ground-Truth 성공 신호가 없는 Outcome-Blind Setting에서 Long-Horizon Tool-Using Agent를 훈련하기 위한 DRACO 방법론을 성공적으로 제안했다. DRACO는 정책 모델 Rollout에서 생성되는 Task-Specific Rubrics와 Judge의 Criterion-level Attribution을 활용하여 Trajectory Advantage를 Step-level로 재분배하는 메커니즘을 통해 기존 방법론의 한계를 극복했다. 이 연구는 AppWorld 벤치마크에서 15.9%p의 TGC 성능 향상과 더불어 Out-of-Domain τ-bench로의 효과적인 Zero-Shot Transfer를 입증하며, 동일한 예산 내에서 Verifier-Trained Baseline과 동등하거나 더 우수한 성능을 달성했다. DRACO의 핵심 시사점은 프로그래밍 방식의 Verifier가 없는 환경에서 효과적인 RL 훈련을 가능하게 하여, 광범위한 실제 에이전트 애플리케이션에 대한 적용 가능성을 확장한다는 점이다. 특히, Dynamic Rubrics와 Step Credit Assignment의 결합이 의미 있는 Attribution을 지원하기 위한 평가 기준의 Specificity를 높이는 데 중요함을 강조하며, 향후 연구에서는 Judge Quality 검증 및 인간 평가자와의 일치도 측정 등이 필요할 것으로 보인다.

Figure 1 — 제안 모델 DRACO의 전체 개요
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
- [논문리뷰] Rubric-to-Code Credit Assignment for Reinforcement Learning
- [논문리뷰] Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
- [논문리뷰] V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
- [논문리뷰] Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning
Review 의 다른글
- 이전글 [논문리뷰] Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
- 현재글 : [논문리뷰] DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
- 다음글 [논문리뷰] Editable Visual Design
댓글