[논문리뷰] DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training본 논문은 Programmatic Verifier가 없는 Long-Horizon Agent Domain에서 발생하는 Credit Assignment 문제와 Outcome-Blind Setting의 한계를 해결하고자 한다.#Review#Fine-Grained Credit Assignment#Dynamic Rubrics#Long-Horizon Agent Training#Outcome-Blind Reinforcement Learning#GRPO#Step Advantage#Tool-Using Agents#AppWorld2026년 9월 3일댓글 수 로딩 중