[논문리뷰] CAST: Game Solvers as Turn-Level Teachers for LLM Agents본 논문은 장기적 계획이 필요한 게임 환경에서 LLM Agents의 학습 효율성과 성공률을 높이기 위해 제안되었습니다. 기존의 RLVR 방식은 최종 결과물에만 보상을 부여하기 때문에, 어떤 행동이 성공을 결정지었는지 파악하기 어려운 '신용 할당(Credit Assignment)'의 한계를 갖습니다 .#Review#LLM Agents#Reinforcement Learning#Credit Assignment#Game Solvers#On-policy Distillation#RLVR#Process Supervision2026년 7월 29일댓글 수 로딩 중