[논문리뷰] Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL현재 코드 에이전트 Reinforcement Learning (RL)은 주로 실행 가능한 테스트를 통해 binary rewards를 제공한다.#Review#Reinforcement Learning#Code Agents#Agentic Grading#Advantage Redistribution#Implementation Quality#Credit Assignment#DeepSWE#SWE-bench Pro2026년 9월 28일댓글 수 로딩 중