[논문리뷰] Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning본 논문은 Long-CoT 추론 학습 시 기존 GRPO와 같은 방식이 응답 내 모든 토큰에 동일한 중요도를 부여하여 발생하는 최적화 비효율 문제를 해결하고자 합니다.#Review#Long-CoT Reasoning#RLVR#GRPO#On-policy Self-distillation#Counterfactual Sensitivity#Credit Reallocation2026년 8월 2일댓글 수 로딩 중