[논문리뷰] Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data본 논문은 No-CoT 데이터를 활용한 추론 모델 학습 시, 최근 제안된 Next-Chunk Reasoning 기반의 Reinforcement Learning(RL) 방식이 기존의 Supervised Fine-Tuning(SFT) 전략보다 진정으로 우월한지 의문을 제기합니다 .#Review#Large Language Models#Reinforcement Learning#Supervised Fine-Tuning#Reasoning#No-CoT#Post-Training#RLVR2026년 8월 26일댓글 수 로딩 중