[논문리뷰] Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning본 논문은 기존 GRPO 기반의 LLM 학습이 '추론 과정(trace)'을 평가하지 못하고 최종 정답에만 의존하여 발생하는 'Length Pathology(불필요한 답변 길이 증가)' 문제를 해결하고자 합니다.#Review#Reinforcement Learning#Large Language Models#Reasoning#GRPO#Competitive Training#Multi-Agent System#Self-Improvement2026년 7월 19일댓글 수 로딩 중