[논문리뷰] Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
링크: 논문 PDF로 바로 열기
메타데이터
저자: Vladislav Beliaev
1. Key Terms & Definitions (핵심 용어 및 정의)
- GRPO (Group Relative Policy Optimization): 최종 정답만을 기반으로 보상을 부여하는 기존의 RL 학습 방식입니다. [Figure 1]
- Agon: 두 개의 경쟁 모델이 서로의 추론 과정을 평가(Rival Grading)하며 학습하는 프레임워크입니다.
- Conversion Bonus: 경쟁 모델이 작성한 솔루션을 읽고, 상대방이 틀린 문제를 본인이 맞혔을 때 추가로 부여되는 보상 지표입니다.
- Draft-and-Challenge: 한 모델이 초안(Draft)을 작성하면, 다른 모델이 이를 보고 검증 및 해결을 시도하는 2단계 cascade 추론 프로세스입니다. [Figure 2]
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존 GRPO 기반의 LLM 학습이 '추론 과정(trace)'을 평가하지 못하고 최종 정답에만 의존하여 발생하는 'Length Pathology(불필요한 답변 길이 증가)' 문제를 해결하고자 합니다. 기존 방식은 정답률을 높이기 위해 모델이 무의미한 추론 과정을 길게 나열하도록 학습되며, 정답 생성에 직접적인 기여를 하지 않는 filler 텍스트가 양산됩니다 [Figure 1]. 저자들은 프로세스 자체에 대한 라벨링이 없는 상황에서, 경쟁 관계에 있는 두 번째 모델이 상대의 추론을 암묵적으로 평가(Implicit Rival Grading)하는 방식이 더 나은 해결책이 될 수 있다고 제안합니다 [Figure 3].
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들이 제안하는 Agon 프레임워크는 두 개의 모델을 경쟁적인 2-policy 체제로 학습시킵니다. 각 모델은 매 단계마다 'Draft(작성자)'와 'Challenge(도전자)' 역할을 교대(Role Rotation)하며, 도전자는 상대방의 요약본을 보고 본인의 풀이를 생성합니다. 이때 보상 함수는 correctness와 함께, 상대가 실패한 문제에서 승리했을 때 받는 Conversion Bonus를 결합하여 설계되었습니다 [Figure 5]. 실험 결과, Agon은 DeepMath-hard 데이터셋에서 GRPO 대비 pass@1을 약 2배 향상(30% → 61%)시켰습니다 [Table 3]. 특히, 동일한 생성 budget 환경에서 untrained Mixture-of-Agents(MoA) 대비 약 8배 높은 성능 향상을 보였으며, 정답률 상승과 동시에 최종 생성된 추론 경로의 길이를 오히려 단축시키는 성과를 거두었습니다 [Figure 7].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 경쟁하는 동료 모델을 통해 추론의 품질을 암묵적으로 평가하게 함으로써, 추가적인 process 라벨링 없이 모델의 추론 능력을 극적으로 개선할 수 있음을 증명했습니다. Agon은 특히 작은 규모의 모델에서 성능 향상이 두드러져 학계와 산업계의 효율적 LLM 학습에 중요한 통찰을 제공합니다. 향후 연구에서는 현재의 텍스트 기반 교환을 넘어서 모델 간 잠재 공간(Latent Space)에서의 추론 교환으로 발전시킬 계획이며, 이는 multi-agent reasoning 학습의 새로운 패러다임이 될 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] TREK: Distill to Explore, Reinforce to Refine
- [논문리뷰] Learning User Simulators with Turing Rewards
- [논문리뷰] N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization
- [논문리뷰] ESPO: Early-Stopping Proximal Policy Optimization
- [논문리뷰] Verifiable Rewards Beyond Math and Code: Lightweight Corpus-Grounded Process Supervision for Factual Question Answering
Review 의 다른글
- 이전글 [논문리뷰] WanSong v1.0 Technical Report
- 현재글 : [논문리뷰] Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
- 다음글 [논문리뷰] Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
댓글