[논문리뷰] Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL본 논문은 Reinforcement Learning을 활용한 추론 성능 향상 과정에서 발생하는 Ground-truth Supervision 의존성과 Self-rewarding RL의 구조적 한계를 해결하고자 합니다.#Review#Multi-agent Reinforcement Learning#Unsupervised Reasoning#Co-RL#Cross-agent Supervision#GRPO#Training Collapse#Cohort Diversity2026년 8월 19일댓글 수 로딩 중