[논문리뷰] Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO본 논문은 LLM reasoning 후학습(post-training)에서 ES가 GRPO와 비교하여 어떠한 최적화 동역학(dynamics)과 장점을 갖는지 체계적으로 분석합니다.#Review#Evolution Strategies#GRPO#LLM Reasoning#Pass@K#Entropy Collapse#Policy Diversity#Catastrophic Forgetting2026년 8월 27일댓글 수 로딩 중
[논문리뷰] SAF-OPD: Stable Advantage Fusion for On-Policy Distillation본 논문은 RLVR과 OPD를 결합할 때 발생하는 고정 계수 통합 방식의 한계를 해결하고자 합니다. 기존 방식은 GRPO의 안정적인 보상과 OPD의 조밀한 피드백을 단순히 더하지만, 실제로는 두 보상의 크기와 시간적 가중치가 서로 달라 학습 과정에서 Entropy Collapse와 같은 심각한 불안정성을 유발합니다 .#Review#Reinforcement Learning#On-Policy Distillation#Advantage Fusion#Large Language Models#GRPO#Training Dynamics#Entropy Collapse2026년 8월 2일댓글 수 로딩 중
[논문리뷰] Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities본 논문은 LLM 추론에서 RLVR(Reinforcement Learning with Verifiable Rewards) 훈련 시 발생하는 엔트로피 붕괴(entropy collapse) 및 모드 붕괴(mode collapse) 문제를 해결하는 것을 목표로 합니다.#Review#Reinforcement Learning#LLM Reasoning#Exploration-Exploitation#Group Relative Policy Optimization#Entropy Collapse#Generative Models#Confidence-Aware Rewards2026년 2월 8일댓글 수 로딩 중
[논문리뷰] Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation논문은 LLM이 라벨이나 외부 평가 없이 스스로 개선하려는 라벨-프리(label-free) 학습 환경에서 겪는 엔트로피 붕괴(entropy collapse) 문제를 해결하는 것을 목표로 합니다.#Review#Label-free Reinforcement Learning#LLMs#Self-improvement#Entropy Collapse#Novelty Reward#Test-Time RL#GRPO#Evolutionary Computing Principles2025년 9월 19일댓글 수 로딩 중