[논문리뷰] Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO본 논문은 LLM reasoning 후학습(post-training)에서 ES가 GRPO와 비교하여 어떠한 최적화 동역학(dynamics)과 장점을 갖는지 체계적으로 분석합니다.#Review#Evolution Strategies#GRPO#LLM Reasoning#Pass@K#Entropy Collapse#Policy Diversity#Catastrophic Forgetting2026년 8월 27일댓글 수 로딩 중
[논문리뷰] Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements본 논문은 Long-horizon 에이전트 추론 환경에서 기존 Agentic RL이 겪는 심각한 자원 및 구조적 한계를 해결하는 것을 목표로 합니다.#Review#Agentic Reasoning#Evolution Strategies#Long-Horizon#Parameter Efficiency#LLM Fine-Tuning#GPU Memory2026년 8월 18일댓글 수 로딩 중