[논문리뷰] Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms본 논문은 딥 강화학습 분야에서 고착화된 평가 패러다임과 그에 내재된 잘못된 가정들을 비판적으로 분석합니다.#Review#Deep Reinforcement Learning#Scaling Laws#Sample Complexity#Evaluation Paradigm#Monotonicity Assumption#Arcade Learning Environment2026년 7월 14일댓글 수 로딩 중
[논문리뷰] Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning본 논문은 LLM pre-training의 데이터 혼합 전략이 단일 최적화 관점에만 치중되어, 복잡하고 동적인 학습 과정을 충분히 반영하지 못하는 문제를 해결합니다.#Review#Large Language Models#Deep Reinforcement Learning#Online Data Mixing#Reward Shaping#Multi-Objective Optimization#Curriculum Learning#Training Efficiency2026년 6월 23일댓글 수 로딩 중
[논문리뷰] Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs본 논문은 멀티턴 LLM 에이전트 학습에서 기존 GRPO(Group Relative Policy Optimization) 의 불안정성과 비효율성을 해결하고자 합니다. 특히 긴 추론이 필요한 시나리오에서 샘플링 분산이 높고, 턴별 기여도가 불균등하여 불정확한 어드밴티지 추정이 발생하는 문제를 개선하는 것을 목표로 합니다.#Review#Multi-Turn Reinforcement Learning#LLM Agents#Proximal Policy Optimization (PPO)#Turn-Level MDP#Advantage Estimation#Generative AI#Deep Reinforcement Learning2025년 12월 21일댓글 수 로딩 중