[논문리뷰] Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning본 논문은 대규모 비동기 강화학습에서 발생하는 training-inference mismatch와 누적된 staleness가 모델 학습의 조기 붕괴(collapse)를 야기한다는 점을 지적합니다.#Review#Asynchronous Reinforcement Learning#Staleness#Trust Region#PPO#Training-Inference Mismatch#Adaptive Clipping#LLM2026년 7월 21일댓글 수 로딩 중
[논문리뷰] The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning본 논문은 LLM RL 파이프라인에서 발생하는 Training-Inference Mismatch가 단순히 알고리즘적 오류를 넘어 Objective Misalignment를 유발한다는 점을 지적한다.#Review#Large Language Model#Reinforcement Learning#Training-Inference Mismatch#Monotonic Policy Improvement#Policy Optimization#Alignment2026년 7월 5일댓글 수 로딩 중
[논문리뷰] GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language ModelsdLLMs는 기존의 Autoregressive Models(ARMs) 대비 효율적인 생성 성능을 제공하지만, 최적의 성능을 위해 필요한 강화학습(RL) 적용 시 정책 likelihood가 계산 불가능하다는 핵심적인 난관에 직면합니다.#Review#Diffusion Language Models#Reinforcement Learning#Self-Distillation#Training-Inference Mismatch#Logit Matching2026년 5월 31일댓글 수 로딩 중
[논문리뷰] Defeating the Training-Inference Mismatch via FP16대규모 언어 모델(LLM)의 강화 학습(RL) 미세 조정 과정에서 발생하는 불안정성의 근본 원인인 훈련-추론 불일치(training-inference mismatch) 를 해결하는 것이 목표입니다.#Review#Reinforcement Learning#LLM Fine-tuning#Training-Inference Mismatch#Floating Point Precision#FP16#BF16#RL Stability2025년 11월 9일댓글 수 로딩 중