[논문리뷰] DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents본 논문은 대규모 언어 모델 기반의 다중 턴 툴 호출 에이전트 학습에서 발생하는 Topological Collapse 문제를 해결하고자 합니다.#Review#Multi-turn Tool-Calling#Self-Distillation#Interaction-State Transition Graph (ISTG)#Critical Topological Breakpoint (CTB)#Localized Supervision#Agent Training#Policy Diversity2026년 8월 30일댓글 수 로딩 중
[논문리뷰] Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO본 논문은 LLM reasoning 후학습(post-training)에서 ES가 GRPO와 비교하여 어떠한 최적화 동역학(dynamics)과 장점을 갖는지 체계적으로 분석합니다.#Review#Evolution Strategies#GRPO#LLM Reasoning#Pass@K#Entropy Collapse#Policy Diversity#Catastrophic Forgetting2026년 8월 27일댓글 수 로딩 중
[논문리뷰] RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization대규모 추론 모델을 위한 검증 가능한 보상 강화 학습 (RLVR) 에서 발생하는 'RL 오버피팅' 문제를 해결하는 것이 목표입니다. 이 오버피팅은 훈련 보상은 증가하지만 일반화 성능이 저하되는 현상으로, 정책의 과도한 전문화와 훈련 과정 중 다양한 솔루션의 catastrophic forgetting 에 의해 발생합니다.#Review#Reinforcement Learning#LLMs#Generalization#Overfitting#Catastrophic Forgetting#Iterative Policy Optimization#Policy Diversity2025년 11월 10일댓글 수 로딩 중