[논문리뷰] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning본 연구는 대규모 언어 모델(LLM)의 에이전트 학습 과정에서 기존의 동기식 RL 방식이 가진 효율성 한계와 비동기식 RL이 직면한 학습 불안정성 문제를 해결하고자 한다.#Review#Reinforcement Learning#Asynchronous RL#Single-Rollout#Agentic RL#Token-level Clipping#Value-model Training2026년 7월 8일댓글 수 로딩 중
[논문리뷰] AsyncOPD: How Stale Can On-Policy Distillation Be?본 논문은 LLM 사후 학습에서 OPD가 겪는 On-policy systems bottleneck 문제를 해결하기 위해 비동기식 학습 파이프라인의 도입 필요성을 제기한다. 기존의 동기식 학습은 rollout 생성이 완료될 때까지 학습기를 대기시켜 하드웨어 활용률을 저하시킨다.#Review#On-policy Distillation#Asynchronous RL#Reverse KL#Staleness#Teacher Cache#Multi-sample MC#Large Language Model2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL본 논문은 기존 오픈소스 LLM 기반 에이전트의 '검색 인텔리전스'가 전문가 수준에 미치지 못하며, 모호한 질의 해결, 정확한 검색 생성, 결과 분석 및 심층 탐색 능력에서 한계를 보이는 문제를 해결하고자 합니다.#Review#Reinforcement Learning#LLM Agents#Agentic Search#Asynchronous RL#Long-Horizon Planning#Tool Use#Data Synthesis2025년 8월 13일댓글 수 로딩 중