[논문리뷰] When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents본 연구는 memory-augmented VLM agents가 dynamic environment에서 행동할 때, persistent spatial knowledge가 silently stale해지면서 안전 관련 실수를 유발할 수 있다는 핵심 문제를 제기합니다.#Review#VLM Agents#Spatial Memory#Staleness#Environmental Change#Safety Liability#Auditing#Visual Grounding#FrozenLake2026년 8월 5일댓글 수 로딩 중
[논문리뷰] Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning본 논문은 대규모 비동기 강화학습에서 발생하는 training-inference mismatch와 누적된 staleness가 모델 학습의 조기 붕괴(collapse)를 야기한다는 점을 지적합니다.#Review#Asynchronous Reinforcement Learning#Staleness#Trust Region#PPO#Training-Inference Mismatch#Adaptive Clipping#LLM2026년 7월 21일댓글 수 로딩 중
[논문리뷰] AsyncOPD: How Stale Can On-Policy Distillation Be?본 논문은 LLM 사후 학습에서 OPD가 겪는 On-policy systems bottleneck 문제를 해결하기 위해 비동기식 학습 파이프라인의 도입 필요성을 제기한다. 기존의 동기식 학습은 rollout 생성이 완료될 때까지 학습기를 대기시켜 하드웨어 활용률을 저하시킨다.#Review#On-policy Distillation#Asynchronous RL#Reverse KL#Staleness#Teacher Cache#Multi-sample MC#Large Language Model2026년 6월 29일댓글 수 로딩 중