[논문리뷰] VideoGen-Agent: Reinforcing Video Generation Agents현재 비디오 생성 모델은 Photorealistic하고 Temporally Coherent한 비디오를 생성하는 데 큰 발전을 이루었지만, 생성된 비디오가 Prompt에 명시된 내용을 정확하게 표현하는 데는 한계가 있습니다.#Review#Video Generation#Multimodal Agents#Reinforcement Learning#Tool Use#Supervised Fine-Tuning#VABench#Agentic RL#Diffusion Models2026년 9월 21일댓글 수 로딩 중
[논문리뷰] Environment Evolution for Terminal Agents본 연구는 고성능 터미널 에이전트 학습을 위한 환경의 난이도 부족 문제를 해결하는 것을 목표로 한다. 최근 구축된 대규모 터미널 환경들은 모델의 성능이 향상됨에 따라 더 이상 충분한 학습 신호를 제공하지 못하며, 이로 인해 RL 과정에서 성능 개선을 위한 차별화된 학습 신호가 결여되는 한계가 있다.#Review#Terminal Agents#Environment Evolution#Reinforcement Learning#Off-policy Scaling#Agentic RL#Multi-turn Objective2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report본 연구는 라이브 커머스 환경에서 실시간 대응이 필요한 디지털 아바타 에이전트가 고정된 Harness에 과적합되어 Harness 변화 시 성능이 급격히 저하되는 문제를 해결하고자 합니다.#Review#Harness-Aware Training#Digital Avatar#Harness Evolution#Surface-form Overfitting#On-Policy Distillation#Agentic RL2026년 8월 27일댓글 수 로딩 중
[논문리뷰] VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?본 논문은 멀티모달 에이전트가 사용자 쿼리를 바탕으로 3D 오픈 월드를 End-to-End로 구축하는 능력을 체계적으로 평가하고 개선하는 것을 목표로 합니다. 기존 연구들은 단순하고 이상적인 쿼리에만 의존하거나, 폐쇄형 프레임워크로 인해 일반화된 성능 평가와 훈련에 한계가 있었습니다.#Review#Multimodal Agents#3D Open World Construction#Agentic RL#VWE-Bench#VibeWorlding-Gym#Dual-Constraint Verifier#End-to-End2026년 8월 17일댓글 수 로딩 중
[논문리뷰] TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning본 논문은 Tool-Integrated Reasoning(TIR) 환경에서 발생하는 불명확한 temporal credit-assignment 문제를 해결하기 위해 TurnSight를 제안합니다.#Review#Tool-Integrated Reasoning#Reinforcement Learning#Self-Distillation#Hindsight Credit Assignment#Multi-turn Interaction#Agentic RL2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning본 연구는 대규모 언어 모델(LLM)의 에이전트 학습 과정에서 기존의 동기식 RL 방식이 가진 효율성 한계와 비동기식 RL이 직면한 학습 불안정성 문제를 해결하고자 한다.#Review#Reinforcement Learning#Asynchronous RL#Single-Rollout#Agentic RL#Token-level Clipping#Value-model Training2026년 7월 8일댓글 수 로딩 중
[논문리뷰] RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents본 논문은 Multi-turn Tool-Use 에이전트 학습 시 발생하는 데이터 부족 및 정보 밀도 감소 문제를 해결하고자 합니다.#Review#Multi-turn Tool-Use#Reinforcement Learning#Data Synthesis#Gradient Variance#Capability Boundary#Agentic RL#Replay Buffer2026년 6월 17일댓글 수 로딩 중
[논문리뷰] PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment본 논문은 long-horizon agentic task에서 발생하는 sparse reward로 인한 credit assignment의 근본적인 한계를 해결하고자 한다.#Review#Reinforcement Learning#Long-Horizon Credit Assignment#Bayesian Inference#Self-Distillation#Search Agents#Agentic RL2026년 6월 8일댓글 수 로딩 중
[논문리뷰] RAGEN-2: Reasoning Collapse in Agentic RL본 논문은 Mutual Information (MI) 기반의 진단 프레임워크와 SNR-Aware Filtering 기법을 제안한다. 연구진은 추론 품질을 Within-input diversity (Entropy)와 Cross-input distinguishability (MI)로 분해하여, 학습 과정에서 MI 프록시를 통해 템플릿 붕괴를 조기에 탐지한다 .#Review#Agentic RL#Reasoning Collapse#Mutual Information#Signal-to-Noise Ratio#Reward Variance#Template Collapse2026년 4월 8일댓글 수 로딩 중
[논문리뷰] AT^2PO: Agentic Turn-based Policy Optimization via Tree Search본 논문은 LLM 에이전트의 다중 턴(multi-turn) 작업에서 발생하는 세 가지 핵심 문제를 해결하고자 합니다.#Review#Agentic RL#Multi-turn Tasks#Policy Optimization#Tree Search#Credit Assignment#Exploration Diversity#LLM Agents2026년 1월 8일댓글 수 로딩 중
[논문리뷰] SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents본 논문은 복잡한 GUI 태스크에서 자율 에이전트 개발을 위한 에이전트 강화 학습( Agentic RL )의 주요 병목인 태스크 완료 검증의 비효율성과 신뢰성 문제 를 해결하고자 합니다.#Review#Agentic RL#Self-Verifying Agents#GUI Automation#Evidence Curation#LLM-as-a-Judge#Reward Shaping#AndroidLab2025년 12월 29일댓글 수 로딩 중