[논문리뷰] SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents본 논문은 에이전트가 중도에 스스로 스킬을 선택하는 In-policy skill selection 과정에서 발생하는 효율성 저하 문제를 해결합니다. 기존의 보상 기반 RL은 실행 단계의 outcome에만 집중하여, 정작 중요한 선택 단계에 기여하는 토큰들에게는 거의 학습 신호가 전달되지 않는다는 치명적인 한계가 있습니다.#Review#In-Policy Skill Selection#Long-Horizon Agents#Reinforcement Learning#Credit Assignment#Policy Gradient#Agentic Benchmarks2026년 8월 19일댓글 수 로딩 중