[논문리뷰] Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL본 연구는 기존 SFT 관행이 에이전트가 환경과의 상호작용 결과인 관찰(Observation)을 예측하도록 학습하지 않아 강화학습(RL)을 위한 최적의 초기화 정책을 제공하지 못한다는 문제의식에서 출발합니다.#Review#Reinforcement Learning#Language Agents#Supervised Fine-Tuning#Observation Supervision#Exploration#GRPO2026년 9월 17일댓글 수 로딩 중