[논문리뷰] LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks본 논문은 오픈 엔디드(open-ended) 작업에서 Reinforcement Learning (RL) 기반의 보상 최적화가 갖는 정보 병목(information bottleneck) 문제를 해결하고자 합니다.#Review#Experiential Learning#LLM-as-a-Coach#On-policy Context Distillation#Feedback Bandwidth#Non-Verifiable Tasks#Reward Hacking2026년 7월 20일댓글 수 로딩 중