[논문리뷰] Flux-OPD: On-Policy Distillation with Evolving Contexts본 논문은 오픈 도메인(open-ended domains) 환경에서 검증 가능한 보상(verifiable rewards)이 결여되어 작업 선호도를 명시적으로 학습하기 어렵다는 문제를 해결하고자 합니다.#Review#On-Policy Distillation#Evolving Contexts#Context Distillation#Reverse KL Decomposition#Open-Ended Domains#Task Preferences2026년 7월 30일댓글 수 로딩 중