[논문리뷰] Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training본 논문은 Online RL 기반의 MLLM post-training 과정에서 모든 prompt가 동일한 학습 가치를 지니지 않는다는 비효율성을 해결하고자 합니다.#Review#Multimodal Large Language Models#Reinforcement Learning#Prompt Scaffolding#Exploration Potential Score#Online RL#Data Flywheel#Curriculum Design2026년 9월 14일댓글 수 로딩 중