[논문리뷰] Diffusion Reward Models본 논문은 기존 Reward Model(RM)들이 인간 선호도의 본질적인 Multimodality를 제대로 반영하지 못하는 문제점을 지적합니다.#Review#Diffusion Reward Model#Conditional Density Estimation#Multimodal Reward#RLHF#Diffusion Transformer#Human Preference#Reward Modeling2026년 9월 28일댓글 수 로딩 중