[논문리뷰] Diffusion Reward Models본 논문은 기존 Reward Model(RM)들이 인간 선호도의 본질적인 Multimodality를 제대로 반영하지 못하는 문제점을 지적합니다.#Review#Diffusion Reward Model#Conditional Density Estimation#Multimodal Reward#RLHF#Diffusion Transformer#Human Preference#Reward Modeling2026년 9월 28일댓글 수 로딩 중
[논문리뷰] WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning본 연구는 기존 LLM 기반 웹사이트 생성 방식이 겪고 있는 확장성 및 품질 한계를 해결하고자 합니다.#Review#Reinforcement Learning#Large Language Models#Website Generation#GRPO#Multimodal Reward#React2026년 4월 23일댓글 수 로딩 중