[논문리뷰] AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation본 논문은 기존 Joint Audio-Video Generation 모델들이 Per-modality Fidelity 부족, Text-Modality Alignment 미흡, 그리고 Cross-Modal Synchronization의 약점이라는 문제점을 겪고 있음을 지적한다.#Review#Joint Audio-Video Generation#Reinforcement Learning#Diffusion Models#Policy Optimization#Cross-Modal Synchronization#Modality-Anchored Learning#Credit Assignment#Multimodal Generative Models2026년 9월 24일댓글 수 로딩 중
[논문리뷰] Trimming the Long-Tail of Visual World Modeling Evaluation본 논문은 현대의 World Models가 물리적 원리를 진정으로 내재화했는지, 아니면 학습 데이터의 통계적 규칙성에 의존하는지에 대한 근본적인 의문을 제기합니다.#Review#Visual World Modeling#Long-Tail Scenarios#Physical Reasoning#Affordance Generalization#Multimodal Generative Models#Benchmark2026년 6월 29일댓글 수 로딩 중
[논문리뷰] ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing본 연구는 다중 모달 생성 모델을 활용한 지시 기반 이미지 편집에서 시각적 추론 능력의 한계 를 해결하고자 합니다. 특히, 기존 RL 방법론의 제한된 추론 탐색, 편향된 보상 통합, 불안정한 VLM 기반 지시 보상 문제를 극복하여, 추론 중심의 이미지 편집 품질을 향상시키는 것을 목표로 합니다.#Review#Reinforcement Learning#Image Editing#Reasoning#Chain-of-Thought#Multimodal Generative Models#Reward Modeling#VLM2026년 1월 7일댓글 수 로딩 중