[논문리뷰] AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation본 논문은 기존 Joint Audio-Video Generation 모델들이 Per-modality Fidelity 부족, Text-Modality Alignment 미흡, 그리고 Cross-Modal Synchronization의 약점이라는 문제점을 겪고 있음을 지적한다.#Review#Joint Audio-Video Generation#Reinforcement Learning#Diffusion Models#Policy Optimization#Cross-Modal Synchronization#Modality-Anchored Learning#Credit Assignment#Multimodal Generative Models2026년 9월 24일댓글 수 로딩 중
[논문리뷰] Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy본 논문은 오디오-비디오 동시 생성 모델에서 발생하는 불안정한 오디오-비디오 정렬 문제를 해결하는 것을 목표로 합니다.#Review#Audio-Visual Generation#Cross-Modal Synchronization#Diffusion Models#Cross-Task Synergy#Classifier-Free Guidance#Multimodal AI#Generative AI2025년 11월 26일댓글 수 로딩 중