[논문리뷰] Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models본 논문은 Vision-Language-Action (VLA) 모델의 액션 디코더가 단순히 행동을 모방하는 것을 넘어, 해당 행동이 달성하고자 하는 behavior-level intent를 명시적으로 모델링해야 한다고 주장합니다.#Review#Vision-Language-Action Models#Intention Distillation#Behavioral Intent#Robot Manipulation#Semantic Supervision#Flow Matching#Policy Learning#Multimodal AI2026년 8월 30일댓글 수 로딩 중
[논문리뷰] Steering Visual Generation in Unified Multimodal Models with Understanding Supervision본 논문은 최신 UMM이 이해와 생성 기능을 한 모델 내에 통합했음에도 불구하고, 실제로는 두 구성 요소가 상호작용 없이 분리된(Decoupled) 구조로 설계되어 성능 극대화에 한계가 있다는 문제를 지적합니다.#Review#Unified Multimodal Models#Understanding-Oriented Post-Training#Generation Synergy#Flow Matching#Semantic Supervision#MetaQuery2026년 5월 10일댓글 수 로딩 중