[논문리뷰] Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model본 연구는 Omni-Model이 단순히 여러 모달리티를 입력받는 것을 넘어, 실제 물리적 세계에 대한 논리적 추론 능력을 갖추고 있는지 검증하기 위해 수행되었습니다.#Review#Omni-Modal Generative Models#Physical-World Reasoning#Video Generation#Multimodal Alignment#Cross-modal Grounding#Implicit Prompting2026년 9월 17일댓글 수 로딩 중
[논문리뷰] DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection본 논문은 급격히 팽창하는 Visual Instruction Tuning 데이터셋 내에서 학습 품질을 극대화할 수 있는 최적의 샘플 선택 문제를 해결합니다.#Review#Visual Instruction Tuning#Data Selection#Data Intrinsic Consistency#Vision-Language Models#Information Gain#Multimodal Alignment#Budget-aware Selection2026년 8월 31일댓글 수 로딩 중
[논문리뷰] TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming본 논문은 e-commerce 라이브 스트리밍 환경에서의 복잡한 멀티모달 정보 이해 문제를 해결하기 위해 TLive-Omni를 제안합니다.#Review#Omni-modal#E-commerce#Live Streaming#Faithful-RFT#Per-vGrid#GRPO#Multimodal Alignment2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Aligning Quantum Operators with Large Language Models본 연구는 LLM이 텍스트나 기호 기반의 양자 프로그램은 처리할 수 있으나, 양자 연산의 본질인 Unitary Matrix와 같은 수학적 객체를 직접 이해하지 못한다는 한계를 해결하고자 합니다. 기존의 방식들은 기호화된 프록시에 의존하여 양자 연산자의 수치적 구조를 파악하지 못하는 문제가 있습니다.#Review#Quantum Circuit Synthesis#Large Language Models#Pauli Transfer Matrix#Multimodal Alignment#Unitary Synthesis#Stepwise Autoregressive Synthesis#Language-Conditioned Synthesis2026년 6월 16일댓글 수 로딩 중
[논문리뷰] When Vision Speaks for Sound본 논문은 최신 Video-LLMs가 오디오 이해 능력을 갖춘 것처럼 보이지만, 실제로는 오디오를 검증하지 않고 시각적 단서에서 사운드를 추론하거나 할루시네이션(Hallucination)을 일으키는 Clever Hans effect에 빠져 있음을 지적합니다 .#Review#Video-LLMs#Audio-Visual Grounding#Clever Hans Effect#Intervention-Driven Diagnostics#Direct Preference Optimization (DPO)#Multimodal Alignment2026년 5월 19일댓글 수 로딩 중
[논문리뷰] Semantic Generative Tuning for Unified Multimodal Models본 논문은 현대 UMM들이 이해와 생성이라는 두 핵심 과업을 분리된 최적화 경로로 학습함으로써 발생하는 표현적 불일치(Representational misalignment) 문제를 해결하고자 합니다.#Review#Unified Multimodal Models#Generative Tuning#Image Segmentation#Multimodal Alignment#Semantic Proxy#Representation Learning2026년 5월 19일댓글 수 로딩 중
[논문리뷰] OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer기존 비디오 커스터마이징 방법론들이 레퍼런스 비디오의 풍부한 시공간 정보를 충분히 활용하지 못하여, 유연성과 일반화가 제한되는 문제를 해결하고자 합니다.#Review#Video Transfer#Diffusion Models#Spatio-temporal Learning#Multimodal Alignment#Appearance Consistency#Temporal Control#Video Generation2026년 1월 20일댓글 수 로딩 중
[논문리뷰] PairUni: Pairwise Training for Unified Multimodal Language Models통합 멀티모달 언어 모델(UVLMs)에서 이해(understanding) 및 생성(generation) 태스크를 동시에 학습할 때 발생하는 이질적인 데이터 및 감독(supervision)으로 인한 태스크 간 간섭 문제 를 해결하고자 합니다.#Review#Unified Vision-Language Models#Reinforcement Learning#Multimodal Alignment#Pairwise Training#Group Relative Policy Optimization#Data Augmentation#Text-to-Image Generation#Visual Reasoning2025년 10월 30일댓글 수 로딩 중
[논문리뷰] ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder기존 CLIP 텍스트 인코더의 77토큰 길이 제한 , 영어 전용 지원, 미흡한 세분화된 의미 이해 능력이라는 한계를 해결하는 것이 목표입니다.#Review#Vision-Language Models#CLIP#LLM-based Embedder#Knowledge Distillation#Contrastive Learning#Curriculum Learning#Multimodal Alignment#Progressive Alignment2025년 10월 22일댓글 수 로딩 중
[논문리뷰] IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance확산 모델(Diffusion Models)에서 생성된 이미지와 입력 프롬프트 간의 정확한 멀티모달 정렬(multimodal alignment) 부족 문제를 해결합니다.#Review#Diffusion Models#Multimodal Alignment#MLLM#Image Re-generation#Preference Learning#Implicit Guidance#Text-to-Image2025년 10월 1일댓글 수 로딩 중