[논문리뷰] Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System본 논문은 통합 멀티모달 모델(UMM) 내에서 이해와 생성이라는 두 기능이 공존할 때 발생하는 상호작용의 실체를 규명하고자 한다. 기존 모델들은 두 기능을 통합하여 제공하지만, 이러한 기능적 통합이 반드시 내재적 학습 시너지로 이어지는지는 불분명하며 때로는 컴퓨팅 자원이나 표현 공간을 두고 경쟁하거나 충돌하기도 한다.#Review#Unified Multimodal Models#Native Multimodal#Understanding-Generation Synergy#Task-decoupled MoT#Parameter Sharing#Spatial Intelligence#Representation Learning2026년 9월 1일댓글 수 로딩 중
[논문리뷰] VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression본 논문은 VLM이 고해상도 이미지를 처리할 때 발생하는 과도한 시각적 토큰으로 인한 inference latency와 KV cache 메모리 오버헤드 문제를 해결하고자 합니다.#Review#Vision-Language Models#Token Compression#Autoencoder#Intrinsic Encoding#Hierarchical Information#Parameter Sharing2026년 7월 26일댓글 수 로딩 중
[논문리뷰] Knocking-Heads Attention본 논문은 기존 Multi-Head Attention (MHA) 의 어텐션 헤드들이 독립적으로 작동하여 개별 헤드 역량 저하 및 상호작용 부족을 야기하는 문제를 해결하고자 합니다.#Review#Multi-Head Attention#Transformer#Large Language Models#Inter-Head Communication#Parameter Sharing#Training Stability#Diagonal Initialization2025년 10월 28일댓글 수 로딩 중