[논문리뷰] Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment본 논문은 Speech 기반 우울증 탐지 모델이 언어적 경계를 넘어 일반화되지 못하는 한계를 해결하고자 합니다.#Review#Cross-lingual Depression Detection#Supervised Contrastive Alignment#WavLM#Speaker-identity Leakage#Layer-wise Analysis#CLeaD2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator본 논문은 Embodied Navigation 학습을 위한 대규모의 고품질 물리 기반 대화형 시뮬레이션 환경이 부족하다는 문제점을 해결하고자 합니다. 기존 연구들은 실제 스캔 데이터와 합성 데이터 사이의 trade-off, 즉 시각적 충실도와 확장성 사이의 한계에 직면해 있습니다 .#Review#Embodied Navigation#Neural Simulator#3D Gaussian Splatting#Pixel Flow#Vision-Language Navigation#Sim-to-Real2026년 7월 7일댓글 수 로딩 중
[논문리뷰] HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better본 논문은 OCR 특화 VLM이 단순한 문서 파싱 도구를 넘어 더 넓은 영역을 커버하고 실제 배포 환경에서 더 빠른 성능을 내야 한다는 필요성에 착안했습니다.#Review#OCR#Vision-Language Model#DFlash#Agentic Data Flow#Speculative Decoding#Document Parsing#Inference Acceleration2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling본 논문은 LLM의 long-context 확장을 저해하는 quadratic computation cost와 length extrapolation 성능 저하 문제를 해결하기 위해, 기존 chunk-wise sparse attention 방식이 갖는 불완전한 chunk 선택 메커니즘을 개선하고자 합니다.#Review#Large Language Models#Long Context Modeling#Sparse Attention#Hierarchical Attention#Chunk-wise Attention#End-to-end Learning2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Gemma 4 Technical Report본 논문은 최신 LLM 생태계에서 요구되는 강력한 multimodal 이해도, 복잡한 추론 능력, 그리고 컴퓨팅 효율성을 동시에 달성하기 위해 Gemma 4 모델 제품군을 제안합니다.#Review#Multimodal#Mixture-of-Experts#Reasoning Trace#Speculative Decoding#Quantization-Aware Training#Long-context#Encoder-free2026년 7월 7일댓글 수 로딩 중
[논문리뷰] From Foundation to Application: Improving VLA Models in Practice본 논문은 기존의 VLA foundation model들이 실험실 환경의 벤치마크에서는 뛰어난 성능을 보이지만, 실제 로봇 환경의 다양한 하드웨어 구성과 복잡한 작업 조건에서는 여전히 한계가 있다는 문제 의식에서 출발합니다.#Review#Vision-Language-Action (VLA)#Mixture-of-Experts (MoE)#Embodiment Generalization#Dual-Query Distillation#Robotic Manipulation#Spatiotemporal Reasoning2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model기존의 비디오 생성 모델은 Bidirectional diffusion과 Autoregressive 모델이라는 두 개의 분리된 패러다임으로 나뉘어 있어, 각각의 장단점이 뚜렷하다는 한계가 있습니다.#Review#Video Diffusion Models#Autoregressive Generation#Bidirectional Generation#Flexible Chunking#Denoising Timesteps#KV Caching#Any-order Editing2026년 7월 7일댓글 수 로딩 중
[논문리뷰] DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation본 논문은 기존 Speculative Decoding 방식이 가진 병렬 생성의 품질 저하와 비효율적인 검증 문제를 해결하기 위해 DSpark를 제안한다. 기존의 Parallel drafter는 토큰 간 의존성을 모델링하지 못해 뒤로 갈수록 수용률이 떨어지는 Suffix Decay 문제를 겪는다.#Review#Speculative Decoding#Semi-Autoregressive Generation#Confidence-Scheduled Verification#Hardware-Aware Scheduler#LLM Inference Acceleration#Throughput Optimization2026년 7월 7일댓글 수 로딩 중
[논문리뷰] CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration본 논문은 복잡한 이미지 생성 및 편집 워크플로우를 수행하는 멀티모달 에이전트의 한계를 해결하기 위해 CanvasAgent를 제안한다.#Review#Multimodal Agents#Image Creation#Tool Orchestration#Reinforcement Learning#Hybrid Reward#Trajectory Optimization2026년 7월 7일댓글 수 로딩 중
[논문리뷰] CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-centric 3D Scene Generation본 연구는 기존 ego-centric 3D 생성 모델들이 시점 변화에 따른 심각한 Consistency 저하 및 기하학적 왜곡 문제를 겪고 있다는 점을 해결하고자 한다.#Review#3D Scene Generation#Gaussian Splatting#Ego-centric#Consistency#Geometry#Generative Modeling2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing본 논문은 현대 학술 연구 과정이 여러 도구로 파편화되어 있어 발생하는 과도한 컨텍스트 전환과 비효율 문제를 해결하고자 한다.#Review#Academic Writing#Agentic Platform#LaTeX#Toolchain Compression#Retrieval-Augmented Generation#Scholarly Infrastructure2026년 7월 7일댓글 수 로딩 중
[논문리뷰] AlayaWorld: Long-Horizon and Playable Video World Generation본 논문은 노동 집약적인 기존 게임 개발 파이프라인의 한계를 극복하고, 확장성과 적응성이 뛰어난 상호작용 가능한 가상 세계를 생성하는 Generative World Models의 기반을 마련하고자 합니다.#Review#Generative World Models#Interactive Video Generation#Long-Horizon Generation#Spatial Memory#Camera Control#Open-ended Action#Prompt-switching2026년 7월 7일댓글 수 로딩 중
[논문리뷰] 3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance본 논문은 기존의 Hierarchical VLA 모델들이 직면한 2D 계획과 3D 실행 사이의 표현적 불일치(Representational Misalignment) 문제를 해결합니다.#Review#Vision-Language-Action Models#3D Trajectory Guidance#Hierarchical Robotics#Metric Depth#Point Cloud Policy2026년 7월 7일댓글 수 로딩 중
[논문리뷰] dOPSD: On-Policy Self-Distillation for Diffusion Language Models본 논문은 dLLM의 추론 성능을 향상시키기 위한 효과적인 post-training 방법론의 부재 문제를 다룬다. 기존의 Supervised Fine-Tuning은 off-policy 문제로 인한 exposure bias에 취약하며, RLVR은 보상이 희소하고 sequence-level에 국한된다는 한계가 있다.#Review#Diffusion Language Models#On-Policy Self-Distillation#Privileged Information#Denoising Trajectory#Reasoning2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Wan-Streamer v0.2: Higher Resolution, Same Latency본 논문은 Wan-Streamer v0.1의 핵심인 네이티브 스트리밍 프레임워크를 유지하면서, 기존 192p의 낮은 출력 해상도를 개선하여 실시간 상호작용의 시각적 품질을 높이는 것을 목표로 합니다.#Review#Native-streaming#Audio-visual Interaction#Context-parallel#Latency-preserving#Ulysses-style#Flow-matching#Real-time2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Vision Pretraining for Dense Spatial Perception본 논문은 현대의 비전 파운데이션 모델들이 Semantic Invariance를 우선시하여 고밀도 공간 이해(Dense Spatial Perception) 능력이 부족하다는 문제를 해결하고자 한다 .#Review#Vision Pretraining#Masked Boundary Modeling#Self-Supervised Learning#Dense Spatial Perception#Vision Transformer#Boundary-Forcing Masking#Categorical Reparameterization2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Unified Audio Intelligence Without Regressing on Text Intelligence본 논문은 오디오와 비전 등 다중 모달 능력을 강화한 기존 LLM들이 텍스트 추론 및 지식 처리 능력에서 심각한 성능 퇴보를 보이는 문제를 해결하고자 합니다. 특히 최근의 멀티모달 모델들은 강력한 생성 능력을 갖추었음에도 불구하고, Reasoning 벤치마크에서 원본 모델 대비 눈에 띄는 저하를 보입니다.#Review#Audio-Text LLM#Mixture-of-Experts (MoE)#Multimodal Generation#Cascade RL#Audio Intelligence2026년 7월 6일댓글 수 로딩 중
[논문리뷰] UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent LearningGUI agent는 단일 플랫폼을 넘어 다양한 환경(데스크탑, 모바일)으로 확장되고 있으나, 플랫폼 간 이질적인 상호작용 방식과 높은 품질의 교차 플랫폼 궤적 부족으로 인해 학습에 어려움을 겪고 있다 .#Review#GUI Agent#Multi-Teacher On-Policy Distillation#Continual Learning#Cross-Platform#Desktop/Mobile#Reinforcement Learning2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports본 연구는 대부분의 기존 Chest X-ray 보고서 생성 모델 및 Best-of-N 파이프라인이 환자의 이전 검사 이력을 무시하고 단일 이미지에만 의존한다는 한계를 해결합니다.#Review#Chest X-ray#Report Generation#Best-of-N Sampling#Longitudinal Context#Vision-Language Models#Set-to-Set Distance#Clinical Transition2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Taste-aware music retrieval from audio embeddings본 연구는 소리와 맛 사이의 상관관계가 인간의 심리적 연구에서는 잘 확립되어 있음에도 불구하고, 콘텐츠 기반 멀티미디어 검색 분야에서는 거의 다뤄지지 않고 있다는 문제의식에서 출발합니다.#Review#Audio Embeddings#Music Information Retrieval#Crossmodal Correspondence#Multimodal Learning#Taste Prediction2026년 7월 6일댓글 수 로딩 중