[논문리뷰] Anisotropic Modality AlignMLLM 학습은 고품질의 쌍(paired) 멀티모달 데이터 부족이라는 고질적인 문제에 직면해 있으며, 이를 해결하기 위해 공유 임베딩 공간에서 unimodal 데이터를 정렬하는 방식이 주목받고 있다.#Review#Multimodal Large Language Models#Modality Gap#Unpaired Alignment#Anisotropic Geometric Correction#Representation Learning2026년 5월 10일댓글 수 로딩 중
[논문리뷰] AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning본 논문은 Agentic RL에서 발생하는 sparse, outcome-level reward 문제를 해결하기 위해 응답 수준에서의 정교한 Credit Assignment 프레임워크를 제안합니다.#Review#Agentic Reinforcement Learning#Credit Assignment#Adaptive Entropy Modulation#Large Language Models#Exploration-Exploitation Trade-off#Surprisal#Policy Optimization2026년 5월 10일댓글 수 로딩 중
[논문리뷰] 4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding본 논문은 기존 VLM이 동적 공간 추론에서 겪는 불투명성과 성능 한계를 해결하기 위해 4DThinker를 제안합니다. 기존 연구들은 추론 과정을 텍스트로만 기술하거나 외부 기하학적 모듈을 의존하여 추론 복잡도를 증가시키고 모델 자체의 내재적 능력을 제한하는 한계를 보입니다 .#Review#Vision-Language Models#Dynamic Spatial Reasoning#Latent Mental Imagery#Dynamic-Imagery Fine-Tuning (DIFT)#4D Reinforcement Learning (4DRL)#Chain-of-Thought (CoT)2026년 5월 10일댓글 수 로딩 중
[논문리뷰] The Scaling Properties of Implicit Deductive Reasoning in Transformers본 논문은 depth-bounded Transformer가 내재적(implicit)으로 수행하는 연역적 추론의 확장성(scaling) 한계를 규명합니다.#Review#Transformers#Implicit Deductive Reasoning#Horn Clauses#Chain-of-Thought#Scaling Properties#Shortcut Learning#Algorithmic Alignment2026년 5월 7일댓글 수 로딩 중
[논문리뷰] TabEmbed: Benchmarking and Learning Generalist Embeddings for Tabular Understanding본 논문은 LLM이 자연어 처리에 성공한 것과 달리, tabular 데이터를 위한 통합된 representation 패러다임이 부재하다는 점을 해결하고자 합니다 .#Review#Tabular Embedding#Contrastive Learning#Tabular Understanding#Foundation Models#Representation Learning#Tabular Retrieval2026년 5월 7일댓글 수 로딩 중
[논문리뷰] SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation본 논문은 2K 고해상도 I2V 생성에서 발생하는 계산 효율성(Efficiency)과 입력 이미지 충실도(Fidelity) 사이의 심각한 trade-off 문제를 해결하고자 한다.#Review#Image-to-Video#High-Resolution Generation#Diffusion Transformer#Conditional Segment-wise Generation#Efficiency#Streaming Inference2026년 5월 7일댓글 수 로딩 중
[논문리뷰] MARBLE: Multi-Aspect Reward Balance for Diffusion RL본 논문은 diffusion model을 human preference에 맞게 미세 조정할 때, 여러 개의 reward를 동시에 최적화하는 과정에서 발생하는 성능 저하 문제를 해결하고자 합니다.#Review#Diffusion Models#Reinforcement Learning#Multi-Reward Optimization#Gradient Harmonization#Reward Balancing#Alignment2026년 5월 7일댓글 수 로딩 중
[논문리뷰] Continuous-Time Distribution Matching for Few-Step Diffusion Distillation본 논문은 기존의 Diffusion Distillation 방식이 학습 및 추론 시 고정된 이산적 타임스텝(discrete anchors)에 지나치게 의존함으로써 발생하는 성능 저하 문제를 해결하고자 한다.#Review#Diffusion Models#Distillation#Continuous-Time Optimization#Distribution Matching#Few-Step Generation#Flow Matching2026년 5월 7일댓글 수 로딩 중
[논문리뷰] Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes본 논문은 기계학습 연구의 제안-측정-수정 루프를 인간의 개입 없이 언어 모델 에이전트로 자동화하는 것을 목표로 합니다. 기존의 자동화 연구들이 주로 단일 모델 출력물 생성이나 제한적인 하이퍼파라미터 탐색에 머물렀던 것과 달리, 이 연구는 실제 학습 파이프라인 전반에 걸친 실질적인 코드 구조 수정을 목표로 합니다.#Review#Auto Research#Language Agents#Closed-Loop#Training Recipes#Specialist Agents#Compute-Budgeted#Lineage Feedback2026년 5월 7일댓글 수 로딩 중
[논문리뷰] Audio-Visual Intelligence in Large Foundation Models본 논문은 대규모 파운데이션 모델 시대에 멀티모달 학습이 필수적임에도 불구하고, 시청각 데이터 간의 정렬, Taxonomy의 불일치, 그리고 평가 방법론의 파편화로 인해 체계적인 연구가 어렵다는 문제를 해결하고자 합니다.#Review#Audio-Visual Intelligence#Foundation Models#Multimodal Fusion#Embodied AI#Cross-modal Generation2026년 5월 7일댓글 수 로딩 중
[논문리뷰] AI Co-Mathematician: Accelerating Mathematicians with Agentic AI본 논문은 수학 연구의 복잡하고 반복적인 실제 프로세스를 지원하기 위해 상태 유지형 워크플로우를 제공하는 AI co-mathematician을 제안한다.#Review#Agentic AI#Mathematical Research#Interactive Workspace#Workstream#Stateful Workflow#Uncertainty Management#FrontierMath2026년 5월 7일댓글 수 로딩 중
[논문리뷰] X2SAM: Any Segmentation in Images and Videos본 논문은 MLLM의 강력한 추론 능력과 foundation segmentation model의 정밀한 픽셀 단위 인식 능력을 통합하여 정적 이미지뿐만 아니라 동적 비디오까지 포괄하는 통합된 세분화 프레임워크를 구축하는 것을 목표로 합니다.#Review#MLLM#Segmentation#Video-Understanding#Mask-Memory#Visual-Prompting#Spatio-Temporal-Consistency2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies본 논문은 기존의 에이전트 벤치마크가 실제 업무 환경의 복잡한 파일 의존성(Large-Scale File Dependencies)을 충분히 반영하지 못하는 한계를 해결하기 위해 제안되었다.#Review#AI Agents#Workspace Learning#Benchmark#File Dependency#Large-Scale#Autonomous Agent#Task-File-Driven2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Video Generation with Predictive Latents본 논문은 기존 Video VAE가 단순히 비디오의 시각적 재구성 성능을 최적화하는 것만으로는 우수한 비디오 생성(Generative Performance)을 보장할 수 없다는 문제점을 해결하고자 한다.#Review#Video Generation#Video VAE#Predictive Learning#Latent Diffusion Models#Temporal Dynamics#Motion Prior#Spatiotemporal Compression2026년 5월 5일댓글 수 로딩 중
[논문리뷰] The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail본 논문은 상용 및 오픈 소스 STT 시스템이 인도 언어의 특정 엔티티 인식에서 극도로 낮은 성능을 보이는 문제를 해결하고자 한다. 기존 시스템들은 Wikipedia나 뉴스 등 read-prose 중심의 데이터로 학습되어, 실제 현업에서 빈번한 엔티티 데이터에 취약하다.#Review#Indic ASR#TTS-STT Flywheel#Entity-Dense Audio#LoRA#Script Fidelity Rate#Data Augmentation#Entity-Hit-Rate2026년 5월 5일댓글 수 로딩 중
[논문리뷰] TCDA: Thread-Constrained Discourse-Aware Modeling for Conversational Sentiment Quadruple Analysis본 논문은 DiaASQ 작업에서 기존 모델들이 대화의 복잡한 의존 관계를 제대로 모델링하지 못하고 발생하는 구조적 노이즈와 거리 감쇠 문제를 해결하고자 합니다. 기존 GCN 기반 연구들은 불필요한 스레드 간 정보를 여과 없이 전파하여 구조적 노이즈를 야기하는 한계가 있습니다.#Review#DiaASQ#TC-DAG#D-RoPE#Distance Dilution#Sentiment Analysis#Conversational AI#Discourse Modeling2026년 5월 5일댓글 수 로딩 중
[논문리뷰] SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment본 연구는 실제 일상생활 속에서 사용자가 호소하는 증상을 기반으로 하는 대화형 AI 진단 에이전트의 성능을 임상적 수준에서 검증하고자 한다.#Review#Conversational AI#Differential Diagnosis (DDx)#LLM#Fitbit#Wearable Biosignals#PheWAS#Healthcare AI2026년 5월 5일댓글 수 로딩 중
[논문리뷰] StateSMix: Online Lossless Compression via Mamba State Space Models and Sparse N-gram Context Mixing본 논문은 대규모 LLM 기반 압축 기술이 요구하는 엄청난 컴퓨팅 자원과 외부 가중치 전송의 비실용성을 해결하기 위해 완전 online 신경망 압축 방식을 제안한다. 기존의 고성능 신경망 압축 모델들은 수억 개의 파라미터를 외부에서 가져와야 하므로 범용적인 환경에서 사용하기 어렵다.#Review#Lossless Compression#State Space Models#Mamba#Online Learning#Arithmetic Coding#N-gram#BPE Tokenisation2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO본 연구는 LLM 기반 Agent 생태계에서 Skill이 범람함에도 불구하고, 개별 개발자가 특정 목적 위주로 설계하여 기능적 파편화(Fragmentation)와 커버리지 부족 문제를 겪고 있는 현실을 해결하고자 합니다 .#Review#Large Language Model#Agent#Skill Self-Evolution#GRPO#Benchmark#Automation2026년 5월 5일댓글 수 로딩 중
[논문리뷰] SVGS: Enhancing Gaussian Splatting Using Primitives with Spatially Varying Colors본 논문은 기존 Gaussian Splatting 방식이 복잡한 텍스처나 기하학적 형태를 표현할 때 비효율적이라는 문제를 해결하고자 합니다 .#Review#Gaussian Splatting#Novel-view Synthesis#Spatially Varying#Gaussian Surfels#Movable Kernels#3D Reconstruction2026년 5월 5일댓글 수 로딩 중