[논문리뷰] UniMate: One Unified Model to Animate Diverse Skeletons본 논문은 기존 모션 생성 모델들이 특정 골격 템플릿(예: SMPL, SMAL)에 종속되어 있어 다양한 캐릭터 구조를 처리하지 못하는 문제를 해결하고자 합니다 .#Review#Motion Synthesis#Skeletal Animation#Diffusion Models#Topology-Aware Learning#Foundation Model#Cross-Topology Generalization2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Training-Free Speech-Centric Omni Understanding with Frozen VLMs본 논문은 기존 Native Omni 모델들이 VLM 백본에 특정 오디오 인코더를 결합하고 대규모 학습을 수행함에 따라 발생하는 효율성 및 성능 저하 문제를 해결하고자 합니다.#Review#Training-Free Omni#Frozen VLM#Audio-to-Language Routing#Multimodal Understanding#Speech-Centric Omni2026년 9월 6일댓글 수 로딩 중
[논문리뷰] To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation기존 text-driven 3D generation methods는 대규모 outdoor environments와 세부적인 indoor scenes를 생성하는 데 상당한 발전을 이루었지만, 이러한 domains는 주로 독립적으로 synthesize되어 coherent urban world에 필요한 correspondence가 부족합니다.#Review#3D Urban Generation#Indoor-Outdoor Coherence#Cross-Scale Context#Autoregressive Generation#Building-Level Correspondence#Unified World Generation2026년 9월 6일댓글 수 로딩 중
[논문리뷰] The Attention Triangle in Audio-Video Models본 논문은 Audio-Video Diffusion Models에서 Cross-modal Attention 메커니즘이 유발하는 Semantic Leakage 문제를 해결하고자 합니다.#Review#Audio-Video Diffusion Models#Attention Triangle#Semantic Leakage#Cross-modal Attention#Source Attribution#Inference-time Steering#LTX-22026년 9월 6일댓글 수 로딩 중
[논문리뷰] The 2026 PNPL Competition: Word Classification and Efficient Cross-Subject Generalisation in LibriBrain100본 논문은 비침습적 MEG 기반의 음성 디코딩 시스템을 실용화하기 위해 필수적인 일반화 성능과 표준화된 평가 환경을 구축하는 것을 목표로 한다. 기존의 BCI 연구들은 개별 피험자에 특화된 수 시간 단위의 데이터에 의존해왔으나, 임상 환경에서는 단 몇 분의 데이터만으로 새로운 사용자에게 적응해야 하는 제약이 존재한다.#Review#Non-invasive BCI#MEG#Word Classification#Cross-Subject Generalisation#LibriBrain100#Data-efficient#Brain-to-Text2026년 9월 6일댓글 수 로딩 중
[논문리뷰] ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding본 논문은 실시간 영상 스트리밍 환경에서 MLLM이 겪는 과도한 연산 비용과 효율성 저하 문제를 해결합니다. 기존의 많은 연구는 모든 프레임을 모델의 전체 레이어(Full-depth)로 미리 처리(Prefill)하여 KV Cache를 생성하는데, 이는 매우 비용이 많이 들고 불필요한 연산을 유발합니다 .#Review#Streaming Video Understanding#MLLM#KV Cache#Efficient Inference#Query-Agnostic#Selective Retrieval2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models본 논문은 LLM의 안전 정렬(Safety Alignment) 과정에서 발생하는 False Refusal 문제를 데이터 구조적 관점에서 해결하고자 합니다.#Review#False Refusals#Safety Tuning#Large Language Models#Rationale-Only#Alignment#Over-refusal2026년 9월 6일댓글 수 로딩 중
[논문리뷰] RISE: Recursive Improvement via Self-Extrapolating Policy Distillation본 논문은 기존의 RLVR 및 OPD 방식이 겪는 근본적인 한계를 해결하고자 합니다. RLVR은 outcome reward만을 제공하여 token-level의 정교한 학습 신호가 부족하며, OPD는 적절한 teacher 모델의 부재로 인해 distribution mismatch 문제를 겪습니다 .#Review#On-policy Distillation#Policy Gradient#Recursive Improvement#Task Arithmetic#Reinforcement Learning with Verifiable Rewards2026년 9월 6일댓글 수 로딩 중
[논문리뷰] One Editor, Many Edits: A Unified Training-Free Framework for Diverse Video Editing본 논문은 강력한 이미지 편집 성능을 가진 MM-DiT를 별도의 비디오 특화 학습 없이도 일관성 있는 비디오 편집에 적용하는 방식을 연구합니다.#Review#Video Editing#Training-Free#Multimodal Diffusion Transformers#Spatio-Temporal Attention#Identity Preservation#Latent Blending2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue본 논문은 대화형 AI에서 발화와 신체 움직임이 분리되어 생성되는 기존 Cascade 방식의 한계점을 해결하고자 합니다. 기존 방식은 발화 생성 후 별도의 모션 모델을 수행하여 추론 지연(Latency)이 발생하며, 두 모듈 간의 공동 최적화(Joint optimization)가 불가능하다는 구조적 결함이 있습니다.#Review#Spoken Dialogue Models#Co-speech Motion#End-to-End#Multimodal Co-learning#Joint Optimization#Progressive Training#Pseudo-labeling2026년 9월 6일댓글 수 로딩 중
[논문리뷰] MaxKernel: Agentic Kernel Generation for TPUs본 논문은 현대 딥러닝 아키텍처의 가속화를 위해 필수적인 수동 커널 엔지니어링의 복잡성과 전문 지식 의존도를 해결하고자 합니다. 기존 방식은 하드웨어의 메모리 계층(HBM, SRAM/VMEM)을 수동으로 관리하고 복잡한 DMA pipelining을 최적화해야 하므로 진입 장벽이 매우 높습니다.#Review#TPU#Kernel Generation#Agentic System#Performance Optimization#JAX/Pallas#Autonomous Search2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models본 논문은 현대의 Vision-Language Models (VLMs)가 단순한 질의응답을 넘어 잘못된 전제, 안전하지 않은 요청, 또는 답변 불가능한 상황에서 적절하게 대응하지 못하는 문제를 해결하고자 합니다 .#Review#Vision-Language Models#Non-compliance#Selective Response#Compound Queries#Alignment#Benchmark2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Iris: Climbing to the Search Frontier본 논문은 Search Agent가 단순한 정보 검색을 넘어 다단계 추론(Multi-hop Reasoning)을 수행할 때 겪는 지식 파편화와 검색 효율성 문제를 해결하고자 한다.#Review#Search Agent#Multi-hop Reasoning#Reinforcement Learning#Supervised Fine-Tuning#Context Management#Web-Graph Construction2026년 9월 6일댓글 수 로딩 중
[논문리뷰] HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals본 논문은 LLM이 현실 세계의 물리적 시스템을 제어할 때 목표 달성만을 추구하며 발생하는 부작용을 얼마나 고려하는지 정량적으로 측정하고자 합니다.#Review#LLM Agents#AI Safety#Moral Reasoning#HarvestBench#Side Effects#Benchmark2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Group Adaptive Clipping Policy Optimization본 논문은 RLVR 환경에서 고정된 클리핑 경계가 학습 신호의 비대칭성을 적절히 반영하지 못하는 문제를 해결합니다. 기존 연구들은 롤아웃의 난이도나 그룹 내 정답 개수와 관계없이 일관된 클리핑 임계값을 적용하여, 어려운 문제에서 얻은 귀중한 학습 신호를 가진 롤아웃들을 과도하게 억제하는 경향이 있습니다 .#Review#RLVR#Policy Optimization#Adaptive Clipping#GRPO#Trust Region#Importance Sampling2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Enoki: Efficient Multi-Level Hallucination Detection본 논문은 LLM의 환각(Hallucination) 문제를 효과적으로 탐지하고, 단순한 이진 판단을 넘어 상세한 국소화(Localization) 피드백을 제공하는 것을 목표로 합니다.#Review#Hallucination Detection#Open Information Extraction#Fact Verification#Span Localization#Multi-granular#Large Language Models2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Dr. Claw: An AI Scientist Workspace for Vibe Research본 논문은 현재의 AI 연구 에이전트들이 실행 효율성에는 집중하지만 연구 프로세스의 Controllability(통제성)와 Auditability(감사 가능성)가 부족하다는 문제점을 해결하고자 합니다.#Review#AI Scientist#Human-in-the-Loop#Research Orchestration#Auditability#Agentic Workspace#Vibe Research2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference본 논문은 LLM pre-training에 막대한 computational resource가 소요되며, time-to-accuracy 개선이 수백만 달러의 비용 절감과 탄소 배출량 감소로 이어질 수 있다는 문제의식에서 출발합니다.#Review#Layer Dropout#Stochastic Depth#LLM Training#Inference Optimization#Structured Sparsity#Hyperparameter Tuning#Early Exit#Self-Speculative Decoding2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems본 논문은 Multi-agent LLM 시스템에서 coordination, memory improvement, 그리고 external verification의 역할에 대한 통합적인 이론적 설명을 제공한다.#Review2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs본 논문은 LLM의 CoT 생성 과정에서 텍스트로 표현되는 추론 연산들이 모델 내부의 Hidden Representations에서 어떤 구조로 기하학적으로 조직화되어 있는지 규명하고자 합니다.#Review#Chain-of-Thought#Mechanistic Interpretability#Reasoning Operations#Representation Geometry#Large Language Models#Latent Dynamics2026년 9월 6일댓글 수 로딩 중