[논문리뷰] Discretizing Reward Models본 논문은 현대의 Reward Model들이 성능 측정 지표상으로는 우수해 보이지만, 실제 Reinforcement Learning 과정에서 응답의 유용성을 과도하게 구별하는 Oversensitivity 문제로 인해 저품질 정책을 유도한다는 점을 문제로 제기합니다 .#Review#Reward Model#Reinforcement Learning#Oversensitivity#Discretization#Reward Clustering#Monte Carlo Dropout#Discriminative Ability#Specificity2026년 6월 25일댓글 수 로딩 중
[논문리뷰] DanceOPD: On-Policy Generative Field Distillation본 연구는 단일 모델이 T2I, 로컬/글로벌 에디팅 등 서로 충돌할 수 있는 다양한 생성 능력을 통합하면서도 각각의 성능을 유지해야 하는 문제를 해결하고자 합니다. 기존의 데이터 혼합(data mixing)이나 모델 결합 방식은 capability 간의 gradient 충돌을 야기하거나 성능을 희석시키는 한계를 가집니다.#Review#Generative Field Distillation#Flow Matching#On-Policy Distillation#Capability Composition#Hard-Routed Field Matching#Multi-Capability Alignment2026년 6월 25일댓글 수 로딩 중
[논문리뷰] Confidence-Aware Tool Orchestration for Robust Video Understanding본 논문은 현대의 Video-LLM들이 실세계의 다양한 시각적 열화 환경에서 프레임별 신뢰도를 무시함으로써 발생하는 Blind Trust Problem을 해결하는 것을 목표로 합니다.#Review#Video Understanding#Robustness#Tool Orchestration#GRPO#Frame Selection#Blind Trust Problem#Confidence-Aware2026년 6월 25일댓글 수 로딩 중
[논문리뷰] CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies본 논문은 기존 LLM 에이전트 벤치마크가 단일 에이전트나 동질적인 환경에 국한되어, 현실적인 경제 시스템의 복잡성을 반영하지 못하는 한계를 해결하고자 한다.#Review#LLM Agents#Long-Horizon#Multi-Agent Economy#Benchmark#Supply Chain#Decision-making2026년 6월 25일댓글 수 로딩 중
[논문리뷰] COrigami: An AI Pipeline for Co-Designing Flat-Foldable Visually Recognisable Origami본 논문은 현대의 생성형 AI가 물리적인 제약 조건과 인간의 미적 취향을 동시에 만족시키는 물리적 예술 작품을 설계하는 데 한계가 있다는 점을 지적합니다.#Review#Computational Origami#Flat-Foldable#Reinforcement Learning#Vision-Language Model#Neuro-symbolic Pipeline#Box Pleating#Crease Pattern2026년 6월 25일댓글 수 로딩 중
[논문리뷰] When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents본 논문은 LLM 에이전트가 작업 수행 시 불필요하게 높은 권한의 도구를 선택하는 Over-privileged Tool Selection의 심각성과 그 기저의 행동적 원인을 규명합니다 .#Review#LLM Agents#Tool Selection Bias#Least Privilege#Privilege-Aware Post-Training#Agent Safety#ToolPrivBench2026년 6월 24일댓글 수 로딩 중
[논문리뷰] What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics본 논문은 대규모 언어 모델(LLMs)의 안전성을 위협하는 Jailbreak 공격을 모델 내부의 활성화 상태(internal representations) 분석을 통해 효율적으로 탐지하고자 합니다. 기존 연구들은 주로 프롬프트 수준의 필터링이나 외부 분류기에 의존하여 모델 내부의 의미적 변화를 간과하는 한계가 있습니다.#Review#Jailbreak Detection#Large Language Models#Predictive Entropy#Logit Lens#Intermediate Layers#Adversarial Robustness#Uncertainty Dynamics2026년 6월 24일댓글 수 로딩 중
[논문리뷰] Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models본 논문은 실시간 오디오-비디오 인터랙션의 단절성과 모듈 간의 지연 시간 문제를 해결하기 위해 Wan-Streamer를 제안한다. 기존 연구들은 VAD, ASR, LLM, TTS 등을 결합한 캐스케이드(cascaded) 방식을 사용하여, 모듈 경계에서의 대기 시간과 오차 누적 문제에 직면해 있다 .#Review#End-to-End#Real-time Interaction#Multimodal Foundation Models#Full-duplex#Streaming Inference#Block-causal Attention#Thinker-Performer Pipeline2026년 6월 24일댓글 수 로딩 중
[논문리뷰] V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning본 논문은 Fine-grained visual reasoning 분야에서 요구되는 고비용의 RL 기반 탐색 및 대규모 텍스트 레이블 의존 문제를 해결하기 위해 제안되었습니다.#Review#Multimodal Large Language Models#On-Policy Distillation#Fine-Grained Visual Reasoning#Contrastive Evidence Gating#Visual Grounding2026년 6월 24일댓글 수 로딩 중
[논문리뷰] UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating본 논문은 기존의 다중 샷(multi-shot) 비디오 생성 모델들이 샷 간의 일관성(cross-shot coherence) 유지와 장기적인 내러티브 확장성이라는 두 가지 핵심 과제를 해결하지 못하는 문제를 다룹니다.#Review#Multi-shot Video Generation#Memory-driven#Boundary-aware Gating#Diffusion Transformer#Audio-Visual Generation2026년 6월 24일댓글 수 로딩 중
[논문리뷰] TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy기존의 Video Virtual Try-on (VVT) 연구들은 입력 영상의 카메라 궤적에 종속되어 있어, 사용자가 원하는 다양한 각도에서의 의류 확인이 불가능하다는 구조적 한계가 존재함.#Review#Video Virtual Try-on#Camera-controllable#4D Try-on Proxy#3DGS#Diffusion Transformer#CaM-VVTBench2026년 6월 24일댓글 수 로딩 중
[논문리뷰] The Hitchhiker's Guide to Agentic AI: From Foundations to Systems이 가이드는 현대 AI 시스템의 전체 스택을 이해하고 구축하고자 하는 연구자와 실무자를 위해, LLM의 기초 아키텍처부터 autonomous agentic 시스템까지를 통합적으로 설명합니다.#Review#LLM#Reinforcement Learning#Agentic AI#System Architecture#Retrieval-Augmented Generation#Chain-of-Thought#Multi-Agent Systems2026년 6월 24일댓글 수 로딩 중
[논문리뷰] ShutterMuse: Capture-Time Photography Guidance with MLLMs본 연구는 실제 촬영 현장에서 필요한 실시간 가이던스 기능을 기존의 MLLM과 사진 모델들이 효과적으로 제공하지 못한다는 문제 의식에서 출발한다.#Review#MLLM#Photography Guidance#Capture-Time Guidance#Composition#Pose Recommendation#Reinforcement Fine-Tuning2026년 6월 24일댓글 수 로딩 중
[논문리뷰] RoPE-Aware Bit Allocation for KV-Cache Quantization본 논문은 기존 KV-Cache 양자화 기법들이 Key를 단순한 평면 벡터(Flat Vector)로 취급하여 발생하는 정보 손실 문제를 해결하고자 합니다.#Review#KV-Cache Quantization#RoPE#Bit Allocation#LLM Inference#Long-Context#TurboQuant#Block-GTQ2026년 6월 24일댓글 수 로딩 중
[논문리뷰] ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation본 논문은 표준 OPD 및 OPSD가 모든 SGO를 균등하게 취급하여 효율적인 학습 기회를 놓치고 있다는 점을 문제로 지적합니다.#Review#On-Policy Distillation#Language Model Post-training#Sample Reweighting#Negative Trajectory#Reasoning#Knowledge Distillation#Prefix-based Training2026년 6월 24일댓글 수 로딩 중
[논문리뷰] RL-Index: Reinforcement Learning for Retrieval Index Reasoning본 논문은 복잡한 논리적 추론이 필요한 검색 과제에서 기존 모델들이 겪는 한계를 극복하기 위해 제안되었다. 기존의 Query Rewriting 기반 접근 방식은 실시간으로 LLM을 호출해야 하므로 상당한 Online Latency를 유발하는 문제가 있다 .#Review#Retrieval-Augmented Generation#Reinforcement Learning#Agentic Indexing#Group Relative Policy Optimization#Document Augmentation#Latency Optimization2026년 6월 24일댓글 수 로딩 중
[논문리뷰] MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation죄송합니다. 현재 제공해주신 논문 URL(https://arxiv.org/html/2606.26087)은 시스템상 접근이 제한되어 내용을 직접 읽고 분석할 수 없습니다.#Review2026년 6월 24일댓글 수 로딩 중
[논문리뷰] Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do본 논문은 Multimodal CoT가 과연 모든 멀티모달 작업에서 일관되게 성능을 향상시키는지, 그리고 그 한계점은 무엇인지를 체계적으로 분석합니다. 최근 텍스트 중심 LLM에서는 CoT가 추론 능력을 극대화하는 표준으로 자리 잡았으나, 이를 멀티모달 영역으로 확장했을 때의 효용성은 여전히 불분명합니다.#Review#Multimodal Chain-of-Thought#Visual Reasoning#LLM#Test-Time Scaling#Visual Reflection#Attention Bias2026년 6월 24일댓글 수 로딩 중
[논문리뷰] Improved Large Language Diffusion Models본 논문은 기존 Autoregressive 패러다임이 지배적인 LLM 생태계에서 Diffusion 기반 언어 모델의 한계를 극복하고 그 가능성을 입증하고자 한다.#Review#Diffusion Language Models#Bidirectional Attention#Masked Diffusion#Instruction Tuning#Large Language Models#Variable-Length Generation2026년 6월 24일댓글 수 로딩 중
[논문리뷰] IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation본 논문은 현대의 통합형 MLLM 기반 이미지 생성 모델들이 복잡한 구조적 요구사항(객체 수, 공간적 관계, 속성 결합 등)을 따르는 데 어려움을 겪는 구조적 불투명성 문제를 해결하고자 합니다.#Review#IV-CoT#Chain-of-Thought#Structure-Aware#Text-to-Image Generation#MLLM-DiT#Latent Reasoning2026년 6월 24일댓글 수 로딩 중