[논문리뷰] β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation본 논문은 기존의 OPSD가 가지는 취약성과 엔지니어링의 어려움을 해결하는 것을 목표로 합니다. 기존 연구들은 학생 모델이 Privileged Teacher를 직접 모방하도록 강제하며, 학습 과정에서 Reference Policy로부터 얼마나 멀어져야 하는지에 대한 명확한 제어 메커니즘을 제공하지 못합니다 .#Review#On-policy Self-distillation#Policy Optimization#KL-regularization#Logit Interpolation#Return-to-go Credit Assignment2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems본 연구는 LLM 기반의 Multi-Agent Systems (MAS)에서 중앙 모델이 각 peer의 응답 신뢰성을 직접 검증하기 어렵다는 근본적인 문제를 해결하고자 합니다.#Review#Multi-Agent Systems#LLM#Online Reliability Memory#Spectral Adaptation#Competence Modeling#Peer Relationship2026년 7월 30일댓글 수 로딩 중
[논문리뷰] VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System본 논문은 기존의 text-to-video 모델들이 텍스트 프롬프트에 내재된 복잡한 물리적 과정을 암시적으로 추론해야 하는 Causal Opacity 문제로 인해 물리적으로 일관된 동역학을 생성하지 못하는 한계를 해결하고자 합니다.#Review#Video Generation#Physical Consistency#Chain-of-Thought#Agentic Systems#Executable Code2026년 7월 30일댓글 수 로딩 중
[논문리뷰] SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them일반적인 Vision-Language Models(VLMs)는 전반적인 과업 수행에는 능숙하나, 공간적 관계나 미세한 시각적 세부 사항을 파악하는 능력은 부족하다는 근본적인 문제가 존재한다.#Review#Vision-Language Models#Spatial Reasoning#Tool-Augmented Agents#Capability Internalization#Embodied AI#Agentic Reinforcement Learning2026년 7월 30일댓글 수 로딩 중
[논문리뷰] ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow본 논문은 interactive video world models에서 보편적이면서도 정밀한 action 제어가 어렵다는 난제를 해결합니다.#Review#Video World Models#Shadow Learning#Cross-shadow Prediction#Latent Action Models#Interactive Generation#Dynamics Representation2026년 7월 30일댓글 수 로딩 중
[논문리뷰] See2Think: Do Multimodal Models Really Use Intermediate Visual States?본 논문은 Multimodal Large Language Models(MLLMs)가 추론 과정에서 생성하는 중간 시각적 상태가 실제로 문제 해결에 기여하는지 검증하는 것을 목표로 한다.#Review#Multimodal Large Language Models#Chain-of-Thought#Visual Reasoning#Evaluation Framework#Intermediate Visual States#Visual Action-of-Thought2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes본 논문은 기존의 Lossy Verification 방법론들이 실제 추론 시 성능 저하를 일으키는 메커니즘을 규명하고, 이들이 제안하는 속도 향상의 실질적인 trade-off를 분석한다.#Review#Speculative Decoding#Lossy Verification#Truncation Sampling#Collaborative Decoding#Inference Acceleration#Large Language Models2026년 7월 30일댓글 수 로딩 중
[논문리뷰] RefCaptioner: Multi-Reference Image-Grounded Video Captioning본 연구는 기존 비디오 캡셔닝 모델이 비디오 내용을 설명하는 데에는 능숙하지만, 복수의 참조 이미지를 시각적 사실과 명확하게 정렬하지 못하는 한계를 해결하고자 합니다.#Review#Multi-Reference Video Captioning#Image-Grounded Captioning#GRPO#Factuality#Reference Binding2026년 7월 30일댓글 수 로딩 중
[논문리뷰] ReToken: One Token to Improve Vision-Language Models for Visual Retrieval본 논문은 긴 시각적 문맥(long visual context)을 처리해야 하는 VLM이 정보량이 많아짐에 따라 성능이 저하되는 문제를 해결하고자 한다.#Review#Vision-Language Models#Visual Retrieval#Long-Context Understanding#ReToken#Attention Mechanism#KV Cache#Sparse Retrieval2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents본 논문은 기존 GUI Agent들이 주로 시뮬레이션 환경에 최적화되어 있어 실제 현실 환경과의 괴리(Sim-to-Real gap)가 크다는 문제를 해결하기 위해 Qwen-UI-Agent를 제안한다.#Review#GUI Agents#Real-world Centric#Foundation Models#Online RL#Multi-domain#Hybrid Action Space#AutoResearch2026년 7월 30일댓글 수 로딩 중
[논문리뷰] PhiZero: A World Model Built Around Physical Language본 논문은 기존 비디오 세계 모델들이 픽셀 공간에서 직접 예측을 수행함에 따라 발생하는 물리적 일관성 부족 문제를 해결하고자 합니다. 대부분의 현존 모델들은 복잡한 세계 역학(dynamics)을 고차원적인 시각적 예측기 내부에 암시적으로 숨겨두기 때문에, 실제 물리 법칙을 충실히 반영하지 못하는 한계가 있습니다.#Review#Physical World Models#Physical Language#Reason-then-Render#Diffusion-prior Decoder#Physical AI2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Pedestrian Archetypes Extension -- More Pedestrian Models for Autonomous Vehicle Safety Testing본 연구는 기존의 보행자 행동 모델이 포착하지 못하는 복합적이고 위험한 보행자 행동 패턴을 규명하고, 이를 통해 자율주행 차량(AV)의 안전 테스트 환경을 고도화하는 것을 목표로 합니다.#Review#Autonomous Vehicle#Pedestrian Behavior#Safety Testing#Behavior Ontology#Archetypes#Dash-cam2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Multi-Head Attention Residuals본 논문은 기존 Transformer의 Attention Residuals가 가진 구조적 한계인 Forced Compromise를 해결하기 위해 제안되었습니다.#Review#Multi-Head Attention Residuals#MHAR#Depth Routing#Transformer Architecture#Forced Compromise#Fused Triton Kernels2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Metis: Memory Foundation Model본 논문은 AI 에이전트의 핵심인 메모리 기능이 기존에는 주로 Retrieval-Augmented Generation (RAG) 와 같은 외부 모듈에 의존하고 있어 발생하는 비효율성을 해결하고자 합니다 .#Review#Memory Foundation Model#Native Memory#Metis#Fast Weight Programming#Memory Attention#Autonomous Memory Procedure#Foundation Model2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory본 연구는 기존 decoder-only 모델들이 long-term memory와 reasoning 능력을 단일 파라미터 세트에 결합하고 있어, 메모리 용량을 독립적으로 확장하기 어렵다는 문제를 해결하고자 합니다.#Review#Parametric Memory#Long-Term Memory#Language Modeling#Distributed Faiss#Parameter Efficiency#Retrieval-Augmented Generation2026년 7월 30일댓글 수 로딩 중
[논문리뷰] MemHarness: Memory Is Reconstructed, Not Replayed본 논문은 기존 메모리 증강 LLM 에이전트들이 겪는 '경험의 부적합성(Applicability Gap)' 문제를 해결하고자 한다.#Review#LLM Agents#Sequential Decision-Making#Experiential Memory#Reinforcement Learning#Memory Reconstruction#GRPO#Policy Optimization2026년 7월 30일댓글 수 로딩 중
[논문리뷰] MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing본 논문은 최신 Text-to-Image 편집 모델이 다수 인물이 포함된 고난도 상호작용(포옹, 격투 등)을 생성할 때 발생하는 심각한 해부학적 오류를 지적한다.#Review#Multi-Person Interaction#Anatomically Plausible#Mesh Reconstruction#Editing Benchmark#Contact Density#HMR2026년 7월 30일댓글 수 로딩 중
[논문리뷰] LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger본 논문은 현대의 다중 모달 에이전트(Multimodal Agents)가 단순한 결과의 정확성(Final-answer accuracy)만을 평가받는 구조적 한계와, 추론 과정에서의 불투명성 문제를 해결하는 것을 목표로 합니다.#Review#Multimodal Agents#Provenance-Constrained#Structured Evidence Ledger#Trajectory Faithfulness#Grounding#Hallucination Mitigation2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions본 논문은 Deep Research 시스템이 외부 정보에 포함된 그럴듯한 거짓 정보에 얼마나 취약한지 규명하고자 한다 . 기존 연구들은 단기적인 RAG 환경에서의 신뢰성만을 주로 다루었으나, 긴 연구 흐름 속에서 거짓 정보가 어떻게 중간 단계에 흡수되고 최종 결과물에까지 반영되는지에 대한 분석은 부족했다.#Review#Deep Research#LLM Agents#Misleading Knowledge#Reliability#False Conclusion#Retrieval-Augmented Generation2026년 7월 30일댓글 수 로딩 중
[논문리뷰] INTACT: Isomorphic Intent-to-Action Learning for Search-Free World ModelsLatent world models, while capable of predicting future states given actions (forward conditional), struggle with inverse control—recovering actions for a desired change.#Review2026년 7월 30일댓글 수 로딩 중