[논문리뷰] InSight-doc: Agentic Visual Perception for Long-Document Understanding본 논문은 긴 문서(Long-document) 이해 작업에서 발생하는 과도한 추론 비용과 Context Rot 문제를 해결하고자 합니다. 기존의 MLLM 기반 접근 방식은 전체 문서를 고해상도로 입력받아 처리하는데, 이는 O(N^2) 수준의 시간 복잡도를 야기하며 매우 비효율적입니다 .#Review#Long-Document Understanding#Multimodal Large Language Models#Agentic Visual Perception#Chain-of-Thought#Reinforcement Learning#Visual Search2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence본 논문은 기존의 omni-modal 대화 모델들이 텍스트와 음성 이해에는 능숙하지만, 시각적 실체가 결여된 'visually disembodied' 상태라는 문제를 해결하기 위해 Ex-Omni-2D를 제안합니다.#Review#Omni-modal Dialogue#Visual Thought Plan#Streaming Student#Multi-codebook Speech Units#Prefix Streaming#Audio-Video Generation2026년 8월 11일댓글 수 로딩 중
[논문리뷰] DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation본 논문은 기존의 고성능 VDR 시스템이 요구하는 막대한 컴퓨팅 자원과 인덱싱 비용 문제를 해결하고자 합니다. 현재 최첨단 VDR 모델들은 수십억 개의 파라미터를 사용하며, Multi-vector 기반의 복잡한 연산으로 인해 메모리 사용량과 검색 레이턴시가 지나치게 높습니다.#Review#Visual Document Retrieval#Distillation#Single-Vector#End-to-End#Multimodal#Encoder-only2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness본 논문은 기존의 LLM 평가 방식이 Nominal 조건에서의 성능만을 측정하여 모델의 실제 운영 환경에서의 강건성을 과대평가하는 '능력의 환상(illusion of capability)'을 만든다는 문제의식에서 출발합니다.#Review#Large Language Models#Robustness#Diagnostic Stress Test#Logit Interventions#Decoding-Level Taboo#Injected Surprisal#Reasoning Resilience2026년 8월 11일댓글 수 로딩 중
[논문리뷰] DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?본 논문은 현재의 AI 에이전트가 단편적인 코드 생성 능력은 뛰어나지만, 실제 컴퓨터 환경에서 복잡한 데이터 과학 워크플로우를 End-to-End로 수행하는 데에는 명확한 한계가 있다는 점을 지적합니다.#Review#Data Science#Agentic Systems#Benchmark#End-to-End Workflow#GUI Interaction#Long-horizon Reasoning#Tool Orchestration2026년 8월 11일댓글 수 로딩 중
[논문리뷰] ComBodied Agents: a New Paradigm of Human-Centric Agentic AI본 논문은 기존의 Agentic AI가 과업 수행 효율성만을 중시하여 인간의 장기적인 역량과 자율성을 저해하는 구조적 한계를 해결하고자 합니다.#Review#Combodied Agents#Human-Centric AI#Personal World Model#Agentic AI#Human Agency#Longitudinal Memory2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design본 논문은 단일 개체 기반의 Self-Evolution이 고정된 학습 컨텍스트라는 제약에 갇혀 있는 문제를 해결하고자 합니다 . 기존 연구들은 주로 고정된 환경이나 사전에 정의된 피드백 구조 하에서 모델을 개선하는 데 치중해 왔으며, 이는 정체된 학습 환경으로 인해 진화의 속도가 둔화되는 한계를 가집니다.#Review#Agentic Systems#Co-Evolution#Self-Evolution#Open-Endedness#Multi-Agent Reinforcement Learning#Evolutionary Optimization2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Beyond Pixels: From Video Priors to 4D Worlds본 논문은 기존의 4D 생성 방식이 가진 RGB 인터페이스의 한계를 극복하고, 비디오 생성 모델의 사전 지식(video priors)을 보다 효율적으로 4D 생성에 전이하는 방법을 탐구합니다.#Review#4D Generation#Video Diffusion Models#Latent Space#L4AR#Spatiotemporal Attention#3D Reconstruction#DiT2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Articulated Object Reconstruction from Rest-State Observation본 논문은 움직임 정보가 부재한 닫힌 상태의 관측으로부터 다중 파트 articulated 객체를 정확하게 재구성하는 Rest2Art 프레임워크를 제안합니다 . 기존 연구들은 주로 여러 관절 상태를 직접 관측하거나 사전 학습된 데이터에 의존하는 등, 정적인 단일 관측 환경에서는 정확도가 떨어지는 한계가 있습니다 .#Review#Articulated Object#Rest-State Reconstruction#Mesh Segmentation#Video Diffusion Model#Digital Twin#Joint Parameter Estimation2026년 8월 11일댓글 수 로딩 중
[논문리뷰] AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss본 논문은 생성 모델의 사후 학습(Post-training) 과정에서 발생하는 Fréchet hacking 문제를 해결하는 것을 목표로 합니다.#Review#Generative Models#Fréchet Distance#Adversarial Learning#Distribution Matching#Objective Hacking#Feature Whitening2026년 8월 11일댓글 수 로딩 중
[논문리뷰] 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents본 논문은 기존의 실외 탐색 벤치마크들이 갖는 photorealism 부족 및 복잡성 결여 문제를 해결하고, 실제 도시 환경과 유사한 환경에서 에이전트의 탐색 및 추론 능력을 평가하기 위해 제안되었습니다.#Review#Embodied AI#Urban Navigation#Benchmark#Photorealistic Virtual Environments#LMM#Spatial Reasoning2026년 8월 11일댓글 수 로딩 중
[논문리뷰] What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems본 연구는 대화형 AI 시스템에서 이미지 생성 과제의 후속 편집 제안이 기존의 텍스트 기반 시스템을 넘어 시각적 맥락(Visual Context)을 이해해야 한다는 점을 다룬다.#Review#Multimodal Recommendation#Image Editing#Visual Grounding#Preference Learning#Reinforcement Learning#Industrial Applications2026년 8월 10일댓글 수 로딩 중
[논문리뷰] WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks본 논문은 에이전트가 단일 환경을 벗어나 Personal Workspace를 기반으로 다자간 협업을 수행할 때 발생하는 보안 및 거버넌스 문제를 해결하고자 합니다.#Review#Agent Network#Personal Workspace#Tool-Use Collaboration#Security Audit#Benchmark#Human-Centered AI2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Vision-Language Grounding as Bidirectional Concept Correspondence기존의 Vision-Language Grounding 연구는 주로 주어진 텍스트 구문이나 카테고리 이름을 이미지 내 특정 영역에 국한하여 매핑하는 일방향성 localization 문제로 접근해 왔습니다 .#Review#Vision-Language Grounding#Bidirectional Concept Correspondence#Bridge Tokens#Instance-level Segmentation#Multimodal Learning2026년 8월 10일댓글 수 로딩 중
[논문리뷰] The Loss Does Not See the Basis, but Adam Does본 논문은 Factored Model에서 Gradient Descent가 보여주는 저차원(low-rank) 학습 유도 편향(Implicit bias)이 왜 Adam과 같은 적응형 최적화 기법에서는 발현되지 않는지를 규명한다.#Review#Gauge Equivariance#Implicit Bias#Adam#Low-rank Recovery#Matrix Factorization#Optimizer Zoo#Symmetry2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Stealing Reasoning Traces from Proprietary LLM APIs본 연구는 API 제공자들이 지적 재산 보호를 위해 CoT 추론 과정을 암호화하여 클라이언트 측에 저장하도록 하는 아키텍처의 구조적 취약점을 제기한다. 기존의 stateless 설계는 암호화된 블록이 세션, 사용자, 심지어 모델 간에 완벽하게 호환되고 상호 교환될 수 있다는 치명적인 보안 결함을 가진다.#Review#Chain-of-Thought#API Security#Model Distillation#Encrypted Reasoning#Prompt Injection#Privacy Leakage2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains본 논문은 현재의 비디오 생성 모델들이 시각적 사실성(visual realism)은 향상되었으나, 과학적 메커니즘이나 인과적 법칙을 정확히 반영하는지 검증하기 어렵다는 문제점을 제기한다.#Review#Video Generation#Scientific Reasoning#Benchmark#Evaluation Protocol#Mechanistic Fidelity#MLLM-as-Judge2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Scaling Inherently Interpretable Language Models본 논문은 현대의 고성능 AI 시스템이 가진 극도의 불투명성(opacity)을 해결하기 위해, 해석 가능성을 훈련 과정의 핵심 제약 조건으로 통합하는 새로운 패러다임을 제안합니다.#Review#Inherent Interpretability#Diffusion Language Models#Concept Bottleneck#Atlas#Scaling Laws2026년 8월 10일댓글 수 로딩 중
[논문리뷰] SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring본 논문은 기존 소프트웨어 엔지니어링 벤치마크가 포화 상태에 도달하고, 다수의 불완전한 테스트 케이스와 데이터 오염 문제로 인해 실제 모델의 능력을 변별하기 어려워짐에 따라 SWE-Bench ProMax를 제안한다.#Review#Code Refactoring#AI Agents#Software Engineering#Multilingual Benchmark#Long-horizon Evaluation#Agentic Workflow2026년 8월 10일댓글 수 로딩 중
[논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation본 논문은 기존 OPD가 교사 모델의 불확실한 토큰에 대해 Reverse-KL 손실 함수를 사용함으로써, 교사가 제시하는 다양한 합리적 대안들을 충분히 포괄하지 못하는 문제(mode-seeking behavior)를 해결하고자 합니다.#Review#On-Policy Distillation#Language Model#Uncertainty-Aware#Sparse Probing#Outcome Calibration#Reasoning Benchmarks#Knowledge Distillation2026년 8월 10일댓글 수 로딩 중