[논문리뷰] Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent본 논문은 현재의 Multimodal Agent들이 비디오 기반의 심층 연구(Video-DR) 환경에서 직면한 두 가지 핵심 문제를 해결하고자 한다. 첫째, 에이전트들이 시각적 도구 사용을 회피하고 텍스트 검색에 의존하는 Modality Bias가 심각하다는 점이다 .#Review#Video-DeepResearch#Multimodal Agent#Spatiotemporal Grounding#GRPO#Modality Bias#Parametric Knowledge Leakage#Tool-augmented Execution2026년 8월 4일댓글 수 로딩 중
[논문리뷰] UniWorld-Design: From Pixel Generation to Layer-Native Design본 논문은 기존의 이미지 생성 모델이 픽셀 수준의 단일 평면(Flat RGB canvas)으로 결과를 출력하여, 이후의 창의적인 편집과 재구성이 어렵다는 근본적인 문제를 해결하고자 한다.#Review#Layer-Native Design#RGBA Generation#Image-to-Layer#Semantic Decomposition#Instruction-Addressable#Flow Matching#DiffusionNFT2026년 8월 4일댓글 수 로딩 중
[논문리뷰] TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning본 논문은 Tool-Integrated Reasoning(TIR) 환경에서 발생하는 불명확한 temporal credit-assignment 문제를 해결하기 위해 TurnSight를 제안합니다.#Review#Tool-Integrated Reasoning#Reinforcement Learning#Self-Distillation#Hindsight Credit Assignment#Multi-turn Interaction#Agentic RL2026년 8월 4일댓글 수 로딩 중
[논문리뷰] SkillJack: Persistent Skill Backdoors in Self-Evolving Agents본 연구는 자가 진화형 에이전트가 경험을 Skill로 변환하는 과정에서 발생하는 새로운 보안 위협을 다룬다.#Review#Self-evolving Agents#Skill Extraction#Backdoor Attack#Experience Poisoning#LLM Security#Transformation-Resilient Payload#Persistence Isolation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts본 논문은 기존의 WAMs가 픽셀 기반의 미래 예측 방식에 과도하게 의존하여 시각적 분포 변화(Visual Distribution Shifts) 환경에서 취약하다는 점을 해결하고자 합니다 .#Review#World Action Models#Robotic Manipulation#Visual Distribution Shifts#DINOv3#Flow Matching#Robustness#Semantic-Temporal2026년 8월 4일댓글 수 로딩 중
[논문리뷰] RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction본 논문은 query-agnostic KV 캐시 압축 환경에서 발생하는 성능 급락 문제를 해결하고자 합니다. 기존 연구들은 주로 중요한 KV 쌍을 선별(Selection)하는 데 집중했으나, 압축률이 높아질수록 선별된 정보만으로는 모델 성능을 유지하기 어렵습니다.#Review#KV Cache Eviction#Query-Agnostic#LoRA#Self-Distillation#Long-Context LLM#Context Reconstruction2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Quo Vadis, World Modeling?본 논문은 기존의 World Model이 단순히 미래의 물리적 상태를 예측하는 데 머물러 있어, 자율적으로 성장하고 지속적으로 개선되어야 하는 현대 Agent의 요구를 충분히 충족하지 못한다는 문제를 제기한다.#Review#World Models#World Proxies#Agent-Centric#Information Transition#Continual Improvement#Inference-Time Guidance#Training-Time Optimization#Co-Evolution2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories본 논문은 점성이 높은 Viscous Stains를 제거하는 과정에서 발생하는 2차 오염 문제를 해결하기 위해 제안되었습니다. 기존의 닦기(Wiping) 방식은 오염물을 넓게 퍼뜨리는 경향이 있고, 문지르기(Scrubbing)는 표면 손상 위험이 커 정밀한 제어가 필요하다는 한계가 있습니다.#Review#Robotic Cleaning#Diffusion Policy#Viscous Stains#Trajectory Planning#Hybrid Force-Position Control#Zero-shot Generalization2026년 8월 4일댓글 수 로딩 중
[논문리뷰] PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs본 논문은 기존 자동화 포스터 생성 시스템들이 가진 출력물의 인쇄 적합성(print-readiness) 부족과 원본 편집 불가능(non-editable) 문제를 해결하기 위해 PosterMELD를 제안한다.#Review#Scientific Poster Generation#Multi-Agent System#Print-Ready Rate#Editable Output#Template-Conditioned#Controllable Design Diversity2026년 8월 4일댓글 수 로딩 중
[논문리뷰] PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning본 논문은 LLM agent의 다회차 상호작용 환경에서 발생하는 보상 희소성(reward sparsity)과 teacher guidance의 신뢰성 저하 문제를 해결하고자 합니다.#Review#Agentic Reinforcement Learning#On-Policy Self-Distillation#Teacher Reliability#Persistent Consistency#Adaptive Aggregation#Token-level Weighting#Multi-turn Interaction2026년 8월 4일댓글 수 로딩 중
[논문리뷰] PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents본 연구는 개인용 AI 에이전트의 발전 과정에서 나타나는 Online Self-Evolution 능력을 체계적으로 평가하고, 실제 개선이 일어나는지 검증하는 것을 목표로 합니다 .#Review#Recursive Self-Improvement#Personal Agents#Performance-Attribution#Online Self-Evolution#Benchmark#Persistence Mechanisms#Agent Framework2026년 8월 4일댓글 수 로딩 중
[논문리뷰] OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models본 연구는 Omni-LLMs가 장문의 오디오-비주얼 입력 시 발생하는 방대한 계산 및 메모리 오버헤드 문제를 해결하고자 합니다.#Review#Omni-modal Large Language Models#Token Compression#Efficient Inference#Multimodal Understanding#Training-free Framework#Audio-visual Collaboration2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Multi-Task Multi-Frame Visual Piano Transcription본 논문은 오디오 기반 AMT가 서스테인 페달로 인해 발생하는 물리적 건반 상태와 실제 소리 종료 시점 간의 괴리 문제를 해결하고자 하는 시도에서 출발합니다. 기존의 오디오 시스템은 페달로 인해 연주 종료가 지연되어 실제 물리적 키 릴리즈를 반영하지 못하는 한계가 있습니다.#Review#Visual Piano Transcription#Multi-task Learning#Conformer#MIDI Transcription#Computer Vision#Key Mechanics2026년 8월 4일댓글 수 로딩 중
[논문리뷰] MiniWorld: Democratizing the Training of Video World Models from Scratch본 논문은 대규모 컴퓨팅 자원 없이도 스트리밍 비디오 월드 모델을 학습할 수 있는 투명하고 재현 가능한 베이스라인을 제공하는 것을 목표로 합니다.#Review#Video World Models#Streaming Inference#Diffusion Transformer#Flow Matching#Block-Causal Attention#Autoregressive Generation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations본 논문은 기존의 LLM Agent 벤치마크들이 단기적인 작업 완수나 즉각적인 피드백 기반의 태스크에 편향되어 있다는 문제를 해결하고자 한다. 실제 환경에서는 상점 운영과 같이 장기적인 전략 수립이 필요하며, 과거의 의사결정이 미래의 선택을 제약하고 피드백이 불균일하게 발생하는 복합적인 상황이 빈번하다.#Review#LLM Agents#Long-Term Coherence#E-Commerce#Order-Level Simulation#Partially Observable Markov Decision Process#Benchmark2026년 8월 4일댓글 수 로딩 중
[논문리뷰] LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models본 논문은 대규모 MoE 기반 dLLM의 최적 Scaling 행동과 아키텍처 설계 원칙이 기존 AR 모델과는 다르다는 점을 지적하며, 이를 체계적으로 정립하고자 합니다.#Review#Diffusion Language Models#Mixture-of-Experts#Scaling Laws#Compute-Optimal#LLaDA#Sparse Activation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation본 논문은 산업계 추천 시스템에서 발생하는 Data Distribution Drift 환경 하의 사전 학습-전이(pretrain-then-transfer) 패러다임이 가진 근본적인 한계를 해결하고자 합니다.#Review#Streaming Recommendation#Pretrained Transfer#Knowledge–Geometry Decoupling#Behavioral Multi-Token Prediction#Anchored Calibration Residual2026년 8월 4일댓글 수 로딩 중
[논문리뷰] JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion본 논문은 실시간 스트리밍 환경에서 높은 품질과 시간적 일관성을 유지하며 비디오를 편집하는 핵심 문제를 해결하고자 합니다.#Review#Autoregressive Diffusion#Real-Time Video Editing#Streaming Inference#Source-Anchored Distribution Matching Distillation#Long-Horizon Autoregressive Distillation#Causal Generation#Video-to-Video2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and EditingUnified 3D modeling은 scarce multimodal data, 특히 large-scale이고 geometrically consistent한 editing data의 부족으로 인해 여전히 제한적이다.#Review#Unified Multimodal Model#3D Generation#3D Understanding#3D Editing#Part Generation#Diffusion Models#Vision-Language Model#Large-scale Data2026년 8월 4일댓글 수 로딩 중
[논문리뷰] GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience본 논문은 웨어러블 비디오 어시스턴트가 reactive 질문 응답과 proactive 서비스를 동시에 수행하기 위해 필요한 장기 기억 관리의 한계를 해결하고자 한다.#Review#Streaming Video#Long-term Memory#Temporal Stratification#Proactive Assistance#Agentic Retrieval#Multimodal Lifelong Understanding2026년 8월 4일댓글 수 로딩 중