[논문리뷰] From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing기존의 Diffusion-based 이미지 편집 모델들은 '모자를 추가하라'와 같은 명확하고 구체적인 작업에는 우수한 성능을 보이지만, '광고를 채식주의자 친화적으로 바꾸라'와 같은 추상적이고 다단계의 장기적인(long-horizon) 지시사항을 처리하는 데에는 한계가 있습니다.#Review#Long-horizon#Image Editing#Planner-Orchestrator#Experiential Learning#Reward-driven#Multimodal LLM#Diffusion Models2026년 5월 17일댓글 수 로딩 중
[논문리뷰] Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization본 논문은 Video Diffusion Model의 효율적인 정렬(Alignment)을 위한 단일 단계(Single-step) 훈련 프레임워크인 Flash-GRPO를 제안합니다 .#Review#Video Diffusion Models#Group Relative Policy Optimization#Reinforcement Learning#Single-step Training#Iso-temporal Grouping#Temporal Gradient Rectification#Alignment2026년 5월 17일댓글 수 로딩 중
[논문리뷰] FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization본 논문은 실시간 인터랙티브 가먼트 교체와 비디오 생성을 동시에 달성하기 어려운 기존의 한계를 해결하고자 합니다. 기존의 subject-to-video(S2V) 방식은 주로 identity 보존에만 집중하고 있어, 패션 산업이나 콘텐츠 생성에서 요구되는 실시간이고 유연한 가먼트 제어 능력이 부족합니다.#Review#Video Customization#Garment Switching#Autoregressive Generation#In-Context Learning#Streaming Distillation#KV Cache Rescheduling#Real-Time Inference2026년 5월 17일댓글 수 로딩 중
[논문리뷰] FFAvatar: Few-Shot, Feed-Forward, and Generalizable Avatar Reconstruction본 논문은 기존 3D avatar 재구성 기법들이 요구하는 과도한 연산 시간과 복잡한 사전 처리의 한계를 극복하기 위해 FFAvatar를 제안한다.#Review#3D Gaussian Splatting#Feed-Forward#Few-Shot#Avatar Reconstruction#FLAME#Multi-View#Generalization2026년 5월 17일댓글 수 로딩 중
[논문리뷰] Efficient Image Synthesis with Sphere Latent Encoder본 연구는 기존 few-step 생성 모델들이 겪는 비효율성과 훈련 불안정성 문제를 해결하고자 합니다.#Review#Few-step Image Generation#Spherical Latent Space#Representation Autoencoder#Denoising Model#Latent Space Sampling2026년 5월 17일댓글 수 로딩 중
[논문리뷰] Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding본 논문은 대규모 Long-CoT 모델의 높은 추론 비용을 해결하기 위한 효율적인 reasoning distillation 프레임워크를 제안합니다.#Review#Reasoning Distillation#Collaborative Decoding#Long-CoT#Predictive Perplexity#Multi-Teacher#Beam Search#Step-wise Synthesis2026년 5월 17일댓글 수 로딩 중
[논문리뷰] DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules본 연구는 산업 설비의 고장 감지 이후, 엔지니어가 수행해야 할 구체적인 정비 단계(maintenance steps)를 추천하는 데 있어 LLM의 역량을 체계적으로 진단하고자 한다.#Review#DiagnosticIQ#Industrial Maintenance#LLM Benchmark#Symbolic Rules#MCQA#Fault Detection#Action Recommendation2026년 5월 17일댓글 수 로딩 중
[논문리뷰] DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo본 논문은 기존의 로봇 조작 벤치마크가 단순한 그리퍼 중심의 환경에 치중되어 있어, 진정한 의미의 인간 수준(Human-level) 조작 능력을 평가하는 데 한계가 있다는 문제 의식에서 출발합니다.#Review#Dexterous Manipulation#Robotics Benchmark#Teleoperation#Imitation Learning#Vision-Language-Action Models#MuJoCo#Domain Randomization2026년 5월 17일댓글 수 로딩 중
[논문리뷰] CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence본 논문은 현대 MLLM의 Doc-VQA 평가 방식이 최종 답변의 정답 여부에만 지나치게 의존하여, 실제 추론의 근거가 되는 시각적 증거의 정확성을 검증하지 못한다는 문제를 지적합니다.#Review#Multimodal Large Language Models#Document Visual Question Answering#Evidence Attribution#Trustworthy AI#Strict Attributed Accuracy#Attribution Hallucination2026년 5월 17일댓글 수 로딩 중
[논문리뷰] ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing본 논문은 기존의 RSCD 연구들이 주로 픽셀 단위의 결정론적 분류(discriminative classification)에 의존하고 있어, 지역적 일관성 부족과 모호성 처리에 한계가 있다는 점을 지적합니다.#Review#Remote Sensing Change Detection#Rectified Flow#Generative Models#Latent Space#Diffusion Transformer#Coherence#Confidence Estimation2026년 5월 17일댓글 수 로딩 중
[논문리뷰] CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage본 논문은 기존 3D 자산 데이터셋들이 파노라마 모델 학습을 위한 효과적인 '관측 레이어(Observation layer)'를 정의하지 못하고 있다는 문제점을 지적합니다.#Review#Panoramic#RGB-D-Pose#Viewpoint Curation#Submodular Maximization#Scene Coverage#Dataset2026년 5월 17일댓글 수 로딩 중
[논문리뷰] Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design본 연구는 Recursive Self-Improvement의 일환으로 LLM 에이전트가 기존 Transformer 패러다임을 넘어선 차세대 foundation model을 자율적으로 설계할 수 있는지 탐구합니다.#Review#Neural Architecture Search#Foundation Models#LLM Agents#Recursive Self-Improvement#Hybrid Architectures#AIRS-Bench2026년 5월 17일댓글 수 로딩 중
[논문리뷰] WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation본 연구는 기존 에이전트 벤치마크가 현실적인 배포 환경을 제대로 반영하지 못하는 한계를 해결하기 위해 수행되었다.#Review#Agent Evaluation#Long-Horizon#Native-Runtime#Multimodal#Reproducible#Hybrid Verification2026년 5월 14일댓글 수 로딩 중
[논문리뷰] Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video본 논문은 대규모 카메라 주석 데이터셋이나 복잡한 아키텍처 수정 없이, 사전 학습된 비디오 생성 모델의 잠재적 카메라 제어 능력을 활용하는 효율적인 방법을 제안합니다.#Review#Video Generation#Camera Control#History Conditioning#LoRA#Zero-shot Learning2026년 5월 14일댓글 수 로딩 중
[논문리뷰] ViMU: Benchmarking Video Metaphorical Understanding본 논문은 현대의 영상 이해 모델들이 표면적인 시각 정보(객체 인식, 행동 분류 등) 인식에는 뛰어나지만, 영상에 내재된 은유적이고 사회적인 의미를 파악하는 능력은 현저히 부족하다는 문제 의식에서 출발한다 .#Review#Video Understanding#Metaphorical Understanding#Subtext Interpretation#Multimodal Benchmark#Rhetorical Mechanisms#Social Value Signals2026년 5월 14일댓글 수 로딩 중
[논문리뷰] VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction본 논문은 기존의 3D 장면 편집 모델들이 직면한 다중 뷰 불일치 및 연산 효율성 문제를 해결하고자 합니다. 대부분의 기존 연구들은 2D 이미지를 개별적으로 편집한 후 이를 3D로 다시 쌓는 '2D-lifting' 방식을 채택하고 있어, 뷰 간의 기하학적 일관성이 깨지거나 텍스처가 흐릿해지는 한계가 존재합니다.#Review#3D Scene Editing#Feed-forward#Residual Field Prediction#Text-conditioned Editing#Multi-view Consistency#DeltaScene Dataset2026년 5월 14일댓글 수 로딩 중
[논문리뷰] Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning본 논문은 현재 T2I(Text-to-Image) 모델이 의존하는 single-step generation 패러다임의 한계를 극복하고자 합니다.#Review#Text-to-Image Generation#Chain-of-Thought#Reinforcement Learning#Diffusion Models#Test-time Scaling#Model Alignment#Efficient Inference2026년 5월 14일댓글 수 로딩 중
[논문리뷰] Topology-Preserving Neural Operator Learning via Hodge Decomposition본 연구는 Riemannian manifolds에서 physical field equations의 solution operators를 resolution-independent하고 structure-preserving 방식으로 학습하는 핵심 문제를 다룬다.#Review#Neural Operator#Hodge Decomposition#Differential Forms#Riemannian Manifolds#Spectral Methods#Topological Deep Learning#Discrete Exterior Calculus2026년 5월 14일댓글 수 로딩 중
[논문리뷰] Self-Distilled Agentic Reinforcement Learning본 연구는 다중 턴 에이전트 환경에서 기존 OPSD가 겪는 불안정성과 성능 저하 문제를 해결하고자 합니다. 기존 방식은 에이전트가 교사 지원 궤적에서 벗어날 때 토큰 단위의 지도가 신뢰성을 잃고, 교사의 privileged context에 대한 의존이 비대칭적인 결과를 초래하여 학습을 방해한다는 점을 지적합니다 .#Review#Agentic Reinforcement Learning#On-Policy Self-Distillation#Token-Level Gating#Privileged Guidance#Multi-turn Agents#GRPO2026년 5월 14일댓글 수 로딩 중
[논문리뷰] Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image본 논문은 단일 위성 이미지만으로 고품질의 3D 스트리트 뷰 장면을 생성하는 데 따르는 기하학적 정밀도 문제를 해결하는 것을 목표로 합니다.#Review#3D Scene Generation#Satellite Imagery#Feed-Forward#NeRF#Geometric Constraint#Street-Level Rendering2026년 5월 14일댓글 수 로딩 중