[논문리뷰] RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing ModelsReal-world Degradation 상황에서의 Image Restoration은 자율 주행(Autonomous Driving) 및 객체 탐지(Object Detection)와 같은 Downstream Task에 필수적이다.#Review#Image Restoration#Real-World Degradation#Large-Scale Image Editing Models#Diffusion Models#Data Generation#RealIR-Bench#Zero-shot Generalization#Transfer Learning2026년 3월 26일댓글 수 로딩 중
[논문리뷰] PixelSmile: Toward Fine-Grained Facial Expression Editing최근 diffusion-based 이미지 편집 모델의 발전에도 불구하고, 미세한(fine-grained) 얼굴 표정 편집은 여전히 어려운 문제로 남아 있다.#Review2026년 3월 26일댓글 수 로딩 중
[논문리뷰] MuRF: Unlocking the Multi-Scale Potential of Vision Foundation Models최근 VFM은 다양한 task에서 강력한 representation을 제공하며 컴퓨터 비전 분야의 핵심으로 자리 잡았습니다.#Review#Vision Foundation Models (VFMs)#Multi-Resolution Fusion (MuRF)#Dense Prediction#Anomaly Detection#Multimodal Understanding#Scale-Robust Representation2026년 3월 26일댓글 수 로딩 중
[논문리뷰] MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-EvolutionLarge Language Models (LLMs) 기반의 Agent들이 장기적인 상호작용을 지원하기 위해 외부 메모리 뱅크를 활용하지만, 대부분의 기존 시스템은 메모리 Construction , Retrieval , Utilization 단계를 개별적인 서브루틴으로 분리하여 처리하는 한계를 가집니다.#Review#LLM Agents#Memory Cycle#Multi-Agent Reasoning#Self-Evolution#Long-Horizon Memory#Strategic Blindness#Memory Management2026년 3월 26일댓글 수 로딩 중
[논문리뷰] MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M TokensLarge Language Models (LLMs)는 다양한 분야에서 뛰어난 능력을 보였지만, 수백만 토큰 규모의 장기적이고 세밀한 기억(long-term, fine-grained memory retention)을 처리하는 데에는 여전히 큰 어려움에 직면해 있습니다.#Review#Memory Sparse Attention#Long-Context LLMs#Efficient Memory#End-to-End Trainable#KV Cache Compression#Rotary Positional Embedding#Multi-hop Reasoning#Scalability2026년 3월 26일댓글 수 로딩 중
[논문리뷰] MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context DataMulti-reference image generation은 multi-subject composition, narrative illustration, novel view synthesis와 같은 실제 애플리케이션에 필수적이지만, 현재 모델들은 input reference의 수가 증가함에 따라 심각한 성능 저하를 겪고 있다.#Review2026년 3월 26일댓글 수 로딩 중
[논문리뷰] Less Gaussians, Texture More: 4K Feed-Forward Textured Splatting기존의 feed-forward 3D Gaussian Splatting (3DGS) 방법론들은 pixel-aligned primitive를 예측하므로, 해상도가 증가함에 따라 primitive의 수가 quadratic하게 증가하여 4K와 같은 고해상도(high-resolution) novel view synthesis를 실질적으로 불가능하게 만듭니다.#Review#3D Gaussian Splatting#Novel View Synthesis#Feed-Forward#High-Resolution Rendering#Textured Primitives#Geometry-Appearance Decoupling#4K2026년 3월 26일댓글 수 로딩 중
[논문리뷰] Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion ScaleLarge Language Models (LLMs)와 Visual Language Models (VLMs)의 등장은 인공지능 분야에 혁신을 가져왔지만, 과학 분야(AI for Science, AI4S)에서 효과적인 foundation model을 구축하는 것은 과학 domain의 immense diversity와 specialization으로 인해 큰 도전을 제시합니다.#Review2026년 3월 26일댓글 수 로딩 중
[논문리뷰] IQuest-Coder-V1 Technical Report기존 Large Language Models (LLMs)는 도메인 특화를 통해 일반적인 지능을 크게 향상시켰지만, 코드 지능 분야에서는 Claude 4.5 Sonnet 과 같은 독점적인 선두 모델들과 오픈-웨이트 모델들 사이에 여전히 큰 격차가 존재한다.#Review2026년 3월 26일댓글 수 로딩 중
[논문리뷰] FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol최근 Large Language Models (LLMs)는 금융 애플리케이션에서 agent 로서 사용자 요청을 해석하고, 외부 도구를 호출하며, 다단계 추론을 수행해야 하는 역할을 점점 더 많이 맡고 있습니다.#Review#LLM Agents#Financial Tool Use#Benchmarking#Model Context Protocol#Multi-tool Reasoning#Multi-turn Conversation#Evaluation Metrics2026년 3월 26일댓글 수 로딩 중
[논문리뷰] Extending Precipitation Nowcasting Horizons via Spectral Fusion of Radar Observations and Foundation Model Priors기존 Radar-only 모델은 대규모 대기 Context 부족으로 인해 예측 Lead Time이 길어질수록 성능 저하를 겪는다 [cite: 1, Figure 1].#Review#Precipitation Nowcasting#Spectral Fusion#Radar Observations#Foundation Model#Pangu-Weather#Frequency Domain#Deep Learning2026년 3월 26일댓글 수 로딩 중
[논문리뷰] Electrostatic Photoluminescence Tuning in All-Solid-State Perovskite Transistors재료의 optoelectronic properties를 'electric knob'으로 가역적으로 tuning하는 것은 잠재적 응용 분야를 크게 확장할 수 있는 중요한 목표이지만, photoluminescence (PL)나 photoconductivity (PC)와 같은 광전 특성을 electrostatically 제어하는 연구는 상대적으로 미개척 상태입니다.#Review#Perovskite#Photoluminescence#Field-Effect Transistor#Electrostatic Tuning#CsPbBr3#Carrier Recombination#Quantum Efficiency2026년 3월 26일댓글 수 로딩 중
[논문리뷰] Calibri: Enhancing Diffusion Transformers via Parameter-Efficient CalibrationThe paper 'Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration' by Danil Tokhchukov, Aysel Mirzoeva, Andrey Kuznetsov, and Konstantin Sobolev from MSU and FusionBrain Lab, AXXX, discusses a new method called…#Review2026년 3월 26일댓글 수 로딩 중
[논문리뷰] BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic AlignmentUnderstanding animal species through multimodal data (visual, textual, acoustic) is a growing challenge at the intersection of computer vision and ecology.#Review2026년 3월 26일댓글 수 로딩 중
[논문리뷰] AVControl: Efficient Framework for Training Audio-Visual Controls비디오 및 오디오 생성 과정의 정교한 제어는 실제 창의적인 애플리케이션에 필수적이다. 그러나 depth, pose, camera trajectories, audio transformations 등 다양한 modalities에 걸친 control의 범위는 매우 광대하다.#Review#Audio-Visual Generation#Video Control#LoRA#Parallel Canvas Conditioning#Diffusion Models#Modularity#Efficiency2026년 3월 26일댓글 수 로딩 중
[논문리뷰] When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning최근 멀티모달 대규모 언어 모델(MLLMs)은 추론 작업에서 강력한 성능을 보여주었지만, 이러한 발전은 주로 고품질의 주석 처리된 데이터나 교사 모델(teacher-model) 증류(distillation)에 의존하고 있어 비용이 많이 들고 확장이 어렵습니다.#Review#Unsupervised Self-Evolution#Multimodal Reasoning#Consistency-Based Reward#Judge Modulation#Group Relative Policy Optimization (GRPO)#Policy Updates#Mathematical Reasoning#Large Language Models2026년 3월 25일댓글 수 로딩 중
[논문리뷰] Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning기존의 Multimodal Large Language Models (MLLMs)는 2D 시각 신호에 과도하게 고정되어 3D 환경에 대한 구조화된 추상화를 구축하지 못함으로써 3D 공간 추론(spatial reasoning)에서 어려움을 겪습니다.#Review#Multimodal Large Language Models (MLLMs)#Spatial Reasoning#Textual Representation#Allocentric Context#Egocentric Video#Prompting Methods#VSI-Bench#OST-Bench2026년 3월 25일댓글 수 로딩 중
[논문리뷰] UI-Voyager: A Self-Evolving GUI Agent Learning via Failed ExperienceMultimodal Large Language Models (MLLMs)의 발전과 함께 자율 모바일 GUI Agent에 대한 관심이 증가하고 있지만, 기존 방법론들은 비효율적인 실패 궤적(failed trajectory) 학습과 장기(long-horizon) GUI 태스크에서 희소한 보상(sparse rewards)에 따른 모호한 Credit Assignment 문제에 직면하고 있습니다.#Review#GUI Agent#Self-Evolving Learning#Rejection Fine-Tuning (RFT)#Group Relative Self-Distillation (GRSD)#Credit Assignment#Sparse Rewards#Mobile Automation#Multimodal Large Language Models (MLLMs)2026년 3월 25일댓글 수 로딩 중
[논문리뷰] Toward Physically Consistent Driving Video World Models under Challenging Trajectories자율 주행 시뮬레이션에서 비디오 월드 모델(Video World Models)은 실세계 데이터 수집의 비싼 비용과 고품질 물리 시뮬레이터의 대안으로 중요성이 커지고 있습니다. 기존 주행 월드 모델들은 일반적으로 실제 주행 데이터셋, 주로 안전하고 일반적인 시나리오에 훈련되어 있습니다.#Review#Driving World Models#Physical Consistency#Video Generation#Challenging Trajectories#Autonomous Driving#Heterogeneous Dataset2026년 3월 25일댓글 수 로딩 중
[논문리뷰] T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search기존 LLM red-teaming 연구는 주로 모델에서 유해한 텍스트 출력(harmful text outputs)을 유도하는 데 초점을 맞추었으나, 이는 Model Context Protocol (MCP)과 같은 통합 표준을 통해 다단계 도구 실행(multi-step tool execution)이 가능한 LLM Agents의 새로운 안전 위험을 간과하고 있습니다.#Review#LLM Agents#Red-Teaming#Vulnerability Discovery#Trajectory-aware Search#MAP-Elites#Tool Call Graph#Attack Realization Rate2026년 3월 25일댓글 수 로딩 중