[논문리뷰] ComboStoc: Combinatorial Stochasticity for Diffusion Generative Models본 논문은 기존 Diffusion 모델이 고차원 데이터의 조합적 구조를 충분히 반영하지 못해 학습 효율과 생성 성능이 제한되는 문제를 해결하고자 한다.#Review#Diffusion Generative Models#Combinatorial Stochasticity#Structured Data#Asynchronous Inference#Graded Control2026년 5월 4일댓글 수 로딩 중
[논문리뷰] AcademiClaw: When Students Set Challenges for AI Agents기존 OpenClaw 생태계의 벤치마크들은 주로 보조 수준(assistant-level)의 단순 업무 평가에 치중되어 있어, 실제 학술 및 전문 분야의 고난도 업무 수행 능력을 평가하는 데 한계가 있습니다 . 이러한 좁은 평가 범위는 OpenClaw 에이전트의 실제 역량에 대한 편향된 인식을 야기합니다.#Review#Agent Benchmarking#OpenClaw#Academic-level Tasks#GPU-intensive#Multi-dimensional Evaluation#Behavioral Phenotypes#Autonomous Agents2026년 5월 4일댓글 수 로딩 중
[논문리뷰] Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction본 논문은 대규모 웹 정보 탐색에서 깊이 있는 추론과 넓은 범위의 구조화된 데이터 집계라는 두 가지 상충하는 요구를 동시에 만족해야 하는 문제를 해결하고자 합니다.#Review#Web-to-Table Search#Multi-Agent Framework#Bi-Level Architecture#External Memory#Self-Evolving Agents#Task Decomposition2026년 5월 3일댓글 수 로딩 중
[논문리뷰] UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors기존의 비디오 생성 연구들은 각 문제 설정(예: Text-to-Video, Inverse Rendering)에 대해 개별적인 모델을 학습시키는 파편화된 방식을 취하고 있어, 고정된 입력-출력 매핑에 제한되고 모달리티 간의 상호 상관관계를 활용하지 못하는 한계가 있습니다.#Review#Video Diffusion Models#Multimodal Video Generation#Intrinsic Decomposition#Diffusion Priors#Stochastic Condition Masking#Decoupled Gated LoRA#Cross-Modal Self-Attention2026년 5월 3일댓글 수 로딩 중
[논문리뷰] Trees to Flows and Back: Unifying Decision Trees and Diffusion Models본 연구는 고전적인 데이터 분석 모델인 결정 트리와 현대의 생성 모델인 diffusion model이 각각 수행하는 계층적 정보 정제 과정 사이의 근본적인 수학적 연결고리를 규명하고자 합니다.#Review#Decision Trees#Diffusion Models#Global Trajectory Score Matching (GTSM)#Probability Flow ODE#Tabular Data#Knowledge Distillation#Flow Matching2026년 5월 3일댓글 수 로딩 중
[논문리뷰] Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling본 논문은 기존의 dual-branch diffusion transformer 구조가 갖는 talking head 생성에서의 한계를 해결하고자 한다.#Review#Talking head generation#Joint audio-video generation#Autoregressive modeling#Diffusion transformer#Multimodal generation2026년 5월 3일댓글 수 로딩 중
[논문리뷰] Online Self-Calibration Against Hallucination in Vision-Language Models본 논문은 기존의 offline 선호도 정렬 방식이 LVLM의 hallucination 문제를 해결하는 데 오히려 역효과를 낼 수 있다는 Supervision-Perception Mismatch 문제를 제기한다.#Review#Vision-Language Models#Hallucination#Monte Carlo Tree Search#Preference Alignment#DPO#Generative-Discriminative Gap#Online Learning2026년 5월 3일댓글 수 로딩 중
[논문리뷰] Map2World: Segment Map Conditioned Text to 3D World Generation본 논문은 기존 3D World Generation 연구들이 겪고 있는 고정된 그리드 기반 레이아웃의 제약과 전역적 규모의 일관성 부족 문제를 해결하는 것을 목적으로 합니다.#Review#3D World Generation#Segment Map Conditioning#Latent Fusion#Structured Latent#Detail Enhancer#Rectified Flow2026년 5월 3일댓글 수 로딩 중
[논문리뷰] Let ViT Speak: Generative Language-Image Pre-training본 논문은 기존 MLLM용 vision encoder 학습 방식인 contrastive learning과 복잡한 encoder-decoder 구조의 한계를 극복하고자 합니다.#Review#Vision Transformer#Generative Pre-training#Multimodal Large Language Models#Gated Attention#Vision-Language Pre-training#Minimalist Architecture2026년 5월 3일댓글 수 로딩 중
[논문리뷰] Learning to Act and Cooperate for Distributed Black-Box Consensus Optimization본 논문은 분산 환경에서 에이전트들이 handcrafted update rules에 의존하지 않고, historical trajectory를 기반으로 스스로 알고리즘을 설계하는 방식을 연구한다.#Review#Distributed Black-Box Optimization#Multi-Agent Systems#Large Language Models#Consensus Optimization#Trajectory-Driven Self-Design2026년 5월 3일댓글 수 로딩 중
[논문리뷰] LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation본 논문은 다국어 음성 합성 및 diarization 시스템에서 동일 화자가 언어(스크립트)를 전환할 때 발생하는 스피커 인식 오류 문제를 해결합니다.#Review#Speaker Encoder#Indic Scripts#Gradient Reversal Layer#Speaker Verification#Language Adversarial Training#Voice Cloning#Diarization2026년 5월 3일댓글 수 로딩 중
[논문리뷰] From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills본 논문은 LLM 에이전트 시스템이 사용하는 기술(Skill)의 표현 방식이 텍스트 중심의 파편화된 구조에 머물러 있어, 기계적 reasoning과 자동화된 검증에 한계가 있다는 문제의식에서 출발합니다.#Review#LLM Agents#Skill Representation#Scheduling-Structural-Logical (SSL)#Skill Discovery#Risk Assessment#Knowledge Representation2026년 5월 3일댓글 수 로딩 중
[논문리뷰] End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer본 논문은 기존의 2단계 학습 방식이 토크나이저와 생성 모델 간의 비정렬 문제를 야기하여 최종 생성 품질을 제한한다는 점을 해결하고자 한다.#Review#Autoregressive Image Generation#1D Vision Tokenizer#End-to-End Training#Semantic Alignment#Vision Foundation Models2026년 5월 3일댓글 수 로딩 중
[논문리뷰] AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval본 논문은 아날로그 회로 설계 시 발생하는 이질적인 표현(Netlist, Schematic, Description) 간의 검색 어려움을 해결하고자 AnalogRetriever를 제안한다.#Review#Analog Circuit Retrieval#Cross-Modal Alignment#SPICE Netlists#Relational Graph Convolutional Network (RGCN)#Retrieval-Augmented Generation (RAG)#Curriculum Contrastive Learning2026년 5월 3일댓글 수 로딩 중
[논문리뷰] Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising본 논문은 기존 Unified World Model들이 2D 픽셀 공간에만 국한되어 기하학적 구조에 대한 이해가 부족하며, 고차원 비디오 생성과 저차원 행동 예측 사이의 효율적인 균형을 맞추지 못한다는 문제를 해결하고자 한다.#Review#Embodied AI#World Models#Diffusion Transformer#3D Reconstruction#Robotic Manipulation#Asynchronous Denoising#Unified Modeling2026년 4월 29일댓글 수 로딩 중
[논문리뷰] FASH-iCNN: Making Editorial Fashion Identity Inspectable Through Multimodal CNN Probing본 연구는 현대 패션 AI 시스템이 특정 패션 하우스나 에디터의 심미적 논리를 데이터 내에 내재화하면서도, 이를 사용자에게 투명하게 공개하지 않는 불투명성 문제를 해결하고자 합니다.#Review#Fashion AI#Multimodal CNN#Visual Channel Probing#Editorial Identity Encoding#Hierarchical Color Prediction#Transparency2026년 4월 29일댓글 수 로딩 중
[논문리뷰] Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion본 논문은 기존 controllable diffusion 모델들의 파편화로 인한 시스템적 병목 현상을 해결하고자 합니다. 현재의 제어 방법들은 특정 백본에 종속적인 구조를 가지며, 각기 다른 학습 파이프라인과 런타임 훅을 사용하여 인프라 재사용이나 다중 제어 기법의 결합이 매우 어렵습니다.#Review#Diffusion Models#Controllable Generation#Plugin Framework#KV-Cache#Template Model#Modular Design2026년 4월 29일댓글 수 로딩 중
[논문리뷰] A Survey on LLM-based Conversational User Simulation본 논문은 LLM의 발달로 가능해진 사용자 시뮬레이션 기술의 체계적인 분류와 분석이 부재한 문제를 해결하고자 한다. 기존의 사용자 시뮬레이션은 특정 도메인(예: 추천 시스템)에 한정되거나 대규모 데이터 수집의 어려움으로 인해 확장성에 한계가 있었다.#Review#Conversational User Simulation#Large Language Models#Persona Modeling#Synthetic Data Generation#Multi-agent Systems#Dialogue Evaluation2026년 4월 29일댓글 수 로딩 중
[논문리뷰] GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction본 연구는 GUI Agent를 모바일 기기와 같은 자원 제약 환경에 효과적으로 배포하기 위해, 기존 대규모 VLM이 가진 과도한 연산 비용과 메모리 요구사항 문제를 해결하고자 한다. 대부분의 최신 VLM은 2.5B 이상의 파라미터를 사용하여 온디바이스 환경에서 활용하기 어렵다는 한계가 있다.#Review#GUI Agent#Vision-Language Model#Visual Grounding#Data Refinement#Model Compression#Encoder-Decoder Architecture2026년 4월 28일댓글 수 로딩 중
[논문리뷰] AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark본 논문은 현재 GUI 에이전트 평가 방식이 단순한 시각적 요소 매칭에 치중되어 있어, 실제 디지털 환경에서의 복잡한 상태 변화와 GUI 동역학을 이해하는 능력을 측정하지 못한다는 문제를 해결하고자 한다.#Review#GUI Agents#Multi-Modal Benchmarking#Functional Understanding#Interaction Outcome Prediction#Vision-Language Models#Hierarchical Decomposition2026년 4월 28일댓글 수 로딩 중