[논문리뷰] LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes본 연구는 폐쇄적인 최신 생성 모델들 사이에서, 고품질 생성과 정교한 편집이 가능한 개방형 이미지 생성 시스템을 구축하는 것을 목표로 합니다. 기존 연구들은 대규모의 이미지-텍스트 쌍 데이터에 의존하지만, 이러한 데이터는 비용이 많이 들고 손실이 발생하기 쉽다는 한계가 있습니다.#Review#Diffusion Transformer#Image Generation#Multimodal Understanding#Open Training Recipes#TwinFlow#Image Editing2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training본 논문은 LLM의 반복적인 post-training 과정에서 과거의 성공적인 업데이트 경험을 무분별하게 재사용할 때 발생하는 비효율성과 모델 성능 저하 문제를 해결하고자 한다.#Review#Autonomous LLM Post-Training#Experience Transfer#Conditional Experience Transfer#BCIT#Model Adaptation#Boundary-Calibrated Intervention2026년 9월 3일댓글 수 로딩 중
[논문리뷰] FlashRender: Few-Step Generative Rendering via Camera-Controlled Video MeanFlow기존 카메라 제어 비디오 생성 기술은 영화 제작 및 가상 프로덕션과 같은 다양한 응용 분야에서 상당한 주목을 받아왔다. 그러나 기존 Generative Rendering 방법들은 높은 추론 비용을 초래하는 많은 Sampling Step을 요구하여 실제 사용 가능성을 제한하는 문제를 가지고 있다.#Review#Generative Rendering#Few-Step#MeanFlow#Representation Alignment#Camera Control#Video Generation#Discretization Error2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Environment Evolution for Terminal Agents본 연구는 고성능 터미널 에이전트 학습을 위한 환경의 난이도 부족 문제를 해결하는 것을 목표로 한다. 최근 구축된 대규모 터미널 환경들은 모델의 성능이 향상됨에 따라 더 이상 충분한 학습 신호를 제공하지 못하며, 이로 인해 RL 과정에서 성능 개선을 위한 차별화된 학습 신호가 결여되는 한계가 있다.#Review#Terminal Agents#Environment Evolution#Reinforcement Learning#Off-policy Scaling#Agentic RL#Multi-turn Objective2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Editable Visual Design본 논문은 기존의 이미지 생성 모델과 코드 기반 생성 방식이 가진 근본적인 한계를 극복하고, 심미성과 편집 가능성을 동시에 갖춘 생산 수준의 디자인 도구를 구축하는 것을 목표로 합니다.#Review#Editable Visual Design#Coding Agent#Visual Simulation#Multimodal Large Model#Layer-decoupled Generation#Human-AI Collaboration2026년 9월 3일댓글 수 로딩 중
[논문리뷰] DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training본 논문은 Programmatic Verifier가 없는 Long-Horizon Agent Domain에서 발생하는 Credit Assignment 문제와 Outcome-Blind Setting의 한계를 해결하고자 한다.#Review#Fine-Grained Credit Assignment#Dynamic Rubrics#Long-Horizon Agent Training#Outcome-Blind Reinforcement Learning#GRPO#Step Advantage#Tool-Using Agents#AppWorld2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Compile by Training: Turning Natural-Language Specifications into Local Neural Functions본 논문은 Natural Language로 쉽게 설명할 수 있지만, 규칙 기반(Rule-based) 코드로는 구현하기 어려운 'Fuzzy Function'의 비효율성 문제를 해결하고자 합니다.#Review#Natural Language Specification#Neural Functions#Compile by Training#LoRA#Large Language Models#Semantic Accuracy#FuzzyBench-Hard#Parameter-Efficient Adaptation2026년 9월 3일댓글 수 로딩 중
[논문리뷰] CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation본 논문은 MLLM 기반 embedding 모델이 compositional한 시나리오에서 객체-속성 간 결합(binding)을 구분하는 데 실패하는 문제를 해결하고자 한다.#Review#Compositional Reasoning#Multimodal Embedding#Reranker Distillation#Rank-KL#MLLM#Hard Negatives#Representation Learning2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding본 논문은 MLLMs가 엄격한 causality와 bounded memory 제약 하에 continuous visual input을 처리하고 사용자 query에 응답해야 하는 streaming video understanding의 한계를 해결한다.#Review#Streaming Video Understanding#Multimodal Large Language Models (MLLMs)#Latent Memory Evolution#Hierarchical Streaming Memory#Retrieve-and-Internalize#Predictive Entropy#Test-Time Optimization2026년 9월 3일댓글 수 로딩 중
[논문리뷰] ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes본 논문은 기존 3D tokenizer들이 latent sequence 길이를 줄였을 때 기하학적 재구성 품질이 급격히 저하되는 문제를 해결하고자 합니다. 기존 방식들은 고정된 토큰 예산 하에 정보를 암묵적으로 분산시키므로, 토큰 수를 극단적으로 줄일 경우 전역 구조와 세부 사항 사이의 정보 병목 현상이 발생합니다.#Review#3D tokenization#3D representation learning#Neural fields#Iterative refinement#Nested dropout#Compact prefix2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Wasserstein-Barycentric Interaction Fields for Spatial Factor Models: Evidence from Language-Model Representations본 논문은 기존 공간적 자산 가격 결정 모델이 사전에 주어진 interaction matrix에 의존하여 경제적 연결성을 충분히 설명하지 못하는 한계를 해결합니다.#Review#Spatial Exposure Adjustment#Barycentric Interaction Fields#Wasserstein Barycentric Reconstruction#Language-Model Representations#Spatial Autoregression2026년 9월 2일댓글 수 로딩 중
[논문리뷰] VibeVoice-ASR-Streaming Technical Report본 논문은 기존 Unified End-to-End 모델들이 오프라인 인식에 국한되어 실시간 음성 비서 환경에서 요구되는 저지연(Low-latency) 요구사항을 충족하지 못하는 문제를 해결합니다.#Review#Streaming ASR#Speaker-Attributed ASR#LLM#End-to-End#Multi-talker Recognition#Interleaved Generation#Voice Assistant2026년 9월 2일댓글 수 로딩 중
[논문리뷰] SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models본 논문은 다양한 이기종 데이터 소스와 서로 다른 아키텍처를 가진 Video generator들을 효과적으로 통합하여 일관된 Interactive video world model을 구축하는 핵심 문제에 주목한다.#Review#Interactive Video World Models#Multi-source Data Engine#Backbone-native Adaptation#Long-horizon Inference#Distribution Matching Distillation#Teacher-forced AnyFlow2026년 9월 2일댓글 수 로딩 중
[논문리뷰] SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions본 논문은 모바일 환경에서 일상적으로 발생하는 이미지 및 텍스트 노이즈가 멀티모달 검색 성능에 미치는 영향을 체계적으로 규명하고자 합니다. 기존 벤치마크들은 주로 노이즈가 없는 깨끗한 데이터셋을 사용하거나, 특정 엔티티에 대한 견고성(Robustness)을 독립적으로 평가하지 못한다는 한계가 있습니다 .#Review#Multimodal Retrieval#Mobile Interaction#Robustness#Benchmark#Snap-and-Ask#Modality Fusion2026년 9월 2일댓글 수 로딩 중
[논문리뷰] S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?본 논문은 LLM 기반 에이전트가 환경과의 상호작용 경험을 통해 실제로 스스로를 개선(Self-Improvement)할 수 있는지에 대한 근본적인 의문을 해결하고자 합니다.#Review#LLM Agents#Self-Improvement#Interactive Benchmark#Self-Judging#History ICL#Summary Memory#Parameter Training2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills본 논문은 자율 연구 에이전트가 수행하는 머신러닝(ML) 연구 과정에서 겪는 도메인 특화 전문 지식 부족 문제를 해결하고자 합니다 .#Review#Autonomous Agents#Operational Knowledge#Skill Distillation#GitHub Repositories#Agentic Systems#AI4AI#DisCo2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Post-Training Language Models for Gold-Medal Performance in Coding Competitions본 논문은 competitive programming에서 AI 시스템이 Gold-Medal 이상의 성능을 달성하기 위한 최적의 파이프라인을 구축하는 것을 목표로 합니다.#Review#Competitive Programming#Supervised Fine-Tuning#Reinforcement Learning#Test-Time Compute#GenCorrect#IOI2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Portfolio Risk Bounds without Cross-Asset Return Covariances: Distributional Fields from Language-Model Representations본 논문은 데이터가 부족하거나 고차원적인 패널 환경에서 cross-asset return covariances를 안정적으로 추정하기 어렵다는 금융권의 고질적인 문제를 해결하고자 합니다.#Review#Portfolio Risk#Certified Diversification#Wasserstein Distance#Distributional Fields#Robust Portfolio Choice#Language-Model Representations2026년 9월 2일댓글 수 로딩 중
[논문리뷰] PaperCompiler: Faithful Paper-to-Code Generation via Repository-Level Specification Compilation본 논문은 최신 연구 논문을 저장소 수준의 코드로 변환할 때 발생하는 정보 손실 및 구현 불일치 문제를 해결하기 위해 PaperCompiler를 제안합니다.#Review#Paper-to-Code#Repository-level Generation#Specification Compilation#Constraint-guided Generation#Software Engineering Agents2026년 9월 2일댓글 수 로딩 중
[논문리뷰] On the Design Fundamentals of Pixel Text Representation Learning본 논문은 기존 Pixel-based Text Encoder가 고정된 해상도 Pretraining, Visual Shortcut Learning, 취약한 Multimodal Grounding, 그리고 Multilingual Visual Text Understanding 측면에서 겪는 근본적인 문제들을 해결하고자 합니다.#Review#Pixel Text Representation Learning#Vision-Language Models#Multimodal Grounding#Native-Resolution Encoding#Layout Augmentation#Multilingual Text Understanding#Contrastive Learning#Optical Context Compression2026년 9월 2일댓글 수 로딩 중