[논문리뷰] ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion본 논문은 기존 Feed-forward 3DGS 방식들이 가진 과도하게 밀집된 3D Gaussian 분포 문제를 해결하기 위해 고안되었습니다.#Review#3D Gaussian Splatting#Feed-forward Models#Novel-view Synthesis#Adaptive Token Expansion#Compact Representation#Multi-view Capture2026년 7월 22일댓글 수 로딩 중
[논문리뷰] Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training본 논문은 Mixture-of-Experts (MoE) 모델 학습 시 발생하는 방대한 Optimizer state 메모리 점유 문제를 해결하기 위해 고안되었습니다.#Review#Mixture-of-Experts (MoE)#Optimizer State#Tiered Allocation#SkewAdam#Memory Efficiency#Factored Second Moments#Bfloat162026년 7월 21일댓글 수 로딩 중
[논문리뷰] Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness본 연구는 장문 생성 모델의 사실성을 평가함에 있어 기존 Decompose-Search-Verify (DSV) 패러다임이 가진 Precision 중심의 편향성과 평면적 사실 확인(Boolean fact-checks)의 한계를 해결하고자 한다.#Review#Factual Completeness#Long-form Generation#Meta-Rubric#Benchmark#LLM-as-a-judge#Multimodal#Everyday Deep Research2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing본 논문은 현대의 ASR 시스템이 혼재된 데이터로 학습됨에 따라 전사 스타일(Transcription Policy)이 제어 불가능한 Latent Variable로 남게 되는 문제를 해결합니다.#Review#Speech Recognition#Transcription Policy#Disfluency Detection#Word-level Timing#Cross-lingual Transfer#Verbatim ASR2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Trajectory-aware Cross-view Geo-localization with Sequential Observations본 논문은 기존의 Cross-view Geo-localization 연구들이 단일 이미지 기반의 한계를 극복하기 위해 비디오와 같은 순차적 관측(sequential observations)을 활용하고 있으나, 텍스트 형태의 경로 설명(route descriptions)이라는 중요한 모달리티를 간과하고 있다는 문제점에 주목한다 .#Review#Cross-view Geo-localization#Sequential Observations#Trajectory Geometry#Multimodal Benchmark#Vision-Language Embedding#Spatial Reasoning2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers본 논문은 현대의 대규모 Diffusion Transformers에서 텍스트와 이미지 토큰의 상호작용 과정이 여전히 불투명하다는 문제를 해결하고자 합니다.#Review#Diffusion Transformers#Causal Interpretability#Attention Sinks#Semantic Registers#Token Pruning#Multimodal Diffusion2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning본 논문은 대규모 비동기 강화학습에서 발생하는 training-inference mismatch와 누적된 staleness가 모델 학습의 조기 붕괴(collapse)를 야기한다는 점을 지적합니다.#Review#Asynchronous Reinforcement Learning#Staleness#Trust Region#PPO#Training-Inference Mismatch#Adaptive Clipping#LLM2026년 7월 21일댓글 수 로딩 중
[논문리뷰] SciForma: Structure-Faithful Generation of Scientific Diagrams과학적 방법론 다이어그램은 연구 논리의 청사진 역할을 하므로, 시각적 플라시보(Visual Plausibility)보다 Structural Fidelity가 매우 중요하다.#Review2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Masked Visual Actions for Unified World Modeling본 논문은 로봇의 동작을 비디오 생성 모델이 이해할 수 있는 범용적인 시각적 언어로 통일하여, 하나의 모델로 forward 및 inverse 추론을 동시에 수행하는 문제를 해결합니다.#Review#World Modeling#Video Generation#Robotic Manipulation#Masked Visual Actions#Embodiment-agnostic#Inverse Dynamics2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing본 논문은 현대의 고성능 생성형 AI 모델들이 요구하는 막대한 컴퓨팅 자원과 연구의 폐쇄성 문제를 해결하기 위해 Mage-Flow를 제안한다.#Review#Generative Foundation Model#Image Generation#Image Editing#Latent Tokenizer#Native-Resolution#Rectified Flow Matching#Diffusion-NFT#Turbo Inference2026년 7월 21일댓글 수 로딩 중
[논문리뷰] ISO: An RLVR-Native Optimization Stack본 논문은 현대의 RLVR 학습이 보상 피드백을 모델 가중치로 변환하는 최적화 계층(optimization layer)을 충분히 이해하지 못한 채 사전 학습(pre-training)의 관습을 그대로 따르고 있다는 문제에서 출발합니다.#Review#RLVR#Optimization#Spectral Inheritance#Isospectral Optimization#ISO-Merger#ISO-Optimizer#Singular Frames2026년 7월 21일댓글 수 로딩 중
[논문리뷰] HPD-Parsing: Hierarchical Parallel Document Parsing본 연구는 기존 VLM-based document parser가 갖는 고유한 sequential bottleneck 문제를 해결하는 것을 목표로 합니다.#Review#Document Parsing#Hierarchical Parallel Decoding#Vision-Language Models#Inference Efficiency#P-MTP#Layout Analysis#Parallel Generation2026년 7월 21일댓글 수 로딩 중
[논문리뷰] H^2SD: Hybrid Hindsight Self-Distillation본 논문은 기존의 RLVR 방식이 가지는 희소한 Supervision(Sparse supervision) 문제와 OPSD 및 RLSD 사이의 성능-안정성 트레이드오프 문제를 해결하고자 한다 .#Review#Reinforcement Learning#Self-Distillation#LLM Reasoning#Credit Assignment#Hybrid Hindsight#Privileged Information2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Generative World Renderer at the Speed of Play본 논문은 기존의 고성능 generative world renderer가 가진 높은 연산 비용과 비실시간성을 해결하여 실시간 게임 환경에서의 사용을 가능하게 하는 것을 목표로 한다.#Review#Generative World Renderer#Autoregressive Streaming#Few-step Distillation#Real-time Rendering#G-buffer Conditioning#Interactive World Modeling2026년 7월 21일댓글 수 로딩 중
[논문리뷰] EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration본 논문은 교육용 동영상이 급증함에 따라 이를 체계적으로 평가할 필요성이 커지고 있으나, 기존 자동화 평가 도구들이 가진 한계를 해결하고자 합니다.#Review#EduPanel#LLM-as-a-judge#Multimodal Evaluation#Pedagogical Assessment#Human-AI Collaboration#Learner-Conditioned#Agent Decomposition2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Delineate Anything v2: A Global Foundation Model for Field Delineation본 논문은 기존의 글로벌 농경지 경계 탐지 모델들이 행정 데이터의 구조적 라벨 노이즈로 인해 발생하는 성능 한계를 해결하기 위해 제안되었다.#Review#Foundation Model#Geospatial AI#Field Boundary Delineation#Data-Centric AI#Label Noise#Remote Sensing2026년 7월 21일댓글 수 로딩 중
[논문리뷰] DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines본 논문은 최신 LLM coding agent가 데이터 처리 워크플로우를 자동화할 때 발생하는 구조적 한계와 영속성의 부재를 해결하기 위해 DataFlow-Harness를 제안합니다.#Review#NL2Pipeline gap#DataFlow-Harness#Agentic Workflow Synthesis#MCP#Data Engineering#DAG#Grounded Code-Agent2026년 7월 21일댓글 수 로딩 중
[논문리뷰] ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning본 논문은 기존 MLLM이 비디오 공간 추론(Video Spatial Reasoning)에서 겪는 비효율성과 뷰포인트 변화에 따른 추론 불안정성 문제를 해결하고자 합니다.#Review#Video Spatial Reasoning#Multimodal Large Language Models#Geometric Consistency#Memory-Augmented#Reinforcement Learning#Viewpoint Stability2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges본 논문은 현대 MLLM(Multimodal Large Language Models)이 이미지 캡셔닝이나 시각적 질의응답(VQA) 등 명시적 인식 능력은 뛰어나지만, 유머와 같이 비유적 의미와 문화적 맥락이 개입된 콘텐츠 이해에는 여전히 구조적 한계를 보인다는 점을 문제로 제기한다.#Review#Multimodal LLMs#Computational Humor#Visual Reasoning#Incongruity#Creative Generation#Task Hierarchy2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Appearance Pointers -- Multimodal Region Control of Diffusion Transformers본 논문은 기존의 생성 모델이 텍스트 프롬프트만으로는 달성하기 어려운 정밀한 영역 기반(Region-aware) 제어 문제를 해결하고자 합니다 .#Review#Diffusion Transformers#Multimodal Control#Region-Aware Generation#Appearance Pointers#Image Synthesis#Spatial Grounding2026년 7월 21일댓글 수 로딩 중