[논문리뷰] Trajectory-aware Cross-view Geo-localization with Sequential Observations본 논문은 기존의 Cross-view Geo-localization 연구들이 단일 이미지 기반의 한계를 극복하기 위해 비디오와 같은 순차적 관측(sequential observations)을 활용하고 있으나, 텍스트 형태의 경로 설명(route descriptions)이라는 중요한 모달리티를 간과하고 있다는 문제점에 주목한다 .#Review#Cross-view Geo-localization#Sequential Observations#Trajectory Geometry#Multimodal Benchmark#Vision-Language Embedding#Spatial Reasoning2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers본 논문은 현대의 대규모 Diffusion Transformers에서 텍스트와 이미지 토큰의 상호작용 과정이 여전히 불투명하다는 문제를 해결하고자 합니다.#Review#Diffusion Transformers#Causal Interpretability#Attention Sinks#Semantic Registers#Token Pruning#Multimodal Diffusion2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning본 논문은 대규모 비동기 강화학습에서 발생하는 training-inference mismatch와 누적된 staleness가 모델 학습의 조기 붕괴(collapse)를 야기한다는 점을 지적합니다.#Review#Asynchronous Reinforcement Learning#Staleness#Trust Region#PPO#Training-Inference Mismatch#Adaptive Clipping#LLM2026년 7월 21일댓글 수 로딩 중
[논문리뷰] SciForma: Structure-Faithful Generation of Scientific Diagrams과학적 방법론 다이어그램은 연구 논리의 청사진 역할을 하므로, 시각적 플라시보(Visual Plausibility)보다 Structural Fidelity가 매우 중요하다.#Review2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Masked Visual Actions for Unified World Modeling본 논문은 로봇의 동작을 비디오 생성 모델이 이해할 수 있는 범용적인 시각적 언어로 통일하여, 하나의 모델로 forward 및 inverse 추론을 동시에 수행하는 문제를 해결합니다.#Review#World Modeling#Video Generation#Robotic Manipulation#Masked Visual Actions#Embodiment-agnostic#Inverse Dynamics2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing본 논문은 현대의 고성능 생성형 AI 모델들이 요구하는 막대한 컴퓨팅 자원과 연구의 폐쇄성 문제를 해결하기 위해 Mage-Flow를 제안한다.#Review#Generative Foundation Model#Image Generation#Image Editing#Latent Tokenizer#Native-Resolution#Rectified Flow Matching#Diffusion-NFT#Turbo Inference2026년 7월 21일댓글 수 로딩 중
[논문리뷰] ISO: An RLVR-Native Optimization Stack본 논문은 현대의 RLVR 학습이 보상 피드백을 모델 가중치로 변환하는 최적화 계층(optimization layer)을 충분히 이해하지 못한 채 사전 학습(pre-training)의 관습을 그대로 따르고 있다는 문제에서 출발합니다.#Review#RLVR#Optimization#Spectral Inheritance#Isospectral Optimization#ISO-Merger#ISO-Optimizer#Singular Frames2026년 7월 21일댓글 수 로딩 중
[논문리뷰] HPD-Parsing: Hierarchical Parallel Document Parsing본 연구는 기존 VLM-based document parser가 갖는 고유한 sequential bottleneck 문제를 해결하는 것을 목표로 합니다.#Review#Document Parsing#Hierarchical Parallel Decoding#Vision-Language Models#Inference Efficiency#P-MTP#Layout Analysis#Parallel Generation2026년 7월 21일댓글 수 로딩 중
[논문리뷰] H^2SD: Hybrid Hindsight Self-Distillation본 논문은 기존의 RLVR 방식이 가지는 희소한 Supervision(Sparse supervision) 문제와 OPSD 및 RLSD 사이의 성능-안정성 트레이드오프 문제를 해결하고자 한다 .#Review#Reinforcement Learning#Self-Distillation#LLM Reasoning#Credit Assignment#Hybrid Hindsight#Privileged Information2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Generative World Renderer at the Speed of Play본 논문은 기존의 고성능 generative world renderer가 가진 높은 연산 비용과 비실시간성을 해결하여 실시간 게임 환경에서의 사용을 가능하게 하는 것을 목표로 한다.#Review#Generative World Renderer#Autoregressive Streaming#Few-step Distillation#Real-time Rendering#G-buffer Conditioning#Interactive World Modeling2026년 7월 21일댓글 수 로딩 중
[논문리뷰] EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration본 논문은 교육용 동영상이 급증함에 따라 이를 체계적으로 평가할 필요성이 커지고 있으나, 기존 자동화 평가 도구들이 가진 한계를 해결하고자 합니다.#Review#EduPanel#LLM-as-a-judge#Multimodal Evaluation#Pedagogical Assessment#Human-AI Collaboration#Learner-Conditioned#Agent Decomposition2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Delineate Anything v2: A Global Foundation Model for Field Delineation본 논문은 기존의 글로벌 농경지 경계 탐지 모델들이 행정 데이터의 구조적 라벨 노이즈로 인해 발생하는 성능 한계를 해결하기 위해 제안되었다.#Review#Foundation Model#Geospatial AI#Field Boundary Delineation#Data-Centric AI#Label Noise#Remote Sensing2026년 7월 21일댓글 수 로딩 중
[논문리뷰] DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines본 논문은 최신 LLM coding agent가 데이터 처리 워크플로우를 자동화할 때 발생하는 구조적 한계와 영속성의 부재를 해결하기 위해 DataFlow-Harness를 제안합니다.#Review#NL2Pipeline gap#DataFlow-Harness#Agentic Workflow Synthesis#MCP#Data Engineering#DAG#Grounded Code-Agent2026년 7월 21일댓글 수 로딩 중
[논문리뷰] ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning본 논문은 기존 MLLM이 비디오 공간 추론(Video Spatial Reasoning)에서 겪는 비효율성과 뷰포인트 변화에 따른 추론 불안정성 문제를 해결하고자 합니다.#Review#Video Spatial Reasoning#Multimodal Large Language Models#Geometric Consistency#Memory-Augmented#Reinforcement Learning#Viewpoint Stability2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges본 논문은 현대 MLLM(Multimodal Large Language Models)이 이미지 캡셔닝이나 시각적 질의응답(VQA) 등 명시적 인식 능력은 뛰어나지만, 유머와 같이 비유적 의미와 문화적 맥락이 개입된 콘텐츠 이해에는 여전히 구조적 한계를 보인다는 점을 문제로 제기한다.#Review#Multimodal LLMs#Computational Humor#Visual Reasoning#Incongruity#Creative Generation#Task Hierarchy2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Appearance Pointers -- Multimodal Region Control of Diffusion Transformers본 논문은 기존의 생성 모델이 텍스트 프롬프트만으로는 달성하기 어려운 정밀한 영역 기반(Region-aware) 제어 문제를 해결하고자 합니다 .#Review#Diffusion Transformers#Multimodal Control#Region-Aware Generation#Appearance Pointers#Image Synthesis#Spatial Grounding2026년 7월 21일댓글 수 로딩 중
[논문리뷰] AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report본 논문은 현대 게임 개발의 노동 집약적이고 시간 소모적인 파이프라인을 대체할 수 있는 실시간 상호작용형 가상 세계 생성 모델을 제안한다. 기존의 영상 생성 모델들은 긴 시간 동안 일관성(Consistency)을 유지하거나 사용자의 카메라 조작 및 행동 입력에 실시간으로 반응하는 데 한계를 가지고 있다.#Review#World Modeling#Interactive Generation#Video Diffusion Transformer#Long-Horizon#Autoregressive#Spatiotemporal Memory2026년 7월 21일댓글 수 로딩 중
[논문리뷰] AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents본 논문은 LLM Agent에서 발생하는 오류의 가시성 부족과 근본 원인 분석의 어려움을 해결하기 위해 AgentDebugX를 제안합니다. 복잡한 Agent 환경에서는 최종 오류가 발생한 시점과 실제 원인이 된 행동의 시점이 일치하지 않는 경우가 많아, 단순한 Trace replay만으로는 디버깅에 한계가 있습니다.#Review#LLM Agents#Debugging#Observability#Root-Cause Attribution#Error Recovery#Agentic Workflow#Closed-Loop System2026년 7월 21일댓글 수 로딩 중
[논문리뷰] ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU본 논문은 실시간 인터랙티브 환경을 구현하기 위한 비디오 월드 모델의 제어 가능성(Controllability), 일관성(Consistency), 효율성(Efficiency) 간의 결합 문제를 해결하는 데 집중한다.#Review#World Model#Action-Conditioned#Real-Time Inference#Video Generation#Streaming#Long-Horizon#System Co-Design2026년 7월 21일댓글 수 로딩 중
[sglang] SGLang ReplaySSM: GDN 추론 최적화 및 메모리 효율 개선ReplaySSM 도입을 통해 GDN 추론 시 불필요한 SSM 상태 저장을 제거하고, Closed-loop Exact Fold로 정확도를 유지하며 메모리를 6.4배 절감했습니다.#SGLang#LLM#SpeculativeDecoding#SSM#Optimization2026년 7월 20일댓글 수 로딩 중