[논문리뷰] GameWAM: A World Action Model for Video Games본 논문은 현대 비디오 게임 환경에서 Closed-Loop 제어와 시각적 미래 예측을 동시에 수행하는 통합된 World-Action Model의 필요성을 제기한다 .#Review#World-Action Model#Video Games#Closed-Loop Control#Flow Matching#Block-Causal Attention#GUI Control#Hierarchical History2026년 8월 27일댓글 수 로딩 중
[논문리뷰] EditaLive! Unified Character Video Editing for Live Streaming본 논문은 실시간 스트리밍 환경에서 인물의 외형을 자유롭게 편집하면서도 동작과 표정의 일관성을 완벽히 유지하기 위한 EditaLive를 제안한다.#Review#Character Video Editing#Live Streaming#Real-time Inference#Video Diffusion Models#Self-rollout Distillation#Causal Streaming#Appearance-Motion Decoupling2026년 8월 27일댓글 수 로딩 중
[논문리뷰] CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes본 논문은 대형 언어 모델(LLM)의 추론 성능을 향상시키기 위한 기존 Inference-Time Scaling 기법들이 과도한 연산 비용과 반복적인 Generation을 요구한다는 문제를 해결한다.#Review#Weak-to-Strong Generalization#Inference-Time Scaling#LLM Failure Modes#In-Context Learning#Reasoning Pitfalls2026년 8월 27일댓글 수 로딩 중
[논문리뷰] CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill RetrievalLLM 에이전트가 복잡한 태스크를 수행할 때 재사용 가능한 스킬 라이브러리는 필수적이나, 효율적인 스킬 검색(Retrieval) 문제는 여전히 도전 과제로 남아 있습니다.#Review#LLM agents#skill retrieval#graph retrieval#causal validation#counterfactual reasoning2026년 8월 27일댓글 수 로딩 중
[논문리뷰] CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension본 논문은 현대의 VLM들이 인간의 유머 속에 내재된 복잡한 사회적 맥락, 관계적 모순, 감정적 큐를 이해하는 데 한계가 있다는 문제를 해결하고자 합니다.#Review#Multimodal Humor Comprehension#Causal Reasoning Graph#Graph-of-Thought#Vision-Language Models#Causal Inference#In-Context Learning2026년 8월 27일댓글 수 로딩 중
[논문리뷰] Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning본 논문은 MLLM의 추론 성능을 향상하기 위해 이미지 편집 도구를 활용하는 MLLM → Image Editor → MLLM 파이프라인의 실질적인 유용성을 진단하는 데 목적이 있다. 기존 연구들은 시각적 중간 상태가 추론에 도움이 된다고 주장하지만, 모든 태스크가 시각적 편집으로부터 이득을 얻는 것은 아니다.#Review#Multimodal Reasoning#Image Editing#Visual Workspace#MLLM#Task-Conditioned Utility#Diagnostic Framework2026년 8월 27일댓글 수 로딩 중
[논문리뷰] Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models본 논문은 현대의 공간 지능(Spatial Intelligence) 연구가 겪고 있는 데이터 중심의 'Bitter Lesson' 문제를 해결하고자 한다.#Review#World Models#Game Development#Reinforcement Learning#Human-Engine Verification#Agentic Workflow#Spatial Intelligence2026년 8월 27일댓글 수 로딩 중
[논문리뷰] WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation본 논문은 현대의 Scalable Off-policy RL이 대규모 병렬 시뮬레이션 환경으로 전환됨에 따라, 과거 데이터가 부족했던 시기에 설계된 기존의 안정화 기법들이 오히려 학습 성능을 저해하고 있다는 점을 문제로 지적합니다.#Review#Reinforcement Learning#Off-policy RL#Scalable#Exploration#Exploitation#Data Regime#WarpSAC2026년 8월 26일댓글 수 로딩 중
[논문리뷰] VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction본 논문은 실시간 대화형 AI 시스템에서 필수적인 정보성 기억과 감정적 이해를 결합한 통합 메모리 프레임워크인 VoiceMem을 제안합니다 . 기존의 대화형 시스템은 정보 기억 능력은 갖추고 있으나, 실시간성(Real-Time)과 감정적·인격적 이해(Empathetic)를 동시에 만족하는 데 한계가 있었습니다.#Review#Speech Language Models#Streaming Memory#Dual-Brain Architecture#Real-Time Interaction#Persona Memory#Affective Attribution2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios본 연구는 기존 비디오 이해 벤치마크들이 모델의 단순히 '정답 여부'에만 집중하여, 실무에서 요구되는 복잡한 '지시 이행(Instruction Following)' 능력을 과소평가하고 있다는 문제 의식에서 출발합니다.#Review#Multimodal Large Language Models#Video Understanding#Instruction Following#Benchmark#Constraint Satisfaction#Evaluation Protocol2026년 8월 26일댓글 수 로딩 중
[논문리뷰] VGI-Bench: Probing Visual Intelligence in Video Generation Models본 논문은 영상 생성 모델이 단순한 '시각적 월드 시뮬레이터'를 넘어, 실제 시각적 추론을 수행하는 'Visual Reasoner'로서 어느 정도의 능력을 갖추고 있는지 검증하는 것을 목표로 한다.#Review#Video Generation Models#Visual Reasoning#Benchmark#Visual Intelligence#Spatio-temporal Dynamics#Procedural Tasks2026년 8월 26일댓글 수 로딩 중
[논문리뷰] VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning본 논문은 visual reasoning 연구가 언어 모델 중심의 학습 환경에 고착되어 있다는 점을 지적하며, visual generation을 통한 추론 역량을 강화하기 위한 통합된 인프라를 구축하고자 한다.#Review#Visual Reasoning#Video Generation#Image Generation#Interleaved Reasoning#Reinforcement Learning#Verifiable Rewards2026년 8월 26일댓글 수 로딩 중
[논문리뷰] V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning본 논문은 VLM이 생성하는 텍스트가 유창함에도 불구하고, 시각적 증거가 부족하거나 잘못된 추론을 포함하는 Visual Faithfulness 부족 문제를 해결하고자 합니다.#Review#Multimodal Reasoning#Reinforcement Learning#Visual Faithfulness#Rubrics#Credit Assignment#GRPO#VLM Post-training2026년 8월 26일댓글 수 로딩 중
[논문리뷰] The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents본 논문은 장기적인 작업(long-horizon tasks)을 수행하는 LLM Agent에서 모델 전환(Handoff)이 품질과 비용에 미치는 영향을 체계적으로 분석합니다.#Review#LLM Agents#Model Handoff#Cost-Quality Trade-off#Trajectory Inheritance#SWE-bench#Coding Agents#Inference Optimization2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans본 논문은 기존의 오프라인 기반 co-speech gesture generation 방식이 실시간 상호작용 환경에서 적합하지 않다는 점을 핵심 문제로 정의합니다 .#Review#Online Co-speech Gesture Generation#Digital Humans#Interactive Agents#Self-evolution#Streaming Speech#Multimodal Interaction2026년 8월 26일댓글 수 로딩 중
[논문리뷰] StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models본 논문은 기존 VLA 모델들이 사용하는 single-frame paradigm의 한계를 극복하기 위해 StreamPI를 제안한다. 최신 모델인 π0.5를 포함한 많은 VLA 모델들은 이전 프레임의 맥락을 고려하지 못하여 기억이 필요한 작업이나 정밀한 공간 인식이 요구되는 상황에서 성능이 저하되는 문제를 겪는다 .#Review#Vision-Language-Action (VLA)#Streaming Inference#Temporal Modeling#Instruction-Anchored#Random-Interval Training#Embodied AI2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models본 논문은 기존 Streaming Autoregressive Diffusion 모델들이 장시간 비디오 생성 시 발생하는 4D 불일치와 움직임 억제 문제를 해결하는 것을 목표로 합니다.#Review#Streaming Autoregressive Diffusion#4D-Consistency#4D Gaussian Splatting#Reinforcement Learning#Motion Prior#Video Generation#Geometry-Aware Reward2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Skill Issue: Are Skills Language-Invariant in LLMs?본 논문은 LLM이 서로 다른 언어 환경에서 상호작용할 때, 단순히 지식의 접근성뿐만 아니라 근본적인 기술(Skill) 수준까지 달라지는지 규명하고자 합니다.#Review#Multilingual LLMs#TextArena#Cross-lingual Skill Inconsistency#Self-play#Language Interface#Agentic Gameplay2026년 8월 26일댓글 수 로딩 중
[논문리뷰] SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?본 논문은 현대 소프트웨어 생태계의 고질적인 문제인 기술 부채(Technical debt) 해결을 위해 코딩 에이전트가 리포지토리 단위의 마이그레이션을 자율적으로 수행할 수 있는지 검증합니다.#Review#Coding Agents#Software Migration#Technical Debt#Evaluation Protocol#Agentic Verification#Blindness2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation본 논문은 UI-to-Code 생성 과정에서 테스트 타임(Test-time) Self-Evolution이 겪는 불안정성을 해결하는 것을 목표로 합니다.#Review#UI-to-Code#Self-Evolution#Visual Repair Coupling#Rubric-guided#Vision-Language Models#Visual Fidelity#Test-time Refinement2026년 8월 26일댓글 수 로딩 중