[논문리뷰] ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training본 연구는 로봇 학습의 핵심 병목인 '확장 가능한 embodied 경험의 부족'을 해결하고자 합니다.#Review#World Action Models#Scalable Video Pre-training#Embodied AI#Dual-System Architecture#Zero-Shot Generalization#Robotics2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System본 논문은 통합 멀티모달 모델(UMM) 내에서 이해와 생성이라는 두 기능이 공존할 때 발생하는 상호작용의 실체를 규명하고자 한다. 기존 모델들은 두 기능을 통합하여 제공하지만, 이러한 기능적 통합이 반드시 내재적 학습 시너지로 이어지는지는 불분명하며 때로는 컴퓨팅 자원이나 표현 공간을 두고 경쟁하거나 충돌하기도 한다.#Review#Unified Multimodal Models#Native Multimodal#Understanding-Generation Synergy#Task-decoupled MoT#Parameter Sharing#Spatial Intelligence#Representation Learning2026년 9월 1일댓글 수 로딩 중
[논문리뷰] UI-Venus-2 Technical Report본 논문은 기존 GUI 에이전트가 벤치마크 점수 향상에는 성공했으나, 실제 환경에서의 신뢰성(Dependability)과 범용성(Generalization) 측면에서 여전히 한계를 가지고 있다는 점을 지적합니다 .#Review#GUI Agents#Multimodal Foundation Models#Reinforcement Learning#System Scalability#Trajectory Verification#Computer Use2026년 9월 1일댓글 수 로딩 중
[논문리뷰] The Mechanics of Democratic Dominance: A System Dynamics Paradigm for Dynamic Consent Engineering본 논문은 기존의 정치적 커뮤니케이션 분석이 선형적이고 사건 중심적인 모델에 의존하여 시스템적 피드백과 지연(Delay)을 간과하고 있다는 문제를 제기합니다. 이러한 정적 접근은 정치 조직이 유권자의 피로도, 정치적 변동성, 기관 신뢰도 저하를 예측하고 대응하는 데 한계를 갖게 합니다 .#Review#Dynamic Democratic Consent#System Dynamics#Political Communication#S-E-E-D Framework#Feedback Loops#Institutional Trust#4M Paradigm2026년 9월 1일댓글 수 로딩 중
[논문리뷰] StudentSim: Training LLM-based Student Simulators본 논문은 적응형 AI 튜터 개발을 위해 필수적인 '개인화된 학생 데이터'의 부족 문제를 해결하고자 합니다. 기존 연구의 한계점은 다음과 같습니다. 지식 추적 모델(Knowledge tracing)과 같은 상태 추적 모델은 학생의 행동을 예측할 수는 있으나, 튜터의 가이던스를 입력으로 받아들여 학습하는 기능이 부족합니다.#Review#Student Simulators#LLM#Educational AI#Reinforcement Learning#Behavioral Fidelity#Guidance Responsiveness#Individualized Simulation2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Safin-1: Safety from Within through Memory-Native State Evolution본 논문은 장기적인 상호작용과 복잡한 작업을 수행하는 모델에서 안전성과 기억 유지가 분리되어 있는 기존 모델의 구조적 한계를 해결하고자 합니다.#Review#Foundation Models#Long-horizon Intelligence#Memory-Native State Evolution#Safety from Within#Recurrent Neural Networks#State-Space Models#MARCH2026년 9월 1일댓글 수 로딩 중
[논문리뷰] SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers본 연구는 Looped Transformer의 성능 향상이 아키텍처 자체의 우수성인지, 아니면 반복 실행으로 인해 증가한 FLOPs와 같은 추가 자원 때문인지 규명하고자 한다.#Review#Looped Transformers#Mixture-of-Experts#Scaling Laws#Compute-Matched#Effective Depth#Inductive Bias#Attention Sink2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Recursive Criticality of AI Self-Improvement본 논문은 AI 시스템이 차세대 AI를 개발하는 R&D 과정에 참여함에 따라 발생하는 Recursive self-improvement(RSI)가 언제 자기 증폭(self-amplifying) 상태로 진입하는지를 규명하고자 합니다.#Review#Recursive AI self-improvement#Recursive criticality#Recursive reproduction number#Research frontier#AI R&D system#Feedback loop#Frontier hardening2026년 9월 1일댓글 수 로딩 중
[논문리뷰] ReFlowSET: Representation-Aligned Latent Flow Matching for SAR-to-EO Image Translation본 논문은 기존의 SAR-to-EO Translation(SET) 연구들이 모델의 근간이 되는 VAE(Autoencoder)의 적합성을 고려하지 않고 자연 이미지용 pretrained codec을 고정적으로 사용한다는 문제점을 해결하고자 합니다.#Review#SAR-to-EO Translation#Latent Flow Matching#Diffusion Transformer#Representation Alignment#Autoencoder Selection2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving본 논문은 자율주행을 위한 통합 비전-언어 파운데이션 모델인 Qwen-Drive-1.0을 제안하여, 기존 모듈형 파이프라인의 한계를 극복하고자 한다.#Review#Vision-Language Foundation Model#Autonomous Driving#3D Perception#Motion Planning#Bird’s-Eye-View (BEV)#Visual Question Answering#Flow Matching2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry본 연구는 다중 모달 기하 추론에서 발생하는 Representation Gap과 Credit Gap 문제를 해결하는 것을 목표로 합니다.#Review#Multimodal Geometry#Credit-Addressable Reasoning#Code-CoT#CE-GRPO#Reinforcement Learning#VLM2026년 9월 1일댓글 수 로딩 중
[논문리뷰] InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal본 연구는 학술 리뷰의 자동화 과정에서 발생하는 hallucination과 비전문적인 리뷰 생성을 해결하기 위해 수행되었습니다. 기존의 LLM 기반 리뷰 생성 모델들은 문체만 모방하거나, 존재하지 않는 문헌을 인용하는 등 사실관계 확인이 부족한 sycophantic한 리뷰를 생성하는 한계가 있습니다 .#Review#Agentic Reinforcement Learning#Peer Review#Rebuttal#Hallucination Suppression#Evidence-grounded Search#Objective Reward Function2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering본 논문은 Multi-hop Question Answering(QA)에서 발생하는 핵심 병목인 'Query-Evidence Granularity Mismatch' 문제를 해결하고자 한다 .#Review#Multi-hop Question Answering#Retrieval-Augmented Generation#Query Refinement#Granularity#Hierarchical Decomposition#Evidence-guided2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement본 논문은 LLM-based Coding Agents를 활용한 Autonomous Software Development라는 ambitious한 목표를 달성하기 위한 Continual Improvement의 필요성을 제기한다.#Review#Autonomous Software Development#LLM-based Agents#Continual Improvement#Agent Harnesses#Iterative Development#Software Quality#Planning–Coding–Testing#Long-Horizon Tasks2026년 9월 1일댓글 수 로딩 중
[논문리뷰] H3-World: Turning Language Understanding into World Control본 논문은 사전 학습된 대규모 비디오 생성 모델을 별도의 복잡한 제어 모듈 추가 없이 상호작용 가능한 월드 모델로 전환하는 것을 목표로 합니다.#Review#World Models#Video Generation#Language Interface#Temporal Grounding#Low-Rank Adaptation#Interactive Control2026년 9월 1일댓글 수 로딩 중
[논문리뷰] From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix본 논문은 엔터프라이즈 환경에서 데이터 보안 및 규제 준수를 위해 자체 호스팅(self-hosted) LLM을 도입할 때 발생하는 파편화 문제를 해결하고자 합니다. 기존에는 수백 개의 애플리케이션이 각각 다른 모델을 사용하여 컴퓨팅 자원(GPU)의 비효율적인 분산이 발생했습니다.#Review#LLM#Post-Training#GRPO#SLERP#Function-Calling#Instruction-Following#Production-Traffic2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching본 논문은 MLLM의 시각적 인지 능력이 물리적 제어(acting) 영역까지 얼마나 확장될 수 있는지, 그리고 드론 제어 루프에서 MLLM의 역할을 어디까지 부여할 수 있는지 규명하는 것을 목표로 합니다. .#Review#Multimodal Large Language Models#Embodied AI#Drone Control#Vision-Language-Action Agents#Benchmark#Action Protocol2026년 9월 1일댓글 수 로딩 중
[논문리뷰] EM^2Mem: Event-Centric Multimodal Memory for Large Language Models본 논문은 기존의 long-video 이해 방식이 가진 정보 파편화와 인퍼런스 시점의 복잡한 정렬 문제를 해결하기 위해 EM^2^Mem을 제안합니다.#Review#Multimodal Memory#Large Language Models#Long-Video Question Answering#Event-Centric#Memory Construction#Evidence Alignment#Inference Efficiency2026년 9월 1일댓글 수 로딩 중
[논문리뷰] E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation본 논문은 기존의 에이전트 벤치마크들이 장기적 의존성과 복잡한 시장 역학을 가진 '지속적인' 비즈니스 환경을 제대로 평가하지 못한다는 문제를 해결하고자 합니다. 대부분의 기존 연구는 과업이 종료되는 에피소드 중심이거나, LLM의 확률적 생성에 의존하여 재현성이 부족한 시뮬레이션을 제공하는 한계가 있습니다.#Review#LLM Agents#Long-Horizon#E-Commerce#Deterministic Benchmarking#Autonomous Business Operation#Multi-Store Management2026년 9월 1일댓글 수 로딩 중
[논문리뷰] DramaChain Bench: An End-to-End Benchmark for Short-Drama Generation본 논문은 기존 short-drama 생성 벤치마크가 전체 생산 파이프라인의 상호의존성을 평가하지 못하고 단일 단계의 isolated 성능 측정에만 국한되는 문제를 해결합니다 .#Review#Short-drama Generation#End-to-End Benchmark#Production Pipeline#Agentic Evaluation#Spatio-temporal Attribution#Automated Metric2026년 9월 1일댓글 수 로딩 중