[논문리뷰] Second Thought: Reasoning in Parallel as LLM Agents Act and Observe본 논문은 ReAct 기반 LLM 에이전트의 워크플로우에서 발생하는 Reasoning Idle Window가 활용되지 않는 비효율성을 해결하고자 합니다. 기존의 에이전트는 Thought 페이즈 이후 대기 상태에 빠지며, 이는 추가적인 추론 자원이 낭비되는 구간입니다.#Review#LLM Agents#ReAct#Reasoning Idle Window#Parallel Reasoning#Inference Efficiency#Atomic Thoughts2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Scaling Domain Data Repetition in LLM Pretraining본 연구는 모델 규모가 커질수록 컴퓨팅 최적화 학습을 위해 더 많은 토큰이 필요하지만, 고품질 도메인 데이터 확보가 어렵다는 불균형 문제를 해결하고자 합니다.#Review#LLM Pretraining#Data Repetition#Tokens-per-parameter Ratio#Scaling Laws#Domain Adaptation#Overfitting2026년 8월 16일댓글 수 로딩 중
[논문리뷰] SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation본 논문은 공간 인지와 추론을 분리된 태스크로 다루는 기존의 한계를 극복하고, 이를 하나의 통합된 multimodal generative framework에서 해결하고자 합니다.#Review#Multimodal Foundation Models#3D Reconstruction#Spatial Reasoning#Dense Correspondence#Generative AI#Mixture-of-Experts2026년 8월 16일댓글 수 로딩 중
[논문리뷰] PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment본 논문은 기존의 로봇 평가 방식이 가진 단순함의 한계를 극복하고, 더 정교한 프로세스 기반 평가 체계를 구축하는 것을 목표로 합니다.#Review#Embodied AI#Robot Process Assessment#Progress Reward Model#VLA#WAM#RoboDojo#RoboPulse++2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Multimodal Model Diffing for Feature Discovery and ControlProblem: MLLMs는 시각적 이해 능력이 뛰어나지만, 이러한 행동을 유발하는 내부 feature를 식별, 감사(audit) 또는 제어하기 어렵다.#Review2026년 8월 16일댓글 수 로딩 중
[논문리뷰] MobileMem: Learning from a Year of Mobile Experiences본 논문은 차세대 AI 에이전트가 단순한 질의응답을 넘어 사용자와 장기간 동행하며 지속적으로 진화하는 '개인 지능(Personal Intelligence)'을 구현해야 한다는 필요성에서 출발합니다.#Review#On-Device Memory#AI Agents#Long-Term Memory#Personalization#Mobile Computing#Multimodal Interaction2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Marionette: Predicting World States, Rendering Geometry, Painting Appearance본 논문은 기존 interactive game world models가 visual observations을 pixel 또는 latent space에서 직접적으로 autoregressive하게 생성함으로써 발생하는 일관성 및 제어 가능성 저하 문제를 해결하고자 합니다.#Review#World Models#Game Engine#Articulated Characters#Deterministic Rendering#Video Diffusion#Controllability#State Prediction2026년 8월 16일댓글 수 로딩 중
[논문리뷰] LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure본 논문은 현대 LLM이 방대한 web-scale 데이터로 학습되어 prior knowledge와 실제 학습된 capability 간의 경계가 불투명하다는 문제를 해결하고자 한다.#Review#LLM#Pretraining#Curriculum Learning#Data Contamination#Educational Sandbox#Capability Boundary2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Latent On-Policy Self-Distillation본 논문은 기존 OPSD 방식이 의존하는 수작업(hand-crafted) 방식의 privileged context가 모델의 확장성과 범용적 자가 진화(self-evolving)를 저해하는 핵심 병목임을 지적합니다.#Review#On-Policy Self-Distillation#Latent Context#Agent Evolution#Reinforcement Learning#End-to-End Learning#Privileged-Margin Constraint2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning본 논문은 기존 Transformer 아키텍처의 지식 저장과 추론 연산이 강하게 결합된 구조적 한계와 이로 인한 비효율성을 해결하기 위해 제안되었습니다.#Review#Foundation Models#Knowledge-Reasoning-Decoupling#Latent Reasoning#Backward Residual Connection#Inference Efficiency#Chain-of-Thought2026년 8월 16일댓글 수 로딩 중
[논문리뷰] HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark본 논문은 기존의 휴머노이드 모션 트래킹 평가 방식이 실제 인간이 비디오에서 인지하는 모션 품질과 일치하지 않는다는 근본적인 문제를 해결하고자 한다.#Review#Humanoid Motion Tracking#Benchmark#Preference-Aligned Evaluation#HumanScore#Reward Model#Motion Taxonomy#Teleoperation#Whole-Body Imitation2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction본 논문은 MLLM에서 시각적 이해와 생성이 서로 분리된 목표로 다뤄지며, 기존의 생성 학습이 모델의 고차원적 이해 능력을 저해하는 문제를 해결하고자 합니다.#Review#Multimodal Large Language Models#Visual Understanding#Auxiliary Supervision#Next Embedding Prediction#Mixture-of-Transformers#Representation Learning2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Forecast Collapse in Time-Series Foundation Models본 연구는 대규모 사전 학습된 Time-Series Foundation Models (TSFMs)가 주식 수익률 예측과 같은 낮은 신호 대 잡음비(low signal-to-noise ratio) 환경에서 예측값이 거의 0에 수렴하는 Forecast Collapse를 보이는 원인을 규명합니다.#Review#Time-Series Foundation Models#Forecast Collapse#Calibration-Ranking Tradeoff#CalibRank#Information Coefficient2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Dion3: Full-Stack Orthogonal Updates본 논문은 최신 LLM 학습에서 탁월한 성능을 발휘하는 Muon 옵티마이저가 겪는 높은 계산 및 통신 비용 문제를 해결하기 위해 고안되었습니다.#Review#Muon Optimizer#Orthogonalization#Newton-Schulz#Gram Matrix#GPU Kernels#Distributed Training#Low-rank Approximation2026년 8월 16일댓글 수 로딩 중
[논문리뷰] DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data본 논문은 현대 대규모 언어 모델(LLM) 개발이 대규모의 비허가 데이터에 의존함으로써 발생하는 높은 진입 장벽과 윤리적 문제를 해결하는 것을 목표로 합니다.#Review#Language Model#HRM-Text#Permissible Data#Danish Foundation Models#Synthetic Datasets#Instruction Tuning2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Claim-Level Reliability Assessment for Efficient Test-Time Reasoning본 논문은 LLM의 Test-Time Scaling 과정에서 발생하는 신뢰성 평가의 불투명성과 계산 자원의 비효율성 문제를 해결하고자 합니다.#Review#Test-Time Reasoning#Reliability Assessment#Falsification#Chain-of-Thought#LLM#Consensus#Inference Scaling2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination본 논문은 전쟁, 재난, 공공 보건 위기 등 사회적 파급력이 큰 사건을 묘사하는 AI 생성 영상의 위험성을 탐지하기 위한 기존 방어 체계의 한계를 해결하고자 합니다. 기존 연구들은 일반적인 영상 생성물에 대한 탐지에 집중하고 있어, 위기 상황에서의 실제적인 오용 사례에 대한 데이터가 부족합니다 .#Review#AI-Generated Video#Detection#RA-Bench#Crisis Events#Social Dissemination#Multimodal Large Language Models (MLLMs)2026년 8월 16일댓글 수 로딩 중
[논문리뷰] CPI-Bench: A Comprehensive,Practical and Intelligent Benchmark for Real-World Image Editing본 논문은 현대의 고도화된 이미지 편집 모델들이 실제 생산 환경에 배포되고 있음에도 불구하고, 기존 벤치마크 시스템은 여전히 단순한 단일 이미지 작업에만 머물러 있다는 문제점을 지적합니다.#Review#Image Editing Benchmark#Multi-Image Editing#Real-World Application#Vision-Language Models#Human-Preference Alignment#Reasoning-based Editing2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development현재 Long-Horizon AI R&D 분야의 Autonomous Agent 평가 방식은 주로 단일 최종 점수 (single final score)에 의존하며, 이는 Agent가 연구 Loop 내에서 왜 성공하거나 실패하는지에 대한 상세한 진단 정보를 제공하지 못하는 근본적인 한계가 있다.#Review#Autonomous Agents#AI Research#Long-Horizon Tasks#Systematic Evaluation#Process Metrics#Experience Reuse#Harness Design#Solution Novelty2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems본 논문은 임상 의사결정 지원 시스템(Clinical Decision Support)에서 다수 LLM Agent가 협력할 때 발생하는 시스템적인 오류 전파 문제인 Shortcut Cascade와 Benchmark Gaming을 다룬다.#Review#Multi-Agent Systems#Clinical Decision Support#Shortcut Learning#Benchmaxxing#Agentic Oversight#Contagion#Referee Agent2026년 8월 16일댓글 수 로딩 중