[논문리뷰] OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning본 논문은 에이전트 강화학습에서 outcome-based RL의 희소하고 지연된 보상이 중간 의사결정에 대한 세밀한 신용 할당(credit assignment)을 제공하지 못하는 문제를 해결합니다 .#Review#Agentic Reinforcement Learning#On-Policy Distillation#Skill Extraction#Hindsight Supervision#Hierarchical Skills#Self-Distillation#Token-level Advantage2026년 6월 25일댓글 수 로딩 중
[논문리뷰] JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting본 논문은 기존 Speculative Decoding 방식이 직면한 확장성(Scalability) 한계, 즉 '인과성-효율성 딜레마(Causality-Efficiency Dilemma)'를 해결하고자 한다 .#Review#Speculative Decoding#Parallel Tree Drafting#Causal Attention#LLM Inference#Latency Reduction2026년 6월 25일댓글 수 로딩 중
[논문리뷰] In-Context World Modeling for Robotic Control본 연구는 기존 VLA 모델들이 훈련 단계의 고정된 환경 컨텍스트에 지나치게 의존하여, 카메라 시점이나 로봇 형태가 변경되는 환경에서의 일반화(generalization) 실패 문제를 해결하고자 합니다.#Review#In-Context World Modeling#VLA models#System Identification#Robotic Control#Generalization#Zero-shot Adaptation2026년 6월 25일댓글 수 로딩 중
[논문리뷰] How Post-Training Shapes Biological Reasoning Models본 논문은 생물학적 추론 모델 개발에서 Post-Training 과정이 모델의 일반화 능력과 과잉 최적화(Over-specialization)에 미치는 영향을 체계적으로 규명한다.#Review#Biological Reasoning#Post-Training#Supervised Fine-Tuning#Reinforcement Learning#Generalization#Foundation Models2026년 6월 25일댓글 수 로딩 중
[논문리뷰] Hallucination in World Models is Predictable and Preventable본 논문은 현대의 generative world model들이 매우 사실적인 미래를 생성함에도 불구하고, 실제 동역학으로부터 이탈하는 Hallucination 문제를 해결하고자 한다.#Review#World Models#Hallucination#Data Coverage#Visual Generative Modeling#Representation Learning#Curiosity-driven Data Collection2026년 6월 25일댓글 수 로딩 중
[논문리뷰] GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents본 논문은 기존의 Computer-Use 에이전트 평가 방식이 GUI와 CLI라는 상호작용 모달리티(Modality)의 차이를 모델 성능, 작업 환경, 에이전트의 제어 능력과 혼동하고 있다는 점을 지적한다.#Review#GUI Agents#CLI Agents#Computer-Use#Skill-Mediated#Execution Bottlenecks#Benchmark#Action Space#Visual Grounding2026년 6월 25일댓글 수 로딩 중
[논문리뷰] Fast LeWorldModel본 논문은 LeWM과 같은 기존 JEPA 기반 World Model이 가진 비효율적인 계획(Planning) 과정을 개선하는 것을 목표로 합니다. 기존의 Autoregressive Rollout 방식은 미래 상태를 예측하기 위해 한 단계씩 순차적으로 모델을 호출해야 하므로 계산 비용이 매우 높습니다.#Review#Latent World Models#Visual Planning#Joint-Embedding Predictive Architectures (JEPA)#Action-Prefix Prediction#Parallel Rollout#CEM (Cross-Entropy Method)2026년 6월 25일댓글 수 로딩 중
[논문리뷰] Discretizing Reward Models본 논문은 현대의 Reward Model들이 성능 측정 지표상으로는 우수해 보이지만, 실제 Reinforcement Learning 과정에서 응답의 유용성을 과도하게 구별하는 Oversensitivity 문제로 인해 저품질 정책을 유도한다는 점을 문제로 제기합니다 .#Review#Reward Model#Reinforcement Learning#Oversensitivity#Discretization#Reward Clustering#Monte Carlo Dropout#Discriminative Ability#Specificity2026년 6월 25일댓글 수 로딩 중
[논문리뷰] DanceOPD: On-Policy Generative Field Distillation본 연구는 단일 모델이 T2I, 로컬/글로벌 에디팅 등 서로 충돌할 수 있는 다양한 생성 능력을 통합하면서도 각각의 성능을 유지해야 하는 문제를 해결하고자 합니다. 기존의 데이터 혼합(data mixing)이나 모델 결합 방식은 capability 간의 gradient 충돌을 야기하거나 성능을 희석시키는 한계를 가집니다.#Review#Generative Field Distillation#Flow Matching#On-Policy Distillation#Capability Composition#Hard-Routed Field Matching#Multi-Capability Alignment2026년 6월 25일댓글 수 로딩 중
[논문리뷰] Confidence-Aware Tool Orchestration for Robust Video Understanding본 논문은 현대의 Video-LLM들이 실세계의 다양한 시각적 열화 환경에서 프레임별 신뢰도를 무시함으로써 발생하는 Blind Trust Problem을 해결하는 것을 목표로 합니다.#Review#Video Understanding#Robustness#Tool Orchestration#GRPO#Frame Selection#Blind Trust Problem#Confidence-Aware2026년 6월 25일댓글 수 로딩 중
[논문리뷰] CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies본 논문은 기존 LLM 에이전트 벤치마크가 단일 에이전트나 동질적인 환경에 국한되어, 현실적인 경제 시스템의 복잡성을 반영하지 못하는 한계를 해결하고자 한다.#Review#LLM Agents#Long-Horizon#Multi-Agent Economy#Benchmark#Supply Chain#Decision-making2026년 6월 25일댓글 수 로딩 중
[논문리뷰] COrigami: An AI Pipeline for Co-Designing Flat-Foldable Visually Recognisable Origami본 논문은 현대의 생성형 AI가 물리적인 제약 조건과 인간의 미적 취향을 동시에 만족시키는 물리적 예술 작품을 설계하는 데 한계가 있다는 점을 지적합니다.#Review#Computational Origami#Flat-Foldable#Reinforcement Learning#Vision-Language Model#Neuro-symbolic Pipeline#Box Pleating#Crease Pattern2026년 6월 25일댓글 수 로딩 중
[sglang] SGLang의 Qwen3.5 성능 극대화: Fused QK GemmaRMSNorm + RoPE 커널 최적화 분석Qwen3.5 모델의 어텐션 레이어 연산을 Triton 커널로 통합하여 메모리 접근을 줄이고 추론 성능을 최대 9.4% 향상시킨 최적화 기법을 소개합니다.#SGLang#Triton#LLM#Optimization#Qwen3.52026년 6월 25일댓글 수 로딩 중
[논문리뷰] When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents본 논문은 LLM 에이전트가 작업 수행 시 불필요하게 높은 권한의 도구를 선택하는 Over-privileged Tool Selection의 심각성과 그 기저의 행동적 원인을 규명합니다 .#Review#LLM Agents#Tool Selection Bias#Least Privilege#Privilege-Aware Post-Training#Agent Safety#ToolPrivBench2026년 6월 24일댓글 수 로딩 중
[논문리뷰] What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics본 논문은 대규모 언어 모델(LLMs)의 안전성을 위협하는 Jailbreak 공격을 모델 내부의 활성화 상태(internal representations) 분석을 통해 효율적으로 탐지하고자 합니다. 기존 연구들은 주로 프롬프트 수준의 필터링이나 외부 분류기에 의존하여 모델 내부의 의미적 변화를 간과하는 한계가 있습니다.#Review#Jailbreak Detection#Large Language Models#Predictive Entropy#Logit Lens#Intermediate Layers#Adversarial Robustness#Uncertainty Dynamics2026년 6월 24일댓글 수 로딩 중
[논문리뷰] Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models본 논문은 실시간 오디오-비디오 인터랙션의 단절성과 모듈 간의 지연 시간 문제를 해결하기 위해 Wan-Streamer를 제안한다. 기존 연구들은 VAD, ASR, LLM, TTS 등을 결합한 캐스케이드(cascaded) 방식을 사용하여, 모듈 경계에서의 대기 시간과 오차 누적 문제에 직면해 있다 .#Review#End-to-End#Real-time Interaction#Multimodal Foundation Models#Full-duplex#Streaming Inference#Block-causal Attention#Thinker-Performer Pipeline2026년 6월 24일댓글 수 로딩 중
[논문리뷰] V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning본 논문은 Fine-grained visual reasoning 분야에서 요구되는 고비용의 RL 기반 탐색 및 대규모 텍스트 레이블 의존 문제를 해결하기 위해 제안되었습니다.#Review#Multimodal Large Language Models#On-Policy Distillation#Fine-Grained Visual Reasoning#Contrastive Evidence Gating#Visual Grounding2026년 6월 24일댓글 수 로딩 중
[논문리뷰] UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating본 논문은 기존의 다중 샷(multi-shot) 비디오 생성 모델들이 샷 간의 일관성(cross-shot coherence) 유지와 장기적인 내러티브 확장성이라는 두 가지 핵심 과제를 해결하지 못하는 문제를 다룹니다.#Review#Multi-shot Video Generation#Memory-driven#Boundary-aware Gating#Diffusion Transformer#Audio-Visual Generation2026년 6월 24일댓글 수 로딩 중
[논문리뷰] TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy기존의 Video Virtual Try-on (VVT) 연구들은 입력 영상의 카메라 궤적에 종속되어 있어, 사용자가 원하는 다양한 각도에서의 의류 확인이 불가능하다는 구조적 한계가 존재함.#Review#Video Virtual Try-on#Camera-controllable#4D Try-on Proxy#3DGS#Diffusion Transformer#CaM-VVTBench2026년 6월 24일댓글 수 로딩 중
[논문리뷰] The Hitchhiker's Guide to Agentic AI: From Foundations to Systems이 가이드는 현대 AI 시스템의 전체 스택을 이해하고 구축하고자 하는 연구자와 실무자를 위해, LLM의 기초 아키텍처부터 autonomous agentic 시스템까지를 통합적으로 설명합니다.#Review#LLM#Reinforcement Learning#Agentic AI#System Architecture#Retrieval-Augmented Generation#Chain-of-Thought#Multi-Agent Systems2026년 6월 24일댓글 수 로딩 중