[논문리뷰] Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures본 논문은 배포된 언어 모델(Language Models, LLMs)에서 AI Alignment Failures를 정확하고 비용 효율적으로 탐지하는 것의 중요성을 강조합니다.#Review#AI Alignment#Reinforcement Learning for Calibrated Decisions (RLCD)#Zero-Shot Detection#Alignment Failures#Language Models#Benchmarking#Calibration#Cost-Efficiency2026년 9월 24일댓글 수 로딩 중
[논문리뷰] IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis본 논문은 기존의 ReAct 스타일 딥 서치 에이전트가 겪는 '역할 결합(Role Coupling)'과 '컨텍스트 누적(Context Accumulation)' 문제를 해결하는 것을 목적으로 합니다.#Review#Deep Search Agents#Role-Decoupling#Iterative Synthesis#Reinforcement Learning#Long-horizon Reasoning#Policy Optimization#Language Models2026년 9월 24일댓글 수 로딩 중
[논문리뷰] ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds``json [ { 'figure_id': 'Figure 2', 'image_url': 'https://arxiv.org/html/2609.30199v1/explorationbench_overview.png', 'caption_kr': 'ExplorationBench 프레임워크' }, { 'figure_id': 'Figure 3', 'image_url'…#Review2026년 9월 24일댓글 수 로딩 중
[논문리뷰] DeltaWAM: Delta World Action Models for Bimanual Manipulation본 논문은 기존 WAM이 매 관측 단계마다 고차원 비디오를 생성하거나 dense한 비디오 표현을 반복적으로 처리함으로써 발생하는 계산 비효율성과 비효율적 추론 문제를 해결하고자 합니다.#Review#World-Action Models#Bimanual Manipulation#Visual Deltas#Streaming Delta Memory#Flow Matching#Robot Control#Efficiency2026년 9월 24일댓글 수 로딩 중
[논문리뷰] Coding Agents for Generalized Task and Motion Planning Problems본 논문은 최첨단 Coding Agents가 Task and Motion Planning (TAMP) 문제의 제약된 조작(constrained manipulation)을 해결할 수 있는 범위를 탐구한다.#Review#Coding Agents#Generalized Task and Motion Planning (TAMP)#Program Synthesis#Physical Reasoning#Large Language Models (LLMs)#Simulation-based Learning#Robotics2026년 9월 24일댓글 수 로딩 중
[논문리뷰] AgentKernel: The Trust-Native Agentic Operating System현대 AI 에이전트들은 untrusted web content를 수집하고, privileged system instructions와 융합하며, 중간 결과(intermediate beliefs)를 영구 메모리에 저장하고, privileged tools을 호출하는 등 신뢰 경계(trust boundaries)를 빈번하게 넘나든다.#Review#Agent Operating System#AI Agent Security#Trust-Native#Semantic Mediation#Information Flow Control#eBPF#Prompt Injection#Delegation2026년 9월 24일댓글 수 로딩 중
[논문리뷰] Agent-Editing World Model: Rethinking World Modeling for LLM Agents본 논문은 Long-Horizon Task를 수행하는 LLM Agent의 성능 향상을 위한 기존 Language World Model의 한계점과 Agent Trajectory에서 발생하는 Task-State Contamination 문제를 제기한다.#Review#LLM Agents#World Models#Agent State Editing#Task-State Contamination#Action Judge#State Revision#EditAct2026년 9월 24일댓글 수 로딩 중
[논문리뷰] AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation본 논문은 기존 Joint Audio-Video Generation 모델들이 Per-modality Fidelity 부족, Text-Modality Alignment 미흡, 그리고 Cross-Modal Synchronization의 약점이라는 문제점을 겪고 있음을 지적한다.#Review#Joint Audio-Video Generation#Reinforcement Learning#Diffusion Models#Policy Optimization#Cross-Modal Synchronization#Modality-Anchored Learning#Credit Assignment#Multimodal Generative Models2026년 9월 24일댓글 수 로딩 중
[논문리뷰] Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts본 논문은 Omni-modal Large Language Models (OLLMs)의 cross-modal conflict 상황에서의 modality bias 문제가 충분히 탐구되지 않았음을 지적합니다.#Review#Modality Bias#Omni-Modal LLMs#Perceptual Evidence#Propositional Evidence#Tri-modal Benchmark#Cross-modal Conflict#Contrastive Decoding#Representation Analysis2026년 9월 22일댓글 수 로딩 중
[논문리뷰] The Tasteful Agent: Measuring and Improving Taste in Long-Horizon TasksLLM agents increasingly engage in long-horizon tasks, where intermediate decisions significantly impact the final outcome.#Review#LLM Agents#Long-Horizon Tasks#Decision Forks#Taste-Bench#Automated Evaluation#Knowledge Distillation#Software Engineering Tasks#Machine Learning Research2026년 9월 22일댓글 수 로딩 중
[논문리뷰] StableVQ: Practical Guidelines for Stable Vector-Quantized Tokenizer Training본 논문은 최신 생성 비전 시스템의 핵심 구성 요소인 Vector Quantization (VQ) 기반 이산 시각 토크나이저의 훈련 안정성(training stability) 문제를 해결한다.#Review#Vector Quantization#Tokenizer Training#Training Stability#Codebook Utilization#Shared-Projection#Dynamic STE#Region VQ Loss#Decoupled Schedule2026년 9월 22일댓글 수 로딩 중
[논문리뷰] RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents본 논문은 현대 embodied agents의 높은 task success rate가 실제 instruction-following 능력과는 괴리가 있을 수 있다는 문제를 제기한다.#Review#Embodied Artificial Intelligence#Vision-Language-Action Models#World Action Models#Instruction Following#Scene Entropy#Diagnostic Benchmark#Generalization#Robotic Manipulation2026년 9월 22일댓글 수 로딩 중
[논문리뷰] Recursive self-improvement of AI research agents본 논문은 AI 에이전트가 AI 스택 전반의 연구 개발(R&D)을 자동화하고 가속화하고 있지만, 이러한 산출물을 생성하는 연구 프로세스 자체의 효율성은 고정되어 있다는 핵심 문제를 제기합니다.#Review#Recursive Self-Improvement#AI Research Agents#Harness Layer#Bi-level Optimization#Reward Hacking#Search Policy#Context Management2026년 9월 22일댓글 수 로딩 중
[논문리뷰] RULER: Instance-aware Rubric Rewards for SVG Generation본 논문은 Scalable Vector Graphics (SVG) 코드를 자연어 명령으로부터 생성하는 개방형(open-ended) 작업에서 신뢰할 수 없는 평가 지표와 불충분한 훈련 신호 문제를 해결하고자 한다.#Review#SVG Generation#Reinforcement Learning#Rubric Rewards#Instance-aware#VLM-as-Judge#Reward Hacking#Visual Code2026년 9월 22일댓글 수 로딩 중
[논문리뷰] Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings본 논문은 현대 정보 저장소가 텍스트, 이미지, 비디오, 오디오 등 다양한 모달리티를 통합함에 따라 발생하는 Any-to-Any Retrieval의 요구사항을 해결하고자 한다.#Review#Omni-Modal Embeddings#Any-to-Any Retrieval#Multimodal Backbone#Contrastive Learning#Embedding Distillation#Elastic Embeddings#Homogeneous-Source Sampling2026년 9월 22일댓글 수 로딩 중
[논문리뷰] Lean Pool: An AI-Maintained Archive of Formalized Mathematics본 논문은 AI 시스템이 수학적 연구에 기여하는 속도가 인간의 이해 및 검증 속도를 초과함에 따라 발생하는 Formal Proof의 재활용 및 지속 가능성 문제를 해결하고자 Lean Pool을 제안한다.#Review#Formalized Mathematics#AI Agents#Lean#Mathlib#Archive#Proof Verification#Automated Maintenance#Compilation Optimization2026년 9월 22일댓글 수 로딩 중
[논문리뷰] LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay기존 언어 모델(LLM) 스위칭 방식은 수신 모델이 historical prefix를 재인식하고 inference state를 재구축해야 하는 비효율성을 내포한다.#Review#Hybrid Language Models#Cross-Model Transfer#Recurrent Memory#KV Cache#Gated DeltaNet (GDN)#Persistent State#Negative Log-Likelihood (NLL)#Prefix Replay2026년 9월 22일댓글 수 로딩 중
[논문리뷰] JEV-as-a-Judge: Accept When Confident, Escalate When Unsure본 논문은 LLM-as-a-Judge 기반 평가 시스템의 Inference Cost와 Confidence Reliability 문제를 해결하기 위해 JEV-as-a-Judge를 제안합니다.#Review#LLM-as-a-judge#Confidence Calibration#Decision-only Judge#Evaluation Cost#Escalation Policy#Reward Models#Factuality2026년 9월 22일댓글 수 로딩 중
[논문리뷰] ImIR: Image-Instruction Tuning for All-in-One Image Restoration본 논문은 다양한 이미지 degradation에 효과적으로 대응할 수 있는 all-in-one image restoration 시스템의 필요성을 제기합니다.#Review#all-in-one image restoration#image editing models#parameter-efficient fine-tuning#image-derived conditioning#controllable restoration2026년 9월 22일댓글 수 로딩 중
[논문리뷰] Geometric and Semantic Coupling for Interaction Understanding in 3D Scenes본 논문은 정적(Static) 3D 장면 관측을 통해 Movable Parts, 이들의 Motion, 그리고 조작 가능한 영역(Handles)을 공동으로 파악하는 3D 상호작용 이해(Interaction Understanding)의 핵심 문제를 다룹니다. 이 과제는 두 가지 주요 모호성으로 인해 난이도가 높습니다.#Review#3D interaction understanding#part-handle coupling#part segmentation#motion estimation#geometric motion decoding2026년 9월 22일댓글 수 로딩 중