[논문리뷰] Lance: Unified Multimodal Modeling by Multi-Task Synergy본 논문은 기존 멀티모달 모델들이 이해와 생성이라는 두 가지 이질적인 목적을 통합할 때 발생하는 성능 저하와 작업 범위의 한계를 해결하기 위해 제안되었습니다.#Review#Unified Multimodal Modeling#Multi-Task Synergy#Dual-Stream Architecture#Modality-Aware Rotary Positional Encoding#Autoregressive Modeling#Flow Matching2026년 5월 18일댓글 수 로딩 중
[논문리뷰] KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration기존의 비디오 생성 모델 정렬 기법들은 주로 노이즈 기반의 탐색(exploration)이나 SDE 기반의 surrogate policy를 사용하여, 결정론적(deterministic) ODEdynamics로 작동하는 distilled AR 모델의 특성과 상충하는 문제를 야기합니다 .#Review#Autoregressive Video Generation#Reinforcement Learning#Policy Optimization#Flow Matching#KV Caching#Causal-Semantic Exploration#Trajectory Velocity Energy2026년 5월 18일댓글 수 로딩 중
[논문리뷰] Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models본 논문은 현대적인 대화형 비디오 세계 모델들이 가진 구조적 한계인 Action Interface의 고착화 문제를 해결합니다.#Review#Interactive Video World Model#Natural Language Action Interface#Multi-Entity Control#Cross-Entity Transfer#Streaming Inference#Self-Forcing Distillation2026년 5월 18일댓글 수 로딩 중
[논문리뷰] Geometric Phase Transition Enables Extreme Hippocampal Memory Capacity본 연구는 생물학적 기억 체계가 어떻게 뉴런의 물리적 증식 없이도 정보 용량을 획기적으로 확장하는지 해결하고자 합니다.#Review#Hippocampal Memory#Geometric Stability#Neural Manifold#Population Code#Excitatory-Inhibitory Dynamics#Crystalline Code2026년 5월 18일댓글 수 로딩 중
[논문리뷰] GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions본 논문은 현재 MLLMs가 다중 인원 비디오에서 미묘한 비언어적 단서에 기반한 사회적 추론을 수행하는 데 어려움을 겪는 문제를 해결합니다.#Review2026년 5월 18일댓글 수 로딩 중
[논문리뷰] From Runnable to Shippable: Multi-Agent Test-Driven Development for Generating Full-Stack Web Applications from Requirements본 논문은 현재의 코딩 에이전트가 웹 애플리케이션 생성 시 겪는 70% 이상의 기능적 요구사항 미충족 문제를 해결하는 것을 목표로 합니다. 기존의 에이전트는 코드 파일이나 터미널 출력만을 기반으로 검증을 수행하지만, 웹 애플리케이션의 정확성은 브라우저 환경에서의 동적 상호작용을 통해서만 평가될 수 있습니다 .#Review#Multi-Agent System#Test-Driven Development#Web Development#Code Generation#Closed-Loop Validation#Large Language Model2026년 5월 18일댓글 수 로딩 중
[논문리뷰] FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models본 논문은 기존의 금융 벤치마크가 지닌 한계를 극복하고 LLM의 실질적인 금융 전문 역량을 정밀하게 진단하기 위해 FINESSE-Bench를 제안한다.#Review#Large Language Models#Financial Benchmarking#Difficulty Hierarchy#Technical Analysis#LLM-as-Judge#Professional Competence#Financial Reasoning2026년 5월 18일댓글 수 로딩 중
[논문리뷰] Evaluating Cognitive Age Alignment in Interactive AI Agents본 논문은 최첨단 MLLM 에이전트가 높은 태스크 정확도에도 불구하고 실제 아동과의 상호작용에서 인지적 수준이 맞지 않는 설명을 제공하거나 과도하게 복잡한 추론을 시도하는 문제를 해결하고자 한다.#Review#Cognitive Age Alignment#MLLM Agents#ChildAgentEval#Developmental Psychology#Skill-Guided Distillation#WISC#Interactive Evaluation2026년 5월 18일댓글 수 로딩 중
[논문리뷰] EndPrompt: Efficient Long-Context Extension via Terminal Anchoring본 논문은 LLM의 컨텍스트 윈도우 확장이 요구하는 막대한 계산 자원과 데이터 수집의 어려움을 해결하기 위해 EndPrompt를 제안합니다.#Review#Long-Context Extension#EndPrompt#Terminal Anchoring#Positional Interpolation#RoPE#Transformer#Sparse Supervision2026년 5월 18일댓글 수 로딩 중
[논문리뷰] E-PMQ: Expert-Guided Post-Merge Quantization with Merged-Weight Anchoring본 논문은 모델 병합(Model Merging) 후 저비트 양자화(Low-bit Quantization)를 적용할 때 발생하는 성능 저하 문제를 해결하고자 합니다.#Review#Post-Merge Quantization#Model Merging#PTQ#Quantization Deviation#Merged-Weight Anchoring#Expert-Guided Calibration2026년 5월 18일댓글 수 로딩 중
[논문리뷰] CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection본 논문은 기존 Chunked Prefill 환경에서 Block-Sparse Attention 및 Query-Subsampled KV Selection 방식이 가진 성능 한계를 극복하기 위해 CompactAttention을 제안합니다.#Review#Chunked Prefill#KV Selection#Block-Sparse Attention#Paged Attention#Zero-Copy Execution#Long-Context LLM2026년 5월 18일댓글 수 로딩 중
[논문리뷰] Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis본 논문은 기존의 text-driven 3D 생성 방식이 갖는 공간적 정보의 불명확성과, 기존 agentic 프레임워크가 holistic room generation 과정에서 직면하는 무한 루프 및 불안정성 문제를 해결하고자 합니다.#Review#Agentic AI#3D Room Synthesis#MLLM#Blender Code#Execution Harness#Cross-stage Memory#Top-down View2026년 5월 18일댓글 수 로딩 중
[논문리뷰] Code as Agent Harness본 논문은 LLM 기반 에이전트 시스템에서 코드가 단순한 생성 대상(target artifact)을 넘어, 시스템의 핵심 운영 인프라로 전환되고 있다는 점을 지적한다.#Review#Agent Harness#Coding Agent#Harness Engineering#Agentic AI#Code-as-Agent-Harness#Executable Verification2026년 5월 18일댓글 수 로딩 중
[논문리뷰] CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?본 논문은 현대 의료 운영 시스템의 핵심 워크플로우인 사전 승인(Prior Authorization), 이용 관리(Utilization Management), 케어 관리(Care Management)를 자동화하려는 AI 에이전트들의 실질적인 한계를 규명합니다.#Review#Healthcare AI#AI Agents#Policy-Rich Workflows#Long-Horizon#Benchmark#Managed-Care Operations#Model Context Protocol2026년 5월 18일댓글 수 로딩 중
[논문리뷰] AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents본 연구는 기존 VLM 에이전트가 긴 호흡의 공간적 과업(long-horizon spatial tasks)을 수행할 때 발생하는 '공간적 맹목(spatial blindness)'과 '모달리티 불일치(modality mismatch)' 문제를 해결합니다.#Review#VLM Agents#Visual Skill Memory#Reinforcement Learning#Reward Shaping#Spatial Reasoning#Self-Evolving2026년 5월 18일댓글 수 로딩 중
[논문리뷰] AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents본 연구는 GPU 커널 최적화 작업이 딥러닝 시스템의 효율성에 핵심적임에도 불구하고, 기존 벤치마크들이 이를 충분히 포괄하지 못한다는 문제 의식에서 출발합니다.#Review#GPU Kernel Optimization#AI Coding Agents#Generalization#Performance Benchmarking#Triton#HIP#LLM Evaluation2026년 5월 18일댓글 수 로딩 중
[논문리뷰] Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces본 논문은 LLM 기반의 자율 에이전트가 시장에서 상호작용할 때 발생하는 체계적인 경제적 리스크를 해결하고자 한다. 기존의 AI 정렬 방식은 개별 에이전트의 사실성이나 무해성에만 집중할 뿐, 다수의 에이전트가 상호작용하며 만드는 시장 수준의 불안정성을 제어하지 못한다.#Review#Multi-Agent Systems#Economic Alignment#Large Language Models#Simulation Framework#Market Stability#Reinforcement Learning2026년 5월 18일댓글 수 로딩 중
[논문리뷰] Actionable World Representation본 논문은 물리 세계의 역학을 효과적으로 modeling하고 제어할 수 있는, 신뢰성 있는 디지털 트윈(Digital Twin)을 구축하는 문제를 해결하고자 합니다.#Review#Physical World Models#Digital Twin#Neural Implicit Representation#Actionable Representation#Deformation Modeling2026년 5월 18일댓글 수 로딩 중
[논문리뷰] AI for Auto-Research: Roadmap & User Guide본 논문은 AI가 연구의 전 과정을 자동화할 수 있는 단계에 이르렀으나, 이로 인해 발생하는 심각한 연구 무결성(Integrity) 문제를 해결하고자 합니다.#Review#AI-assisted research#Research Lifecycle#Autonomous Agents#Scientific Integrity#End-to-End Analysis#Research Integrity2026년 5월 18일댓글 수 로딩 중
[논문리뷰] A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation현재 Large Language Models (LLM)의 추상적 추론 능력 평가는 진정한 추론 요구와 벤치마크 확장성 사이의 근본적인 trade-off에 직면해 있다.#Review#Abstract Reasoning#LLM Evaluation#Cycle Consistency#Benchmark Generation#Formal Verification#Task Expansion#Cognitive Analysis2026년 5월 18일댓글 수 로딩 중