[논문리뷰] SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation본 논문은 기존 로봇 조작 벤치마크들이 과업 완료(Task Success) 여부만 평가하여, 실제 물리적 상호작용의 질적 수준을 간과하고 있다는 문제점을 해결하고자 합니다 .#Review#Deformable-Object Manipulation#Visuo-Tactile#Dataset#Benchmark#Deformation-aware Success Rate#Finite-Element Method (FEM)2026년 8월 19일댓글 수 로딩 중
[논문리뷰] SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents본 논문은 에이전트가 중도에 스스로 스킬을 선택하는 In-policy skill selection 과정에서 발생하는 효율성 저하 문제를 해결합니다. 기존의 보상 기반 RL은 실행 단계의 outcome에만 집중하여, 정작 중요한 선택 단계에 기여하는 토큰들에게는 거의 학습 신호가 전달되지 않는다는 치명적인 한계가 있습니다.#Review#In-Policy Skill Selection#Long-Horizon Agents#Reinforcement Learning#Credit Assignment#Policy Gradient#Agentic Benchmarks2026년 8월 19일댓글 수 로딩 중
[논문리뷰] SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation본 논문은 기존의 LLM 기반 PLC 코드 생성 연구들이 주로 독립적인 POU 단위의 생성에 머물러 있어, 실제 산업 현장에서 필수적인 프로젝트 통합성과 정확한 런타임 동작을 보장하지 못한다는 문제를 해결하고자 한다.#Review#PLC#Code Generation#Agentic Workflow#Project Grounding#Formal Verification#Runtime Validation#IEC 61131-32026년 8월 19일댓글 수 로딩 중
[논문리뷰] SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation본 연구는 현존하는 Video Generation 모델들이 시각적 품질이나 시간적 일관성은 뛰어나지만, 사용자의 구체적인 작업 목표를 달성하는 능력은 제대로 평가받지 못하고 있다는 문제 인식에서 출발합니다.#Review#Semantic Task Completion#Video Generation#Semantic Grounding#Outcome Achievement#Generation Reliability#VLM-based Evaluation2026년 8월 19일댓글 수 로딩 중
[논문리뷰] Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion본 논문은 기존 LLM의 창작 데이터가 지나치게 story-centric 데이터에 편중되어 있어, 다양한 창작물의 구조적·형식적 요구사항을 충족하지 못하는 한계를 해결하고자 합니다.#Review#Creative writing#Synthetic data generation#Large language models#Multi-genre datasets#Attribute-guided expansion2026년 8월 19일댓글 수 로딩 중
[논문리뷰] SPADE: Self-Play in Adaptive Synthetic Executable Environments본 연구는 LLM 에이전트의 지속적인 성능 향상을 가로막는 환경(Environment) 공급의 병목 현상을 해결하고자 합니다. 기존의 수작업으로 구축되거나 고정된 합성 환경은 에이전트가 학습함에 따라 한계에 도달하며, 모델의 능력이 발전해도 새로운 도전 과제를 제공하지 못한다는 한계가 있습니다.#Review#Self-Play#LLM#Environment Design#Reinforcement Learning#Code-as-Environment#Agentic AI2026년 8월 19일댓글 수 로딩 중
[논문리뷰] OmniScientist: An Omni-Modal Omni-Discipline AI Scientist본 논문은 기존 AI 과학자들이 데이터의 원시적인 구조(spatial, temporal, cross-channel relations)를 보지 못하고, 미리 가공된 텍스트나 요약본에 의존하는 'evidence-incomplete' 상태에 머물러 있다는 문제를 해결하고자 합니다.#Review#AI Scientist#Multimodal Agents#Autonomous Research#Scientific Discovery#LLM Agents#Tool Use2026년 8월 19일댓글 수 로딩 중
[논문리뷰] Looped Language Models Improve Compositional Tool Calling본 논문은 Looped Language Models가 에이전트 환경의 Compositional Tool Calling에서 가질 수 있는 잠재적인 성능 향상을 규명하고자 합니다. 기존의 LLM 기반 에이전트 시스템은 복잡한 API 호출 시 다단계 계획 수립과 종속성 보존에 어려움을 겪는 경우가 많습니다.#Review#Looped Language Models#Compositional Tool Calling#Recurrent Depth#Adaptive Inference#Agentic Systems#Latent Computation2026년 8월 19일댓글 수 로딩 중
[논문리뷰] FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents본 논문은 기존의 LLM 에이전트 벤치마크가 단기적이고 고정된 환경의 작업에만 국한되어, 현실적인 '관리(Management)' 능력을 측정하지 못한다는 한계에서 출발합니다.#Review#Long-Horizon#Management#Multi-Agent#LLM Agents#Benchmark#Behavioral Analysis2026년 8월 19일댓글 수 로딩 중
[논문리뷰] Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning본 논문은 JEPA 스타일의 잠재 월드 모델에서 나타나는 정보적 충실도와 실제 제어 성능 사이의 괴리 문제를 해결하고자 합니다. 기존 연구들은 잠재 공간의 정보적 완결성(예: 선형 프로브 정확도)에 집중했으나, 이는 실제 MPC 계획 시 후보 계획의 순위를 매기는 기하학적 구조를 보장하지 못합니다 .#Review#Latent World Models#MPC#Decision-Metric Alignment#Representation Learning#Robotic Manipulation#Auxiliary Objectives2026년 8월 19일댓글 수 로딩 중
[논문리뷰] Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL본 논문은 Reinforcement Learning을 활용한 추론 성능 향상 과정에서 발생하는 Ground-truth Supervision 의존성과 Self-rewarding RL의 구조적 한계를 해결하고자 합니다.#Review#Multi-agent Reinforcement Learning#Unsupervised Reasoning#Co-RL#Cross-agent Supervision#GRPO#Training Collapse#Cohort Diversity2026년 8월 19일댓글 수 로딩 중
[논문리뷰] aDSL: Agentic 3D Creation via Joint Agent-Program Design본 논문은 기존의 LLM 기반 3D 생성 방식이 상위 수준의 사용자 의도를 정밀한 3D 기하학적 구조로 변환하는 데 실패하는 불완전성을 해결하는 것을 목표로 합니다.#Review#3D Creation#Domain-Specific Language (DSL)#LLM Agents#Programmatic Representation#Spatial Reasoning#Joint Design2026년 8월 18일댓글 수 로딩 중
[논문리뷰] V-RAE: Rethinking Video Latent Spaces for Generation본 논문은 현대의 잠재 기반 비디오 생성(Latent video generation)이 인코더의 픽셀 단위 재구성 최적화에만 치우쳐 생성 모델링에 불리한 잠재 공간을 형성한다는 문제점을 제기합니다.#Review#Video Generation#Latent Space#Autoencoder#Temporal Pooling#Frozen Foundation Model#Rectified Flow#tFVD2026년 8월 18일댓글 수 로딩 중
[논문리뷰] Unifying Graph Neural Networks Through a Common Layer Equation본 논문은 GNN 연구 분야의 파편화된 아키텍처 표기법이 연구 간의 비교와 기술적 이해를 저해하는 문제를 해결하고자 합니다. 기존 방식은 특정 모델 군(family-specific)마다 서로 다른 수식과 표기법을 사용하여, 서로 다른 아키텍처 간의 공유된 계산 구조와 본질적인 차이를 은폐합니다.#Review#Graph Neural Networks#Layer Equation#Architectural Unification#Propagation Bank#Message Map#Component-level Attribution#Identifiability Framework2026년 8월 18일댓글 수 로딩 중
[논문리뷰] StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows본 논문은 기존의 에이전트 벤치마크가 단일 태스크나 지나치게 단순화된 시나리오에 치중되어 있어, 실제 산업계에서의 복잡한 End-to-End 업무 수행 능력을 충분히 반영하지 못한다는 한계를 지적합니다.#Review#General-Purpose Agents#Benchmark#End-to-End Workflows#Market-Validated#Agent Evaluation2026년 8월 18일댓글 수 로딩 중
[논문리뷰] Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection본 논문은 DeepSeek Harness (DSH) 프레임워크를 대상으로 indirect prompt injection에 대한 보안 취약점을 체계적으로 평가하는 것을 목표로 한다.#Review#Indirect Prompt Injection#LLM Agent Security#DeepSeek Harness#A.I.G (AI-Infra-Guard)#Source-to-Sink Analysis#Red Teaming#Runtime Assessment2026년 8월 18일댓글 수 로딩 중
[논문리뷰] PixRestore: Unified Image Restoration via Pixel Diffusion Transformer본 논문은 기존의 대규모 Text-to-Image(T2I) latent diffusion model을 기반으로 한 UIR 방식이 안고 있는 정보 손실과 비효율성 문제를 해결하고자 합니다.#Review#Image Restoration#Pixel Diffusion#Degradation-Aware#DINO#Unified Image Restoration#Flow Matching#Transformer2026년 8월 18일댓글 수 로딩 중
[논문리뷰] Personalized Auto-Research: Towards a True AI Co-Scientist본 논문은 현대의 AI Co-scientist 시스템이 지닌 구조적 한계인 Researcher-Agnostic 성향을 극복하기 위해 Personalized Auto-Research를 제안합니다.#Review#Auto-research#AI Co-scientist#Personalization#Graph-grounded Representation#Scientific Discovery2026년 8월 18일댓글 수 로딩 중
[논문리뷰] MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding본 연구는 대규모 Vision 모델의 성능 향상과 실시간 처리 능력 간의 상충 관계(Trade-off)를 해결하기 위해 MoE-ViE를 제안합니다.#Review#Mixture of Experts#Vision Encoder#Computer Vision#Parameter Efficiency#Inference Latency#Multi-modal Learning2026년 8월 18일댓글 수 로딩 중
[논문리뷰] MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement본 연구는 기존 autoformalization 모델들이 수학적 개념을 Mathlib의 복잡한 타입 시스템에 매핑하는 과정에서 겪는 한계와, 정적인 데이터 생성 방식의 구조적 문제를 해결하고자 합니다.#Review#Autoformalization#Lean 4#Knowledge Retrieval#Iterative Refinement#FormalVerse#Reinforcement Learning2026년 8월 18일댓글 수 로딩 중