[논문리뷰] SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring본 논문은 기존 소프트웨어 엔지니어링 벤치마크가 포화 상태에 도달하고, 다수의 불완전한 테스트 케이스와 데이터 오염 문제로 인해 실제 모델의 능력을 변별하기 어려워짐에 따라 SWE-Bench ProMax를 제안한다.#Review#Code Refactoring#AI Agents#Software Engineering#Multilingual Benchmark#Long-horizon Evaluation#Agentic Workflow2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution본 논문은 기존 Coding Agent들이 고정된 Harness 하에서만 동작하여 성능 향상에 한계가 있다는 문제점을 해결하고자 한다.#Review#Self-evolving Agents#Coding Agent#Agentic Workflow#Frontier Model#Operational Safety#Recursive Evolution#Version Control2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Progressive Agent Skill Generation via Reinforcement Learning본 연구는 LLM 에이전트가 외부 스킬을 통해 복잡한 태스크를 수행할 때 발생하는 자동화된 고품질 스킬 생성의 어려움을 해결하고자 합니다.#Review#LLM Agents#Reinforcement Learning#Skill Generation#Rollback Reward#Progressive Editing#GRPO#Agentic Workflow2026년 8월 3일댓글 수 로딩 중
[논문리뷰] DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents본 논문은 기존의 MLLM 기반 검색 에이전트가 지닌 고정된 파라미터 지식의 한계와 복잡한 장기적(long-horizon) 검색 과제에서의 부적합성을 해결하고자 합니다.#Review#Multimodal Large Language Models#Long-Horizon Search#Vision-in-the-Loop#Multimodal Event Graph#Active Visual Acquisition#Agentic Workflow2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale본 논문은 기존의 Live-web 기반 벤치마크가 Computer-Use Agent 학습 및 평가에 가지는 근본적인 한계를 해결하고자 한다.#Review#Computer-Use Agent#Reinforcement Learning#Synthetic Environments#Co-evolution Loop#Grounded Grading#Agentic Workflow2026년 7월 30일댓글 수 로딩 중
[논문리뷰] AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents본 논문은 LLM Agent에서 발생하는 오류의 가시성 부족과 근본 원인 분석의 어려움을 해결하기 위해 AgentDebugX를 제안합니다. 복잡한 Agent 환경에서는 최종 오류가 발생한 시점과 실제 원인이 된 행동의 시점이 일치하지 않는 경우가 많아, 단순한 Trace replay만으로는 디버깅에 한계가 있습니다.#Review#LLM Agents#Debugging#Observability#Root-Cause Attribution#Error Recovery#Agentic Workflow#Closed-Loop System2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Recursive Harness Self-Improvement본 논문은 foundation model과 harness의 공동 진화(co-evolution) 과정에서, 수작업으로 생성된 harness의 최적화가 어렵고 비용이 많이 든다는 문제를 해결하고자 합니다.#Review#Recursive Harness Self-Improvement#RHI#Agentic Workflow#Test-time Scaling#Prompt-level Optimization#Co-evolution2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Cura 1T: Specialized Model for Agentic Healthcare본 논문은 환자 상담, 임상 추론, EHR 워크플로우 수행이라는 복합적인 의료 과업을 동시에 해결할 수 있는 특화된 LLM이 부재하다는 문제점을 해결하고자 합니다. 기존 연구들은 각기 다른 의료 하위 도구에 집중해왔으나, 한 영역의 업데이트가 다른 영역의 성능을 저하시키는 '성능 침식' 현상이 발생하기 쉽습니다.#Review#Healthcare LLM#Self-evolution Loop#Data-centered#Agentic Workflow#EHR Tool Use#SDFT2026년 7월 19일댓글 수 로딩 중
[논문리뷰] From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World본 논문은 기존의 사이버 보안 벤치마크가 지나치게 제한된 환경(예: Capture-the-Flag)에 국한되어 있어, 실제 환경에서의 복잡한 공격 표면과 전략적 탐색 능력을 평가하지 못하는 한계를 해결하고자 한다 .#Review#AI Pentesting Agents#Vulnerability Discovery#Evaluation Protocol#Ground-Truth Matching#Stochasticity#Agentic Workflow2026년 7월 15일댓글 수 로딩 중
[논문리뷰] Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading본 논문은 기존의 에이전트 벤치마크가 지나치게 단기적인 작업에 치중되어 있으며, 평가 방식이 최종 결과에만 의존한다는 한계를 해결하고자 한다.#Review#Autonomous Agents#Long-Horizon Tasks#Terminal Benchmarks#Dense Reward-Based Grading#Subtask-based Evaluation#Failure Analysis#Agentic Workflow2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising본 논문은 기존의 AI 에이전트 기반 슬라이드 생성 시스템이 가진 Page-level 디자인의 한계를 해결하고자 합니다. 기존 방식들은 사전에 정의된 템플릿에 의존하거나, 사용자의 장황한 직접 지시(verbose instructions)에만 의존하여 개인화된 디자인 의도를 파악하는 데 실패합니다.#Review#Page-level Slide Personalization#Inverse Planning#Structural Denoising#Reinforcement Learning#Latent Design Intent#Multi-agent Framework#Agentic Workflow2026년 7월 1일댓글 수 로딩 중
[논문리뷰] BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery본 논문은 생의학 분야에서 AI가 생성하는 분석 리포트가 여전히 정적인 텍스트나 표에 머물러 있어, 연구자가 근거를 검증하거나 불확실성을 확인하고 가설을 수정하는 데 한계가 있다는 문제를 제기합니다 .#Review#Multi-Agent System#Biomedical Knowledge Discovery#Evidence-Centered Interface#Provenance-Preserving#Protein-Function Reasoning#Agentic Workflow2026년 7월 1일댓글 수 로딩 중
[논문리뷰] Autodata: An agentic data scientist to create high quality synthetic data본 연구는 고품질 데이터의 부족 문제를 해결하고, 인간의 개입을 최소화하면서 데이터 생성 파이프라인을 자동화하는 것을 목표로 합니다. 기존의 데이터 생성 방식은 데이터의 다양성이 부족하거나 품질 제어가 어렵다는 한계를 지니고 있으며, 단순히 양적인 데이터 확대만으로는 모델 성능의 비약적인 향상을 이끌어내기 어렵습니다.#Review#Synthetic Data#Agentic Workflow#LLM#Data Curation#Model Training#Automated Discovery2026년 6월 24일댓글 수 로딩 중
[논문리뷰] SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks본 논문은 frontier multimodal scientific reasoning 분야에서 단일 상용 LLM 시스템이 전문가 수준의 성능을 달성하지 못하는 한계를 극복하고자 합니다.#Review#Multimodal Scientific Reasoning#LLM Orchestration#MCTS#Reinforcement Learning#Expert Model Delegation#Agentic Workflow2026년 6월 17일댓글 수 로딩 중
[논문리뷰] HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry본 논문은 현대 AI Agent의 성능이 모델 자체의 스케일링뿐만 아니라 이를 둘러싼 Harness 설계에 크게 의존함에도 불구하고, 기존 Harness들이 수동적이고 정적(static)이라는 점을 핵심 문제로 정의합니다.#Review#AI Agent#Harness Engineering#Evolutionary Optimization#Agentic Workflow#Composable Architecture#Operational Mirror#GRPO2026년 6월 14일댓글 수 로딩 중
[논문리뷰] TreeSeeker: Tree-Structured Trial, Error, and Return in Deep Search본 논문은 복잡한 Deep Search 과정에서 에이전트가 단일 선형 궤적을 맹목적으로 따르거나, 체계적인 규칙 없이 분기를 탐색하여 예산을 낭비하는 문제를 해결합니다.#Review#Deep Search#Tree-Structured Search#Tree-Search#TreeMem#Textual UCB#Branch-and-Return#Agentic Workflow2026년 6월 11일댓글 수 로딩 중
[논문리뷰] Personal AI Agent for Camera Roll VQA본 연구는 사용자 개인의 Camera Roll 전체를 대상으로 대화형 AI가 사진을 검색하고 질의에 응답하는 VQA 설정에서의 한계를 해결하고자 한다.#Review#Personal AI Agent#Camera Roll#Visual Question Answering#Long-horizon Memory#Hierarchical Memory#Multimodal LLM#Agentic Workflow2026년 6월 4일댓글 수 로딩 중
[논문리뷰] Benchmark Everything Everywhere All at Once본 논문은 기존의 수동적인 벤치마크 구축 방식이 가진 한계인 노동 집약성, 재사용 불가능성, 그리고 모델 성능 향상에 따른 빠른 벤치마크 포화(Saturation) 문제를 해결하고자 합니다.#Review#Benchmark Agent#Autonomous Evaluation#Benchmark Construction#MLLM-as-a-Judge#Agentic Workflow#Performance Saturation2026년 6월 4일댓글 수 로딩 중
[논문리뷰] 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code본 논문은 현대 3D 생성 분야에서 Procedural Code 생성을 통한 모델링의 중요성이 커지고 있으나, 이를 객관적으로 평가할 수 있는 표준화된 벤치마크가 부재하다는 문제점을 해결하고자 합니다 .#Review#3D Modeling#Procedural Generation#Vision-Language Models#Agentic Workflow#Benchmark#Human-Preference#Blender2026년 6월 1일댓글 수 로딩 중
[논문리뷰] When Cloud Agents Meet Device Agents: Lessons from Hybrid Multi-Agent Systems본 연구는 클라우드 기반의 고성능 Frontier 모델과 에지 장치 기반의 고효율 SLM(Small Language Model)을 통합하는 하이브리드 Multi-Agent System(MAS)의 설계 공간을 체계적으로 탐구합니다.#Review#Multi-Agent Systems#Hybrid AI#Edge Inference#Cloud Agents#Agentic Workflow#KV-cache#Model Routing2026년 5월 28일댓글 수 로딩 중
[논문리뷰] SkillOpt: Executive Strategy for Self-Evolving Agent Skills본 논문은 LLM 기반 에이전트가 복잡한 환경에서 스킬을 재사용할 때 발생하는 비효율성과 적응력 저하 문제를 해결합니다. 기존의 정적인 스킬 라이브러리는 에이전트의 다양한 상황 대응 능력을 제한하며, 스킬 간의 Dependencies를 고려하지 못한 실행은 성능 저하를 초래합니다.#Review#Self-Evolving Agent#Skill Optimization#Executive Strategy#Hierarchical Planning#Agentic Workflow#Skill Library2026년 5월 24일댓글 수 로딩 중
[논문리뷰] π-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows본 논문은 Personal Assistant Agent가 장기적인 프로젝트나 업무 환경에서 능동적으로 의도(Hidden Intents)를 파악하고 대응하지 못하는 한계를 해결하고자 한다.#Review#Proactive Personal Assistant Agents#Long-Horizon Workflows#Hidden Intents#Benchmark#Task Completion#Agentic Workflow2026년 5월 21일댓글 수 로딩 중
[논문리뷰] GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation본 논문은 오픈 엔드 이미지 생성이 단순한 텍스트 프롬프트 기반의 task를 넘어, 모델의 내부 지식과 외부 리소스를 효과적으로 결합해야 하는 복잡한 에이전트 과정임을 강조합니다.#Review#Image Generation#Agentic Workflow#Self-Evolving#Visual Experience Distillation#Tool-Orchestrated#On-Policy Distillation#Multimodal Agent2026년 5월 21일댓글 수 로딩 중
[논문리뷰] R^3-SQL: Ranking Reward and Resampling for Text-to-SQL본 연구는 기존 Text-to-SQL 시스템의 순위 결정(Ranking) 과정에서 발생하는 Functional Inconsistency와 Bounded Recall이라는 두 가지 핵심 과제를 해결하는 데 목적을 둡니다.#Review#Text-to-SQL#Ranking#Resampling#Functional Inconsistency#Bounded Recall#Agentic Workflow2026년 5월 10일댓글 수 로딩 중
[논문리뷰] Chat2Workflow: A Benchmark for Generating Executable Visual Workflows with Natural Language본 논문은 실무 환경에서 널리 사용되는 agentic workflow의 구축이 현재 전적으로 수동적인 엔지니어링에 의존하고 있어, 자동화 및 확장성에 한계가 있다는 문제를 해결하고자 한다.#Review#Agentic Workflow#Benchmark#Large Language Models#Visual Programming#Executable Workflow#Task Automation2026년 4월 21일댓글 수 로딩 중
[논문리뷰] QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies본 논문은 400개의 트레이딩 전략 생성 태스크로 구성된 데이터셋을 바탕으로, Compilation, Backtest, Trade, Judge라는 4단계 순차적 검증 파이프라인을 제안한다. 실험은 단일 시도(Single-turn)와 반복 수정이 가능한 Agentic multi-turn 설정에서 진행되었다 .#Review#QuantCode-Bench#Large Language Models#Algorithmic Trading#Backtrader#Code Generation#Agentic Workflow#Domain-Specific Benchmarking2026년 4월 19일댓글 수 로딩 중