[논문리뷰] Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution본 논문은 기존의 자가 개선(self-improving) 코딩 에이전트들이 단일 실패 궤적에만 의존하여 정보를 효율적으로 활용하지 못하는 한계를 해결하고자 합니다.#Review#Coding Agents#Self-Improvement#Recursive Evolution#Comparative Evidence#Mendelian Principles#LLM#Agent Scaffold2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Self-Evolving Coding Agents본 논문은 현대의 Coding Agents가 배포 후 정적인 상태로 머물러 있어, 변화하는 소프트웨어 환경에 적응하지 못하는 문제를 해결하고자 한다. 대부분의 에이전트는 고정된 프롬프트와 컨트롤 로직을 사용하는데, 이는 저장소의 지속적인 변화와 반복적인 버그 수정 과정에서 최적의 성능을 발휘하기 어렵다.#Review#Coding Agents#Self-Evolving Agents#Software Engineering#Repository-level Context#Executable Feedback#Agent Framework#Automated Programming2026년 8월 5일댓글 수 로딩 중
[논문리뷰] SWE-Touch: Benchmarking Coding Agents When Users Touch the Code본 논문은 Coding Agents가 autonomous한 환경에서 impressive performance를 보였음에도 불구하고, real-world collaborative development 상황에서 사용자 intervention에 의해 workspace 상태가 변경될 때 struggle한다는 핵심 문제를 제기합니다.#Review#Coding Agents#Benchmarks#Human-AI Collaboration#Shared Workspace#Interactive Coding#SWE-Touch#Counter-Edit#LLMs2026년 8월 3일댓글 수 로딩 중
[논문리뷰] CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents본 논문은 코딩 에이전트가 리포지토리의 컨텍스트를 파악하는 과정에서 발생하는 비효율적인 반복 탐색과 생명주기 관리 비용 문제를 해결하기 위해 CodeNib을 제안합니다 . 기존의 에이전트 시스템은 리포지토리를 탐색할 때마다 인덱스, 언어 서버, 로컬 히스토리를 매번 새로 발견하거나 구성해야 하는 중복 비용이 발생합니다.#Review#Coding Agents#Repository Context#Multi-View Data System#Incremental Maintenance#Agent Runtime2026년 7월 28일댓글 수 로딩 중
[논문리뷰] SWE-Pruner Pro: The Coder LLM Already Knows What to Prune본 논문은 coding agents가 다중 턴 환경에서 축적하는 방대한 tool outputs로 인해 발생하는 연산 비용 및 컨텍스트 품질 저하 문제를 해결하고자 한다.#Review#Coding Agents#Context Pruning#Large Language Models#Model Efficiency#Token Compression#Hidden-State Analysis#Software Engineering2026년 7월 20일댓글 수 로딩 중
[논문리뷰] FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications본 논문은 실시간 멀티모달 애플리케이션의 복잡한 파이프라인을 효율적으로 서비스하기 위한 최적화 자동화 문제를 해결합니다. 기존의 서비스 시스템이나 자동 병렬화 컴파일러는 특정 워크로드에 고정되어 있거나, 오퍼레이터 수준의 최적화에만 국한되어 다양한 멀티모달 파이프라인의 구조적 요구사항을 충족하지 못합니다 .#Review#Multimodal Applications#Real-Time Inference#Coding Agents#Chain-of-Program#Deployment Optimization#Multi-GPU Deployment2026년 7월 20일댓글 수 로딩 중
[논문리뷰] Dockerless: Environment-Free Program Verifier for Coding Agents본 논문은 기존의 실행 기반(Execution-based) 프로그램 검증기가 가진 과도한 엔지니어링 오버헤드와 비확장성 문제를 해결하기 위해 Dockerless를 제안합니다.#Review#Coding Agents#Environment-Free#Program Verifier#SWE-bench#Reinforcement Learning#Supervised Fine-tuning2026년 6월 30일댓글 수 로딩 중
[논문리뷰] The Verification Horizon: No Silver Bullet for Coding Agent Rewards본 논문은 최신 Coding Agent의 성능이 발전함에 따라, 생성된 코드의 정확성을 신뢰할 수 있게 검증하는 문제가 생성 자체보다 훨씬 어려워진 현실을 지적합니다.#Review#Coding Agents#Reward Design#Reward Hacking#Alignment#Verification#Systematic Evaluation2026년 6월 25일댓글 수 로딩 중
[논문리뷰] NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?본 논문은 AI 코딩 에이전트가 단순한 논문 구현(reproduction)을 넘어, 실제 과학적 난제에 대해 기존 SOTA를 능가하는 독창적인 방법론을 발견(discovery)할 수 있는지 평가하는 것을 목표로 한다.#Review#Coding Agents#NatureBench#NatureGym#AI for Science#Benchmark#SOTA-normalized#Autonomous Discovery2026년 6월 23일댓글 수 로딩 중
[논문리뷰] GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?본 논문은 현대의 Coding Agent가 자연어 명세(Specification)를 실제 실행 가능한 게임으로 변환하는 End-to-End 생성 능력을 엄밀하게 평가하고자 합니다.#Review#Game Generation#Coding Agents#Game Engine#Godot#End-to-End Evaluation#Interactive Verification#Benchmark2026년 6월 16일댓글 수 로딩 중
[논문리뷰] FastContext: Training Efficient Repository Explorer for Coding Agents본 논문은 LLM 기반 코딩 에이전트의 저장소 탐색 단계에서 발생하는 고비용 토큰 소비 및 불필요한 컨텍스트 오염 문제를 해결하기 위해 제안되었다. 기존 에이전트들은 동일한 모델이 탐색과 문제 해결을 모두 수행하여, 탐색 과정에서 누적된 방대한 양의 관련 없는 코드 스니펫이 주 모델의 컨텍스트를 오염시킨다 .#Review#Coding Agents#Repository Exploration#Subagent Architecture#Supervised Fine-Tuning#Reinforcement Learning#Context Efficiency#Token Consumption2026년 6월 15일댓글 수 로딩 중
[논문리뷰] Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized TestsCoding Agent의 성능 평가가 실제 실무 능력과 괴리되는 현상은 모델이 벤치마크 데이터를 암기하거나 유출된 테스트 케이스를 미리 확인하는 Cheating 문제에서 기인합니다.#Review#Coding Agents#Cheating Detection#Capped Evaluation#Randomized Tests#Benchmark Overfitting#Code Generation2026년 6월 9일댓글 수 로딩 중
[논문리뷰] SWE-Explore: Benchmarking How Coding Agents Explore Repositories본 논문은 기존의 SWE-bench와 같은 벤치마크가 이슈 해결 여부를 이분법적(성공/실패)으로만 판단하여, 에이전트의 내부적인 탐색, 위치 파악, 맥락 추출 능력을 측정하지 못하는 문제를 해결하고자 합니다 .#Review#Repository-level Coding#Coding Agents#Repository Exploration#Line-level Benchmark#Context Retrieval#Software Engineering2026년 6월 8일댓글 수 로딩 중
[논문리뷰] SWE-chat: Coding Agent Interactions From Real Users in the Wild저자들은 GitHub 저장소에서 코딩 에이전트 세션을 자동으로 기록하는 오픈소스 도구인 Entire.io를 활용하여 데이터셋을 구축하였다. 수집된 데이터는 인간과 에이전트 간의 상세한 상호작용 추적(Interaction traces)과 라인별 코드 기여도 정보를 포함한다 .#Review#Coding Agents#Software Engineering#Human-Agent Interaction#In-the-wild Dataset#Code Attribution2026년 4월 22일댓글 수 로딩 중
[논문리뷰] Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents본 논문은 기존의 메모리 기반 self-evolving agent들이 단일 도메인(Single-domain) 내의 메모리 활용에 국한되어, 다양한 도메인을 아우르는 공유 인프라와 프로그래밍 원칙을 충분히 활용하지 못하는 문제를 해결하고자 한다.#Review#Coding Agents#Self-evolving Agents#Memory Transfer Learning#Cross-domain#Meta-knowledge#Abstraction#Transferability2026년 4월 15일댓글 수 로딩 중
[논문리뷰] Terminal Agents Suffice for Enterprise Automation저자들은 터미널과 파일시스템을 통해 플랫폼 API와 직접 통신하는 최소한의 코딩 에이전트인 StarShell을 제안합니다 . StarShell은 사전 정의된 도구 레지스트리에 의존하지 않고, 문서나 API 응답을 통해 능동적으로 기능을 발견하고 작업을 구성합니다.#Review#Enterprise Automation#Agentic Systems#Terminal-based Agents#API Interaction#Model Context Protocol (MCP)#Coding Agents2026년 4월 1일댓글 수 로딩 중
[논문리뷰] SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks기존 Coding Agent Benchmark 들은 압도적으로 Single-shot Solutions 을 Complete Specification에 대해 평가하고 있으며, 이는 Agent가 현재 Specification 에 대한 Correct Code 를 생성할 수 있는지 여부만을 측정한다.#Review#SlopCodeBench#Coding Agents#Iterative Development#Code Quality#Structural Erosion#Verbosity#Benchmarking#Long-Horizon Tasks2026년 3월 26일댓글 수 로딩 중
[논문리뷰] Qwen3-Coder-Next Technical Report본 논문은 코딩 에이전트에 특화된 오픈-웨이트 언어 모델인 Qwen3-Coder-Next 를 소개합니다. 800억 개의 총 파라미터 중 추론 시 30억 개만 활성화 되는 MoE(Mixture-of-Experts) 아키텍처를 통해 효율적인 추론과 강력한 코딩 능력을 동시에 달성하는 것을 목표로 합니다.#Review#Coding Agents#Large Language Models (LLMs)#Mixture-of-Experts (MoE)#Agentic Training#Software Engineering#Reinforcement Learning#Code Generation#Tool Usage2026년 3월 3일댓글 수 로딩 중
[논문리뷰] SERA: Soft-Verified Efficient Repository Agents본 논문은 폐쇄형 시스템 대비 오픈 소스 코딩 에이전트의 강점인 사설 코드베이스 특화 능력 을 저비용으로 실현하는 것을 목표로 합니다. 기존 훈련 방식의 높은 비용과 복잡성으로 인해 이론에 머물렀던 이점을 극복하고, 효율적인 데이터 생성 및 학습 방법론 을 제시하여 실질적인 적용 가능성을 입증하고자 합니다.#Review#Coding Agents#Synthetic Data Generation#Repository Specialization#Supervised Finetuning#Soft Verification#Cost-Efficiency#SWE-bench2026년 1월 28일댓글 수 로딩 중
[논문리뷰] SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents본 논문은 소프트웨어 개발을 위한 LLM 에이전트가 긴 컨텍스트로 인해 발생하는 높은 API 비용과 지연 시간 문제를 해결하고자 합니다.#Review#Context Pruning#Coding Agents#Large Language Models (LLMs)#Software Development#Code Comprehension#Efficiency Optimization#Task-Aware Pruning#CRF2026년 1월 25일댓글 수 로딩 중
[논문리뷰] SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios이 논문은 기존 AI 코딩 에이전트 벤치마크(예: SWE-Bench )가 단일 이슈 해결 에 초점을 맞춰 실제 소프트웨어 진화의 복잡성을 포착하지 못하는 한계를 해결하고자 합니다.#Review#Coding Agents#Software Evolution#Benchmarking#Long-Horizon Tasks#Large Language Models (LLMs)#Software Engineering#Code Generation2025년 12월 24일댓글 수 로딩 중
[논문리뷰] NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents이 논문은 기존 코딩 에이전트 벤치마크들이 완전한 소프트웨어 시스템을 구축하는 데 필요한 장기적인 추론 능력 을 엄격하게 평가하지 못하는 문제를 해결하고자 합니다.#Review#Coding Agents#LLMs#Software Engineering#Repository Generation#Long-Horizon Reasoning#Benchmark#Python Development#Autonomous Systems2025년 12월 15일댓글 수 로딩 중
[논문리뷰] VisCoder2: Building Multi-Language Visualization Coding Agents본 논문은 기존 시각화 코드 생성 연구의 한계, 즉 단일 언어 및 단일 라운드 생성에 대한 편향을 해결하고, 다국어 환경에서 신뢰성 있는 시각화 코드를 생성하며 스스로 오류를 수정 할 수 있는 AI 에이전트 구축을 목표로 합니다.#Review#Multi-Language Visualization#Code Generation#Self-Debugging#Instruction Tuning#Large Language Models#Visualization Benchmark#Coding Agents#Code-Feedback2025년 10월 29일댓글 수 로딩 중
[논문리뷰] A Survey of Vibe Coding with Large Language Models본 논문은 대규모 언어 모델(LLM)의 발전에 따라 등장한 '바이브 코딩(Vibe Coding)' 이라는 새로운 개발 방법론을 심층적으로 탐구합니다.#Review#Vibe Coding#Large Language Models#Coding Agents#Human-AI Collaboration#Software Engineering#Development Models#Context Engineering2025년 10월 15일댓글 수 로딩 중