[논문리뷰] When Models Edit Too Much: On the Fidelity of Minimal Code Edits본 논문은 최신 LLM이 코드 수정 작업에서 기능적 정확성(Pass@1)은 높으나, 불필요하게 많은 코드를 수정하는 Over-editing 문제를 해결하고자 합니다 . 기존의 많은 코드 벤치마크는 테스트 케이스 통과 여부만을 평가할 뿐, 수정의 최소성이나 가독성(Reviewability)을 고려하지 않는 한계가 있습니다.#Review#Code Repair#Edit Fidelity#Over-editing#Large Language Models#Reinforcement Learning#Code Maintenance2026년 9월 6일댓글 수 로딩 중
[논문리뷰] SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration기존 벤치마크들이 정적이고 단발적인 기능적 정확성 평가에 치중하여 실제 소프트웨어 개발의 복잡한 요구사항 변화와 장기적인 기능 반복을 포착하지 못하는 문제를 해결하는 것이 목표입니다.#Review#LLM Agents#Software Engineering#Code Maintenance#Continuous Integration#Benchmark#Code Generation#Long-term Evaluation#Technical Debt2026년 3월 4일댓글 수 로딩 중