[논문리뷰] ExplainBench: Evaluating Code Explanations from Agents본 논문은 LLM 에이전트가 생성하는 코드 설명(Explanation)의 신뢰성을 검증할 수 있는 객관적인 평가 기준이 부재하다는 문제점을 지적합니다. 에서 볼 수 있듯이, 에이전트의 설명은 그럴듯해 보이지만 실제 패치는 테스트 코드조차 통과하지 못하는 등 설명과 실제 동작 간의 불일치(Mismatch)가 발생합니다.#Review#LLM agents#explainability#benchmark#trustworthiness#software engineering#code explanation#evaluation framework2026년 8월 4일댓글 수 로딩 중