[논문리뷰] ExecRetrieval: Measuring the Functional-Correctness Gap in Code-Embedding Retrieval기존 코드 Retrieval 벤치마크들은 Lexical 또는 Topical Similarity에 중점을 두어, 코드 임베딩 모델이 기능적으로 올바른 코드와 미묘하게 버그가 있는 코드를 구별하는 능력을 측정하지 못하는 문제를 안고 있습니다.#Review#Code Retrieval#Code Embeddings#Functional Correctness#Code Benchmarking#Buggy Variants#Execution-based Evaluation#LLM Generation2026년 9월 2일댓글 수 로딩 중