[논문리뷰] Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency본 연구는 LLM 기반의 검증 파이프라인에서 '이전에 완료된 감사-수정 작업'이 모델의 Verifier로서의 판단에 의도치 않은 편향을 유발하는지 규명하고자 합니다.#Review#LLM-as-a-judge#Verifier#False Alarm Rate#Signal Detection Theory#Context Bias#Audit-Repair2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Codifying the Judge: Scalable Evaluation via Program Distillation본 논문은 기존 LLM-as-a-judge 패러다임이 가진 높은 API 비용, 불투명한 의사결정 과정, 시스템적 편향(Bias), 그리고 유연성 부족 문제를 해결하는 것을 목적으로 한다.#Review#LLM-as-a-judge#Program Distillation#Pajama#Weak Supervision#Model Routing#Pareto Frontier#Reward Modeling2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness본 연구는 장문 생성 모델의 사실성을 평가함에 있어 기존 Decompose-Search-Verify (DSV) 패러다임이 가진 Precision 중심의 편향성과 평면적 사실 확인(Boolean fact-checks)의 한계를 해결하고자 한다.#Review#Factual Completeness#Long-form Generation#Meta-Rubric#Benchmark#LLM-as-a-judge#Multimodal#Everyday Deep Research2026년 7월 21일댓글 수 로딩 중
[논문리뷰] EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration본 논문은 교육용 동영상이 급증함에 따라 이를 체계적으로 평가할 필요성이 커지고 있으나, 기존 자동화 평가 도구들이 가진 한계를 해결하고자 합니다.#Review#EduPanel#LLM-as-a-judge#Multimodal Evaluation#Pedagogical Assessment#Human-AI Collaboration#Learner-Conditioned#Agent Decomposition2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Blind to the Human Touch: Overlap Bias in LLM-Based Summary Evaluation본 논문은 대규모 언어 모델(LLM)을 요약 평가 심사관으로 활용할 때 발생하는 overlap bias 를 심층적으로 분석하는 것을 목표로 합니다.#Review#LLM-as-a-judge#Summarization Evaluation#Overlap Bias#Position Bias#N-gram Metrics#Gemma#Llama#Evaluation Bias2026년 2월 16일댓글 수 로딩 중
[논문리뷰] Are Large Reasoning Models Good Translation Evaluators? Analysis and Performance Boost본 논문은 대규모 추론 모델(LRMs)이 기계 번역(MT) 품질 평가자로서 어떤 성능을 보이는지 체계적으로 분석하고, 그 과정에서 발생하는 비효율성과 한계를 식별하는 것을 목표로 합니다.#Review#Machine Translation Evaluation#Large Reasoning Models#LLM-as-a-judge#MQM#Fine-tuning#Thinking Calibration#Computational Efficiency#Meta-evaluation2025년 10월 27일댓글 수 로딩 중
[논문리뷰] Who's Your Judge? On the Detectability of LLM-Generated Judgments본 논문은 LLM이 생성한 평가(judgment)를 인간의 평가와 구별하는 판단 탐지(judgment detection) 태스크를 제안하고, 그 탐지 가능성을 체계적으로 조사하는 것을 목표로 합니다.#Review#LLM-as-a-judge#Judgment Detection#Bias Quantification#Feature Engineering#Interpretability#Peer Review#AI Ethics#Evaluation2025년 10월 1일댓글 수 로딩 중
[논문리뷰] DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis본 연구는 기존 질의응답 벤치마크나 수동 큐레이션 데이터셋의 한계를 극복하고, 생성형 연구 합성(Generative Research Synthesis) 시스템의 성능을 효과적으로 평가하기 위한 라이브 벤치마크 와 자동화된 평가 프레임워크 인 DeepScholar-Bench 를 제안합니다.#Review#Generative Research Synthesis#Live Benchmark#Automated Evaluation#LLM-as-a-judge#Related Work Generation#Retrieval-Augmented Generation#Verifiability2025년 8월 28일댓글 수 로딩 중