[논문리뷰] Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness본 연구는 장문 생성 모델의 사실성을 평가함에 있어 기존 Decompose-Search-Verify (DSV) 패러다임이 가진 Precision 중심의 편향성과 평면적 사실 확인(Boolean fact-checks)의 한계를 해결하고자 한다.#Review#Factual Completeness#Long-form Generation#Meta-Rubric#Benchmark#LLM-as-a-judge#Multimodal#Everyday Deep Research2026년 7월 21일댓글 수 로딩 중
[논문리뷰] When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling본 논문은 LLM(Large Language Model) 앙상블이 장문(long-form) 생성에서 겪는 불안정성과 비효율성 문제를 해결하는 것을 목표로 합니다.#Review#LLM Ensembling#Token-level Ensembling#Speculative Decoding#Tokenization Mismatch#Probability Sharpening#Long-form Generation#KV Cache Management2025년 10월 21일댓글 수 로딩 중