[논문리뷰] FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth본 논문은 기존의 언어 모델 평가가 모델 judge나 인간의 주관적 선호도에 의존하여 발생하는 불투명성과 비일관성 문제를 해결하기 위해 FlavourBench를 제안한다.#Review#Language Model Benchmark#Culinary Ground Truth#Executable Evaluation#Frontier LLMs#Common-core Evaluation#Statistical Inference2026년 8월 23일댓글 수 로딩 중