[논문리뷰] NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap본 논문은 LLM이 단순 pattern matching을 넘어 진정한 logical reasoning 능력을 갖추고 있는지에 대한 불확실성과 multilingual evaluation에서 language-specific failure가 단일 performance gap으로 뭉뚱그려지는 문제를 해결하고자 한다.#Review#Puzzle Benchmark#Cross-Lingual Evaluation#Performance Gap#Hangul Jamo#Difficulty Calibration#Procedural Generation#LLM Reasoning#Korean NLP2026년 8월 5일댓글 수 로딩 중