[논문리뷰] Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness본 논문은 기존의 LLM 평가 방식이 Nominal 조건에서의 성능만을 측정하여 모델의 실제 운영 환경에서의 강건성을 과대평가하는 '능력의 환상(illusion of capability)'을 만든다는 문제의식에서 출발합니다.#Review#Large Language Models#Robustness#Diagnostic Stress Test#Logit Interventions#Decoding-Level Taboo#Injected Surprisal#Reasoning Resilience2026년 8월 11일댓글 수 로딩 중