[논문리뷰] Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness본 논문은 기존의 LLM 평가 방식이 Nominal 조건에서의 성능만을 측정하여 모델의 실제 운영 환경에서의 강건성을 과대평가하는 '능력의 환상(illusion of capability)'을 만든다는 문제의식에서 출발합니다.#Review#Large Language Models#Robustness#Diagnostic Stress Test#Logit Interventions#Decoding-Level Taboo#Injected Surprisal#Reasoning Resilience2026년 8월 11일댓글 수 로딩 중
[논문리뷰] How Far Are We from Genuinely Useful Deep Research Agents?본 논문은 기존의 심층 연구 에이전트(DRA) 벤치마크가 질문 응답(QA) 또는 폐쇄형 작업 에 치중하여 종합적인 보고서 생성 능력을 제대로 평가하지 못하는 한계를 지적합니다. 또한, 현재의 개방형 벤치마크는 LLM 기반 샘플링 이나 주관적인 평가 방식 으로 인해 실제 사용자 요구사항과 동떨어져 있음을 문제로 삼습니다.#Review#Deep Research Agents#Evaluation Benchmark#Failure Taxonomy#Report Generation#Information Retrieval#Reasoning Resilience#Content Fabrication#AI Agents2025년 12월 1일댓글 수 로딩 중