[논문리뷰] Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures본 논문은 배포된 언어 모델(Language Models, LLMs)에서 AI Alignment Failures를 정확하고 비용 효율적으로 탐지하는 것의 중요성을 강조합니다.#Review#AI Alignment#Reinforcement Learning for Calibrated Decisions (RLCD)#Zero-Shot Detection#Alignment Failures#Language Models#Benchmarking#Calibration#Cost-Efficiency2026년 9월 24일댓글 수 로딩 중