[논문리뷰] Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures본 논문은 배포된 언어 모델(Language Models, LLMs)에서 AI Alignment Failures를 정확하고 비용 효율적으로 탐지하는 것의 중요성을 강조합니다.#Review#AI Alignment#Reinforcement Learning for Calibrated Decisions (RLCD)#Zero-Shot Detection#Alignment Failures#Language Models#Benchmarking#Calibration#Cost-Efficiency2026년 9월 24일댓글 수 로딩 중
[논문리뷰] Machine Text Detectors are Membership Inference Attacks본 연구는 멤버십 추론 공격(MIAs)과 기계 생성 텍스트 감지(MGTD)라는 두 가지 관련 연구 분야가 독립적으로 연구되어 발생하는 비효율성을 해결하고자 합니다.#Review#Membership Inference Attacks#Machine-Generated Text Detection#Transferability#Likelihood Ratio Test#Large Language Models#Zero-Shot Detection#Model Security#AI Safety2025년 10월 23일댓글 수 로딩 중