[논문리뷰] Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks본 연구는 Large Language Models (LLMs)의 backdoor poisoning attacks에 대한 기존 평가 방식의 근본적인 한계를 지적합니다.#Review#Backdoor Attacks#LLM Poisoning#Poison Set Selection#Oracle-budgeted Optimization#SAILS#Attack Success Rate (ASR)#Triggered Loss#Goodhart Effect2026년 9월 14일댓글 수 로딩 중