[논문리뷰] Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks본 연구는 Large Language Models (LLMs)의 backdoor poisoning attacks에 대한 기존 평가 방식의 근본적인 한계를 지적합니다.#Review#Backdoor Attacks#LLM Poisoning#Poison Set Selection#Oracle-budgeted Optimization#SAILS#Attack Success Rate (ASR)#Triggered Loss#Goodhart Effect2026년 9월 14일댓글 수 로딩 중
[논문리뷰] Jailbreaking in the Haystack본 연구는 장문(long-context) 언어 모델(LMs)의 확장된 컨텍스트 창이 가지는 안전성 함의를 분석하고, 심지어 양성(benign) 컨텍스트 내에서도 안전 기능이 어떻게 저하되는지 탐구하는 것을 목표로 합니다.#Review#Jailbreaking#LLM Safety#Long-Context Models#Positional Bias#Attack Success Rate (ASR)#Prompt Engineering#Compute Efficiency#AI Agents2025년 11월 9일댓글 수 로딩 중