[논문리뷰] Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs본 논문은 LLM의 safeguard가 응답의 실제 활용 방식을 알기 전에 필터링을 수행함으로써 발생하는 근본적인 한계를 지적한다. 기존의 안전장치들은 사용자의 의도나 대화 이력을 기반으로 결정을 내리지만, 공격자는 이러한 증거들을 정교하게 모방하여 승인된 사용자로 위장할 수 있다 .#Review#LLM#Safeguards#Dual-use#Capability-Safety Trilemma#Trusted Credentials#Copyable Evidence2026년 8월 2일댓글 수 로딩 중