[논문리뷰] Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration본 논문은 open-weight 대규모 언어 모델(LLMs)에서 safety guardrails가 Refusal Feature Ablation (RFA)과 같은 공격에 의해 쉽게 우회될 수 있는 심각한 문제를 해결하고자 한다.#Review#LLM Safety#Refusal Feature Ablation#Post-Hoc Defense#Decoy Direction Optimization#Weight Editing#Adversarial Robustness2026년 9월 15일댓글 수 로딩 중