[논문리뷰] When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles본 논문은 learned interpretability interfaces, 특히 Activation Oracles (AOs)의 신뢰성 문제를 다룹니다.#Review#Activation Oracles#Interpretability#Large Language Models#Concept-Specific Blind Spots#Anti-reading#Taboo Word Guessing#Readout Suppression2026년 8월 9일댓글 수 로딩 중