[논문리뷰] From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data AttributionLarge Language Models (LLMs)의 다양한 Capabilities와 Behaviors는 학습 데이터로부터 형성되지만, 어떤 학습 예제가 이러한 Behaviors를 야기하는지에 대한 이해는 부족한 상태입니다.#Review#Training Data Attribution#Influence Functions#Supervised Fine-tuning#Response Rewriting#Reweighting#Language Model Abstention#Safety Refusal#Behavioral Intervention2026년 9월 9일댓글 수 로딩 중
[논문리뷰] Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions본 논문은 LLM이 structurally unanswerable questions, 예를 들어 cot(−540∘) 계산이나 (1).startswith('1') 평가와 같이 유효한 답이 없는 질문에 대해 abstention 대신 answer-like outputs을 제공하는 문제를 다룹니다.#Review#Recognition–Refusal Misalignment#LLMs#Unanswerable Questions#Internal Representations#Safety Refusal#Activation Steering#Pretraining2026년 9월 8일댓글 수 로딩 중