[논문리뷰] Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions
링크: 논문 PDF로 바로 열기
저자: Yucheng Du, Xiyang Hu
1. Key Terms & Definitions
- Recognition–Refusal Misalignment: Large Language Models (LLMs)이 내부적으로 질문의
unanswerability를 인식함에도 불구하고, 적절한refusal행동으로 이어지지 않고answer-like output을 생성하는 현상입니다. - Structural Impossibility: 수학적 규칙(예:
division by zero)이나 프로그래밍 언어의 형식적 규칙(예:TypeError)을 위반하여 본질적으로no admissible answer가 존재하는 질문 유형을 지칭합니다. 본 논문의 핵심 연구 대상입니다. - d_imp (Impossibility Direction): LLM의
hidden state내에서answerable프롬프트와structurally impossible프롬프트를 선형적으로 구분하는 단일 방향입니다. 이는 모델이 생성 전에impossibility를 표현하는 방식을 나타냅니다. - d_ref,safety (Safety-Refusal Direction): 기존 연구에서 유해 콘텐츠(
harmful content)에 대한refusal을 중재한다고 알려진residual-stream direction입니다. - Gated Flip Rate:
Activation Steering개입의 효과를 측정하는 핵심 지표로,pre-intervention class와 일치하는clean baseline샘플에서invalidity-aware classifier를 통해 행동 변화가 일어날 조건부 확률을 의미합니다.
2. Motivation & Problem Statement
본 논문은 LLM이 structurally unanswerable questions, 예를 들어 cot(−540∘) 계산이나 (1).startswith("1") 평가와 같이 유효한 답이 없는 질문에 대해 abstention 대신 answer-like outputs을 제공하는 문제를 다룹니다. 저자들은 이러한 실패가 모델이 질문의 impossibility를 pre-generation 단계에서 인식하지 못하거나, 인식하더라도 abstention 메커니즘으로 routing하는 데 실패하는 두 가지 가설 중 하나 때문일 수 있다고 문제를 제기합니다. 기존 연구들은 safety refusal이 d_ref,safety라는 단일 residual-stream direction에 의해 중재된다는 구체적인 기하학적 후보를 제시했지만, structural impossibility recognition이 이 기존 safety-refusal pathway를 재사용하는지에 대한 의문이 존재합니다. 따라서 본 연구는 LLM이 내부적으로 impossibility 신호를 인코딩하는지, 그리고 이 신호가 safety-refusal 메커니즘과 어떻게 관련되어 있는지를 탐구하여 routing failure에 대한 기계적인 설명을 제공하고자 합니다.
3. Method & Key Results
저자들은 LLM이 structurally impossible questions을 처리하는 방식을 분석하기 위해 math800 (16개 카테고리) 및 code800 (8개 카테고리) 데이터셋을 구축하고, instruction-tuned models (1.7B ~ 70B 파라미터)에 대한 일련의 실험을 수행합니다. 핵심 방법론은 pre-generation hidden state에서 impossibility를 나타내는 d_imp를 식별하기 위해 one-dimensional null-space MeanDiff probe (CosNSRT)를 사용하는 것입니다. 특히 A-null projection은 answerable prompts의 공통된 분산을 제거하여 impossibility-specific signal을 노출하는 데 중요합니다. 또한 generation-time steering 기법을 사용하여 d_imp를 residual stream에 주입함으로써 모델의 invalidity-aware behavior에 대한 causal control을 테스트합니다.
주요 실험 결과는 다음과 같습니다. 첫째, 22개 model–dataset cells에 걸쳐 AUC 0.939 (범위 0.841–0.993)의 평균 AUC로 d_imp가 answerable 프롬프트와 structurally impossible 프롬프트를 선형적으로 구분함을 보여주며, 이는 모델이 pre-generation 단계에서 impossibility를 내부적으로 인식하고 있음을 입증합니다. 둘째, 이 recognition direction은 canonical safety-refusal direction (d_ref,safety)과 거의 orthogonal하며, 22개 셀에서 평균 cosine similarity가 0.087 (범위 0.020–0.130)에 불과합니다. 이는 impossibility recognition이 safety refusal 경로와 별개임을 시사합니다. 셋째, activation steering을 통해 d_imp를 주입하면 structurally impossible math and code cells에서 invalidity-aware behavior가 양방향으로 dose-responsively 변화함을 확인했습니다. 특히 Mistral-7B 모델의 경우 gated flip rates가 math 및 code에서 +33pp에서 +44pp까지 증가했습니다. 마지막으로, base/instruct 모델 간의 비교를 통해 이러한 low-cosine geometry가 instruction tuning 이전에 pretraining endpoint에서 이미 형성되어 있었음을 밝혀냈습니다.
4. Conclusion & Impact
본 논문은 LLM이 structurally unanswerable questions에 대해 자신감 있게 답변하는 현상이 encoding failure가 아닌 routing failure 때문임을 명확히 합니다. 모델은 pre-generation hidden state 내에 질문의 impossibility를 나타내는 유용한 내부 신호(d_imp)를 가지고 있지만, 이 신호가 trained safety-refusal pathway와 거의 orthogonal하게 정렬되어 있어 abstention 메커니즘으로 제대로 routing되지 못하고 있습니다. 이러한 recognition–refusal misalignment는 instruction tuning 이전의 pretraining 단계에서 이미 존재합니다.
이 연구는 unreasonable math failures와 같이 출력 수준에서 관찰되는 LLM의 비합리적인 행동에 대한 representation-level의 기계론적 설명을 제공합니다. activation steering을 통해 d_imp가 invalidity-aware behavior를 causally control할 수 있다는 발견은, 향후 LLM이 structurally unanswerable questions에 대해 더 신뢰할 수 있는 abstention 반응을 보이도록 safety-refusal pathway를 d_imp와 명시적으로 align시키는 방향으로 연구가 진행될 수 있음을 시사합니다. 이는 LLM의 reliability를 향상하고 잘못된 답변을 자신감 있게 제시하는 문제를 줄이는 데 중요한 impact를 미칠 것입니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
- [논문리뷰] From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data Attribution
- [논문리뷰] Steering Geometry: Validating Human Value Geometry in LLM Steering Space
- [논문리뷰] Exploring Collaboration between a language and a non-language agent
- [논문리뷰] Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
Review 의 다른글
- 이전글 [논문리뷰] Reason Through the Latent! Making Latent Visual Reasoning Necessary
- 현재글 : [논문리뷰] Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions
- 다음글 [논문리뷰] RelightFormer: Feed-forward Generative Transformer for Multiview Object Relighting
댓글