본문으로 건너뛰기

[논문리뷰] Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions

링크: 논문 PDF로 바로 열기

저자: Yucheng Du, Xiyang Hu

1. Key Terms & Definitions

  • Recognition–Refusal Misalignment: Large Language Models (LLMs)이 내부적으로 질문의 unanswerability를 인식함에도 불구하고, 적절한 refusal 행동으로 이어지지 않고 answer-like output을 생성하는 현상입니다.
  • Structural Impossibility: 수학적 규칙(예: division by zero)이나 프로그래밍 언어의 형식적 규칙(예: TypeError)을 위반하여 본질적으로 no admissible answer가 존재하는 질문 유형을 지칭합니다. 본 논문의 핵심 연구 대상입니다.
  • d_imp (Impossibility Direction): LLM의 hidden state 내에서 answerable 프롬프트와 structurally impossible 프롬프트를 선형적으로 구분하는 단일 방향입니다. 이는 모델이 생성 전에 impossibility를 표현하는 방식을 나타냅니다.
  • d_ref,safety (Safety-Refusal Direction): 기존 연구에서 유해 콘텐츠(harmful content)에 대한 refusal을 중재한다고 알려진 residual-stream direction입니다.
  • Gated Flip Rate: Activation Steering 개입의 효과를 측정하는 핵심 지표로, pre-intervention class와 일치하는 clean baseline 샘플에서 invalidity-aware classifier를 통해 행동 변화가 일어날 조건부 확률을 의미합니다.

2. Motivation & Problem Statement

본 논문은 LLM이 structurally unanswerable questions, 예를 들어 cot⁡(−540∘) 계산이나 (1).startswith("1") 평가와 같이 유효한 답이 없는 질문에 대해 abstention 대신 answer-like outputs을 제공하는 문제를 다룹니다. 저자들은 이러한 실패가 모델이 질문의 impossibilitypre-generation 단계에서 인식하지 못하거나, 인식하더라도 abstention 메커니즘으로 routing하는 데 실패하는 두 가지 가설 중 하나 때문일 수 있다고 문제를 제기합니다. 기존 연구들은 safety refusald_ref,safety라는 단일 residual-stream direction에 의해 중재된다는 구체적인 기하학적 후보를 제시했지만, structural impossibility recognition이 이 기존 safety-refusal pathway를 재사용하는지에 대한 의문이 존재합니다. 따라서 본 연구는 LLM이 내부적으로 impossibility 신호를 인코딩하는지, 그리고 이 신호가 safety-refusal 메커니즘과 어떻게 관련되어 있는지를 탐구하여 routing failure에 대한 기계적인 설명을 제공하고자 합니다.

3. Method & Key Results

저자들은 LLM이 structurally impossible questions을 처리하는 방식을 분석하기 위해 math800 (16개 카테고리) 및 code800 (8개 카테고리) 데이터셋을 구축하고, instruction-tuned models (1.7B ~ 70B 파라미터)에 대한 일련의 실험을 수행합니다. 핵심 방법론은 pre-generation hidden state에서 impossibility를 나타내는 d_imp를 식별하기 위해 one-dimensional null-space MeanDiff probe (CosNSRT)를 사용하는 것입니다. 특히 A-null projectionanswerable prompts의 공통된 분산을 제거하여 impossibility-specific signal을 노출하는 데 중요합니다. 또한 generation-time steering 기법을 사용하여 d_impresidual stream에 주입함으로써 모델의 invalidity-aware behavior에 대한 causal control을 테스트합니다.

주요 실험 결과는 다음과 같습니다. 첫째, 22개 model–dataset cells에 걸쳐 AUC 0.939 (범위 0.8410.993)의 평균 AUCd_impanswerable 프롬프트와 structurally impossible 프롬프트를 선형적으로 구분함을 보여주며, 이는 모델이 pre-generation 단계에서 impossibility를 내부적으로 인식하고 있음을 입증합니다. 둘째, 이 recognition directioncanonical safety-refusal direction (d_ref,safety)과 거의 orthogonal하며, 22개 셀에서 평균 cosine similarity0.087 (범위 0.0200.130)에 불과합니다. 이는 impossibility recognitionsafety refusal 경로와 별개임을 시사합니다. 셋째, activation steering을 통해 d_imp를 주입하면 structurally impossible math and code cells에서 invalidity-aware behavior가 양방향으로 dose-responsively 변화함을 확인했습니다. 특히 Mistral-7B 모델의 경우 gated flip ratesmathcode에서 +33pp에서 +44pp까지 증가했습니다. 마지막으로, base/instruct 모델 간의 비교를 통해 이러한 low-cosine geometryinstruction tuning 이전에 pretraining endpoint에서 이미 형성되어 있었음을 밝혀냈습니다.

4. Conclusion & Impact

본 논문은 LLM이 structurally unanswerable questions에 대해 자신감 있게 답변하는 현상이 encoding failure가 아닌 routing failure 때문임을 명확히 합니다. 모델은 pre-generation hidden state 내에 질문의 impossibility를 나타내는 유용한 내부 신호(d_imp)를 가지고 있지만, 이 신호가 trained safety-refusal pathway와 거의 orthogonal하게 정렬되어 있어 abstention 메커니즘으로 제대로 routing되지 못하고 있습니다. 이러한 recognition–refusal misalignmentinstruction tuning 이전의 pretraining 단계에서 이미 존재합니다.

이 연구는 unreasonable math failures와 같이 출력 수준에서 관찰되는 LLM의 비합리적인 행동에 대한 representation-level의 기계론적 설명을 제공합니다. activation steering을 통해 d_impinvalidity-aware behaviorcausally control할 수 있다는 발견은, 향후 LLM이 structurally unanswerable questions에 대해 더 신뢰할 수 있는 abstention 반응을 보이도록 safety-refusal pathwayd_imp와 명시적으로 align시키는 방향으로 연구가 진행될 수 있음을 시사합니다. 이는 LLM의 reliability를 향상하고 잘못된 답변을 자신감 있게 제시하는 문제를 줄이는 데 중요한 impact를 미칠 것입니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글