본문으로 건너뛰기

[논문리뷰] Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

링크: 논문 PDF로 바로 열기

저자: Minji Kim, Hyounghun Kim, et al.

## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • False Refusal: 모델이 안전 가이드라인에 따라 무해한 요청임에도 불구하고 위험한 요청으로 오인하여 거절하는 현상입니다.
  • Refusal Statement: 모델의 응답 앞에 붙는 "I’m sorry, but I cannot help with that"과 같은 boilerplate 식의 정형화된 거절 문구입니다.
  • Refusal Rationale: 모델이 요청을 왜 거절하는지 그 이유를 설명하는 논리적 근거입니다.
  • Pseudo-harmful: 내용상 무해하지만, 어휘나 구조적으로 유해한 요청과 유사하여 모델이 거절하기 쉬운 입력을 지칭합니다.
  • Rationale-Only: 거절 문구(Statement)를 제거하고 오직 논리적 근거(Rationale)만으로 안전 학습을 수행하는 데이터 처리 기법입니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 논문은 LLM의 안전 정렬(Safety Alignment) 과정에서 발생하는 False Refusal 문제를 데이터 구조적 관점에서 해결하고자 합니다. 기존의 안전 데이터셋은 정형화된 Refusal Statement를 포함하는 경우가 많으며, 이것이 모델로 하여금 문맥적 이해보다 표면적인 어휘나 구조적 패턴에 과도하게 의존하게 만드는 "Shortcut Learning"을 유도한다는 점을 문제로 지적합니다. 특히, 이러한 구조적 편향은 무해한 질문까지 유해한 것으로 오인하게 만드는 주요 원인이 됩니다. 본 연구는 이러한 거절 문구가 모델의 긍정적인 응답 능력을 저해하고 있음을 [Table 2]를 통해 입증합니다.

Table 2: 방법론에 따른 성능 변화를 수치로 보여주는 메인 실험 결과 테이블

Table 2 — 방법론에 따른 성능 변화를 수치로 보여주는 메인 실험 결과 테이블

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 연구는 안전 응답을 Refusal StatementRefusal Rationale로 분해하고, Statement를 제거하고 Rationale-Only로 학습시키는 데이터 중심 접근법을 제안합니다. 이 방법은 모델이 표면적인 거절 문구에 의존하지 않고, 요청의 의미론적(Semantic) 의도를 파악하도록 유도합니다. Llama-3.1-8BMistral-7B-v0.3을 포함한 다양한 모델로 실험한 결과, Rationale-Only 학습 기법은 기존의 Statement and Rationale 방식 대비 XSTest-SafeOKTest와 같은 pseudo-harmful 벤치마크에서 더 높은 Compliance를 기록하면서도, 유해 요청에 대한 방어력은 유지함을 확인하였습니다 [Table 2]. 특히 Request-Specific한 논리 근거를 제공할수록 모델의 식별 능력이 향상되며, 이러한 성능 향상은 In-Context Learning (ICL) 환경과 기존의 추론 단계(Inference-time) 중재 기법인 SelfCDSCANS 적용 시에도 일관되게 나타납니다 [Table 9].

Table 9: 기존 Inference-time 중재 기법들과의 결합 성능을 보여주는 응용성 평가 테이블

Table 9 — 기존 Inference-time 중재 기법들과의 결합 성능을 보여주는 응용성 평가 테이블

## 4. Conclusion & Impact (결론 및 시사점) 본 논문은 정형화된 거절 문구가 모델의 과도한 거절(Over-refusal)을 유발하는 핵심 요인임을 밝혀내고, 데이터 구조를 Rationale-Only로 정제하는 것만으로도 모델의 유용성과 안전성을 개선할 수 있음을 증명합니다. 본 연구는 안전 학습 데이터의 미세한 구조적 차이가 모델의 안전 행동 패턴을 어떻게 형성하는지 명확히 보여줍니다. 이는 향후 더 정밀하고 유연한 정렬(Alignment) 데이터를 구축하려는 연구자들에게 중요한 설계 지침을 제공하며, LLM의 안전성을 보장함과 동시에 사용자의 편의성을 최적화하는 새로운 표준이 될 것으로 기대됩니다.

Figure 1: 제안하는 방법론이 어떻게 기존 방식과 차별화된 결과를 내는지 예시를 통해 보여주는 핵심 그림

Figure 1 — 제안하는 방법론이 어떻게 기존 방식과 차별화된 결과를 내는지 예시를 통해 보여주는 핵심 그림

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글