[논문리뷰] Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
링크: 논문 PDF로 바로 열기
메타데이터
저자: Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López
1. Key Terms & Definitions (핵심 용어 및 정의)
- GLU-MLP (Gated Linear Unit MLP): 정보 흐름을 제어하는
gate_proj와 콘텐츠를 저장하는up_proj의 곱을 통해 내부 정보를 처리하는 Transformer의 피드포워드 층 구조입니다. - Differential Activation: 두 개의 대비되는(contrastive) 프롬프트 쌍을 모델에 입력했을 때, 특정 뉴런에서 발생하는 활성화 값의 차이로, 편향(bias)을 국소화하는 지표입니다.
- BiasScore: 특정 뉴런이 demographic attribute 변화에 얼마나 민감하게 반응하는지를 나타내는 정량적 지표로, 본 논문에서 편향 뉴런을 식별하는 핵심 도구입니다.
- Fairness Pruning: 모델의 일반적인 능력(capabilities)을 보존하면서, 편향을 유발하는 특정 뉴런만을 선별적으로 제거(zeroing)하여 편향을 완화하는 구조적 개입 방식입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LLM이 학습 데이터 내의 사회적 편향을 구조적으로 내재화하는 문제를 해결하기 위해, 모델의 일반적 능력을 저하시키지 않으면서 편향만을 정밀하게 제거하는 효율적인 방안을 탐색합니다. 기존의 데이터 필터링, 파인튜닝, 표현 편집(representation editing) 방식들은 편향된 정보와 일반적 지식을 분리하지 못하고 전체 가중치에 영향을 미쳐 성능 저하를 초래하는 한계가 있습니다. 최근 등장한 Sparse Autoencoders를 활용한 방식은 정밀도가 높지만 막대한 컴퓨팅 자원을 요구하여 일반적인 연구 환경에서 적용하기 어렵습니다. 저자들은 이러한 문제를 극복하기 위해, 별도의 추가 학습 없이 Differential Activation을 기반으로 편향 뉴런을 저비용으로 국소화하고 구조적으로 제거하는 Fairness Pruning을 제안합니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들이 제안하는 Fairness Pruning은 down_proj 입력 단에서 활성화 값을 포착하여 편향에 민감한 뉴런을 찾아내는 파이프라인으로 구성됩니다. 각 demographic 카테고리(Age, Gender, RaceEthnicity 등)별로 구축된 contrastive 프롬프트 쌍을 사용하여 BiasScore를 계산하고, 상위 k개 뉴런을 선정하여 가중치를 0으로 만드는 방식입니다. 실험 결과, Llama-3.2-1B 모델에서 최대 40개의 뉴런(전체 MLP 너비의 0.031% 미만)만을 제거함에도 불구하고, 추론 및 일반 지식에 대한 성능은 99.49% 수준으로 유지됨을 확인하였습니다. 이는 편향 처리와 모델의 일반 능력이 신경망 내의 서로 다른 회로(circuits)에서 독립적으로 동작함을 입증합니다. 다만, BiasScore가 부호(unsigned)가 없는 값으로 계산될 경우, 편향을 강화하는 뉴런과 억제하는 뉴런이 혼재되어 나타나는 bidirectional bias destabilization 현상이 관찰되었습니다. 이는 편향을 특정 방향으로 조정하기 위해서는 단순히 magnitude만을 측정하는 것이 아니라 뉴런 반응의 부호를 고려한 정밀한 접근이 필요함을 시사합니다 [Table 1, Table 2].
4. Conclusion & Impact (결론 및 시사점)
본 연구는 대규모 언어 모델의 인구통계학적 편향이 모델 전체에 퍼져 있는 것이 아니라 특정 뉴런에 집중되어 있음을 실증적으로 증명하였습니다. 제안된 Fairness Pruning은 별도의 추가 학습 없이 소비자용 하드웨어 수준에서 편향을 효과적으로 제어할 수 있는 실용적 방법론을 제시합니다. 이러한 발견은 향후 LLM의 편향 완화 작업을 blind zeroing(무차별적인 제거)에서 directional behavior modulation(방향성 있는 행동 조절)으로 전환하는 중요한 학술적 토대를 마련하였습니다. 향후 연구에서는 더욱 정밀한 편향 제어를 위해 뉴런의 활성화 방향성을 고려한 비대칭적 접근법이 요구됩니다.
Part 2: 중요 Figure 정보

Figure 1 — 제안하는 Fairness Pruning 파이프라인

Table 1 — 데이터셋의 대비 프롬프트 예시

Table 2 — 실험 조건 및 설정 그리드
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] NeuroCogMap Reveals Cognitive Organization of Large Language Models
- [논문리뷰] The Shape of Addition: Geometric Structures of Arithmetic in Large Language Models
- [논문리뷰] The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models
- [논문리뷰] LLMs4All: A Review on Large Language Models for Research and Applications in Academic Disciplines
- [논문리뷰] How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review
Review 의 다른글
- 이전글 [논문리뷰] Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- 현재글 : [논문리뷰] Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
- 다음글 [논문리뷰] Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability
댓글