[논문리뷰] Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity
링크: 논문 PDF로 바로 열기
메타데이터
저자: Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe
1. Key Terms & Definitions (핵심 용어 및 정의)
- Instruction Tuning: 사전 학습된 모델을 자연어 지시 사항(Instruction)을 따르도록 추가 학습시키는 과정으로, 모델의 응답 방식과 confidence 분포에 큰 변화를 유발함.
- Verbalized Confidence: 모델이 자신의 예측이 정답일 확률을 명시적으로 숫자로 표현하도록 유도하는 기법.
- Hchoice (Choice Entropy): 선택지 기반의 문제에서 모델이 후보 답안들에 할당한 likelihood의 entropy를 통해 모델의 불확실성을 측정하는 지표.
- Unique-2 & Self-BLEU: 생성된 rationale의 어휘적 다양성(Lexical Diversity)을 평가하기 위한 지표로, 각각 고유한 bigram의 비율과 생성물 간의 유사성을 나타냄.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Instruction Tuning이 모델의 verbalized overconfidence를 유발한다는 기존 연구에 주목하여, 이러한 confidence의 변화가 생성된 근거(Rationale)의 어휘적 다양성과 어떤 상관관계가 있는지 규명하고자 한다. 기존 모델들은 정답 예측의 정확도 향상과 무관하게 post-training 과정에서 confidence 분포가 왜곡되는 경향을 보이며, 이는 특히 의료, 금융 등 신뢰성이 중요한 분야에서 심각한 문제로 대두되고 있다. 저자들은 기존의 likelihood 기반 평가나 verbalized confidence가 생성된 근거의 일관성이나 다양성을 충분히 반영하지 못한다고 지적하며, 이들 사이의 연관성을 체계적으로 분석할 필요성을 제기한다. 이를 통해 instruction tuning이 모델의 내부적 확신과 출력된 근거 사이의 정합성에 미치는 영향을 다각도로 조사한다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 연구는 Qwen2.5-7B, Mistral-7B-v0.3, Llama-3.1-8B 등 3개의 모델 패밀리를 활용하여 ARC-Easy, MMLU, CSQA 등 3가지 벤치마크에서 base 모델과 instruction-tuned 모델 간의 pair 비교를 수행한다. 모델의 확신도는 Hchoice와 Verbalized Confidence를 통해 측정하고, rationale의 다양성은 Unique-2와 11-SelfBLEU를 사용하여 분석한다 [Table 1]. 주요 실험 결과, instruction tuning은 모든 모델에서 predictive accuracy의 일관된 향상 없이도 모델의 confidence를 현저히 증가시켰다. 특히 rationale 측면에서 cross-rationale diversity는 모든 경우에서 감소하는 반면, 표면적 어휘 다양성(Unique-2)은 모델과 벤치마크에 따라 비일관적인 변화를 보였다. 마지막으로, 동일한 답안을 선택하고 rationale 길이를 제어한 조건에서도 이러한 diversity 변화 패턴이 유지됨을 확인하여, instruction tuning이 confidence와 rationale diversity에 서로 독립적인 영향을 미침을 입증했다 [Table 3].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 instruction tuning이 모델의 confidence를 높이지만, 이것이 rationale의 다양성 증가나 calibration의 개선으로 이어지지는 않는다는 사실을 확인하였다. 연구 결과는 모델이 생성한 근거의 다양성이 모델의 확신도와 항상 일치하지 않으며, 단일 confidence 지표에 의존하는 것이 위험할 수 있음을 시사한다. 이는 향후 고성능 LLM의 신뢰성을 평가할 때 predictive confidence뿐만 아니라 생성된 근거의 다양성을 공동으로 고려하는 다차원적 평가 체계가 필요함을 강조한다. 본 연구는 LLM의 post-training 전략이 모델의 투명성과 해석 가능성에 미치는 영향에 대한 중요한 통찰을 제공한다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] CLASS-IT: Conversational and Lecture-Aligned Small-Scale Instruction Tuning for BabyLMs
- [논문리뷰] NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs
- [논문리뷰] Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
- [논문리뷰] K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
- [논문리뷰] RecGPT-V3 Technical Report
Review 의 다른글
- 이전글 [논문리뷰] An AI4AI Framework for Visual Token Pruning
- 현재글 : [논문리뷰] Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity
- 다음글 [논문리뷰] AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
댓글