[논문리뷰] Small Foundation Models of Human Cognition and Behaviour
링크: 논문 PDF로 바로 열기
저자: Nick Oh, Fernand Gobet, et al.
## 1. Key Terms & Definitions (핵심 용어 및 정의)
- Psych-101: 160개의 심리학 실험에서 수집된 1,070만 개의 trial-level 선택 데이터를 포함한 대규모 행동 데이터셋입니다.
- Noise Ceiling: 특정 데이터셋 내에서 인간의 반응에 존재하는 제거 불가능한 확률적 불확실성을 고려했을 때 달성 가능한 최대 예측 성능의 상한선입니다.
- Structural Ablation: 프롬프트를 4개의 정보 채널(instructions, stimuli, feedback, choice history)로 분해하여 각 채널이 모델의 예측 성능에 미치는 기여도를 평가하는 분석 방법입니다.
- LoRA (Low-Rank Adaptation): 대규모 언어 모델의 파라미터를 동결한 채 선형 계층의 가중치 업데이트를 최적화하여 파라미터 효율적인 학습을 가능하게 하는 기술입니다.
## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 연구는 대규모 언어 모델을 활용한 Cognitive Foundation Models의 성능이 단순히 파라미터 규모에 의존하는지, 아니면 실제 과제 구조(task structure)를 학습하는지 규명하고자 합니다. 기존 연구들은 Centaur와 같은 70B 파라미터 모델이 인간의 행동을 효과적으로 예측한다고 보고했으나, 이러한 성능이 단순히 통계적 편향(statistical shortcuts)을 활용한 결과인지, 아니면 실제 인지 과정을 모사하는 것인지에 대한 검증이 부족했습니다. 본 논문은 135M에서 14B에 이르는 다양한 크기의 모델을 학습시켜, 모델 성능이 인지적 정교함보다는 데이터의 풍부함과 과제 구조에 기여함을 증명합니다.
## 3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 Qwen3, Llama-3, SmolLM2/3, OLMo2/3 등 4개 아키텍처 패밀리의 14개 모델을 사용하여 Psych-101 데이터셋을 활용한 Supervised Fine-tuning을 수행하였습니다. 주요 실험 결과는 다음과 같습니다. 첫째, In-distribution 성능의 경우 모델의 파라미터 크기보다는 Fine-tuning 여부가 성능에 10배 이상 큰 영향을 미치며, 0.6B~1B 파라미터만으로도 70B 모델의 성능을 재현할 수 있음을 확인하였습니다 [Figure 1]. 둘째, Structural Ablation 테스트 결과, 자극(stimuli)과 피드백(feedback)을 마스킹하면 학습된 정보의 75.7%가 손실되어 모델이 우연 수준(chance level) 이하로 성능이 하락함에 따라, 단순히 과거 선택 이력(choice history)만을 활용하는 shortcut learning 가설을 기각하였습니다 [Figure 4]. 마지막으로, 과제 구조에 따른 정보 사용 패턴 분석을 통해 인지적으로 타당한 예측 도구로서의 가능성을 입증하였습니다.

Figure 1 — 모델 규모와 어댑터 랭크(r)가 성능(Negative log-likelihood)에 미치는 영향을 비교하여, 작은 모델이 큰 모델의 성능을 재현할 수 있음을 보여주는 핵심 그래프

Figure 4 — 프롬프트 내 정보 채널을 제거했을 때 성능 저하 정도를 보여주어 shortcut learning 가설을 반박하는 핵심 근거
## 4. Conclusion & Impact (결론 및 시사점) 본 연구는 소형 모델이 특정 행동 패러다임 내에서 인간의 선택을 예측하는 Noise Ceiling Estimator로서 탁월한 성능을 발휘하며, 모델의 크기보다는 데이터의 질과 구조가 예측 정확도를 결정하는 핵심 요인임을 밝혀냈습니다. 이러한 발견은 인지 과학 연구에서 모델의 정교함을 과대평가하기보다, 모델이 학습한 행동 데이터의 범위 내에서만 해석을 제한해야 한다는 중요한 방법론적 시사점을 제공합니다. 본 모델들은 복잡한 인지 모델을 구축하기 전, 데이터의 예측 가능성 상한선을 파악하는 효율적인 도구로 활용될 것입니다.

Table 5 — 다양한 태스크 유형별 모델들의 정량적 예측 성능을 비교한 핵심 결과 테이블
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] CW-BASS v2: Saturation-Aware Pseudo-Label Selection for Semi-Supervised Segmentation under Foundation-Model Teachers
- [논문리뷰] Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models
- [논문리뷰] Self-Evolving Embodied Agents via Skill-Harness Evolution
- [논문리뷰] Towards Interpretable Foundation Models for Retinal Fundus Images
- [논문리뷰] RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction
Review 의 다른글
- 이전글 [논문리뷰] Skaling: Chinchilla's Exponents Meet Kaplan's Coupling
- 현재글 : [논문리뷰] Small Foundation Models of Human Cognition and Behaviour
- 다음글 [논문리뷰] StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding
댓글