본문으로 건너뛰기

[논문리뷰] SLPO: Scaling Latent Reasoning via a Surrogate Policy

링크: 논문 PDF로 바로 열기

메타데이터

저자: Runyang You, Zhiyuan Liu, Yongqi Li, Wenjie Li

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Latent Reasoning: 명시적인 자연어 토큰 대신 연속적인 벡터(hidden states)를 통해 중간 추론 과정을 수행하는 방식.
  • Surrogate Latent Policy Optimization (SLPO): 명시적인 vocabulary-level action 확률이 없는 latent reasoning 환경에서 trajectory-level credit assignment를 가능하게 하는 대리 likelihood 기반 RL 방법론.
  • Stopping-gate: latent reasoning 모델이 스스로 계산을 종료할지 여부를 결정하게 하는 학습 가능한 head.
  • Test-Time Scaling (TTS): 추론 과정에서의 추가적인 연산 자원 할당(계산 시간 또는 시도 횟수 증가)을 통해 모델의 성능을 향상시키는 기법.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 연구는 latent reasoner가 명시적 CoT와 달리 결과 기반 RLVR을 활용한 test-time scaling의 이점을 누리지 못하는 문제를 해결하고자 한다. 기존의 명시적 CoT는 토큰 단위의 명확한 likelihood를 통해 정책 경사(policy gradient)를 계산할 수 있는 반면, latent reasoning은 중간 단계가 연속적인 벡터로 처리되어 추론 가능한 action likelihood가 결여되어 있다. 또한, 고정된 연산 자원(fixed thinking budget)을 사용하는 한계로 인해 모델이 스스로 연산량을 조절할 수 없는 상태이다. 이러한 환경에서는 보상 기반의 결과 최적화가 불가능하며, 결과적으로 latent reasoner는 imitation 학습에 머물러 있는 실정이다. [Figure 1]

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 SLPO를 제안하여 latent reasoning에 결과 기반 RL 프레임워크를 도입한다. 먼저 Stopping-gate를 도입하여 correctness-supervised cold start를 수행함으로써 모델이 adaptive하게 연산 시간을 결정할 수 있는 기반을 마련한다 [Figure 2]. 이후, 연속적인 잠재 전이(latent transition)에 대해 Surrogate transition likelihood를 정의하여 vocabulary-level 확률 없이도 trajectory-level credit assignment를 가능케 한다. 주요 실험 결과에 따르면, SLPO를 적용한 모델은 GPT-2Llama-3.2 backbone에서 기존 COCONUTCODI 대비 Pass@kk 지표에서 우수한 성능 향상을 보였다 [Table 1]. 또한, 난이도가 높은 문제에 대해 더 긴 잠재 연산 시간을 할당하는 adaptive한 계산 분포를 보여주었으며, GSM8K, GSM-Hard, MultiArith 데이터셋 전반에서 정량적 성능 우위를 입증하였다 [Table 2].

4. Conclusion & Impact (결론 및 시사점)

본 연구는 SLPO를 통해 latent reasoner가 명시적 CoT와 유사하게 보상 기반 최적화를 수행하고 test-time scaling을 달성할 수 있음을 입증하였다. 대리 likelihood와 적응형 종료 결정이라는 두 가지 핵심 요소를 결합함으로써, 벡터 기반 추론 모델이 imitation 한계를 넘어 강화학습의 이점을 온전히 활용할 수 있는 경로를 제시하였다. 이는 향후 대규모 언어 모델의 추론 효율성을 극대화하고, 명시적 언어 모델링에서 탈피하여 더 깊고 효율적인 잠재 추론 구조로 나아가는 학계 및 산업계 연구에 중요한 시사점을 제공한다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글