본문으로 건너뛰기

[논문리뷰] When Does Muon Help Agentic Reinforcement Learning?

링크: 논문 PDF로 바로 열기

메타데이터

저자: Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Muon: Newton-Schulz (NS) iteration을 사용하여 2D Hidden Layer 가중치 행렬의 모멘텀 행렬을 스펙트럼 정규화(Spectral Normalization)하는 최적화 기법입니다.
  • GiGPO (Group-in-Group Policy Optimization): 에피소드 단위 이득(Episode-level Advantage)에 특정 앵커 상태(Anchor States)를 활용한 스텝 단위 이득(Step-level Advantage)을 결합하여 credit assignment를 수행하는 RL 알고리즘입니다.
  • GraphGPO: rollouts를 상태 전이 그래프로 통합하고, 목표 상태까지의 거리를 기반으로 전이 수준(Transition-level)의 credit을 할당하는 방법론입니다.
  • SNR (Signal-to-Noise Ratio): 본 논문에서 Muon의 효용성을 설명하는 가설적 지표로, 정책 그래디언트 내의 잠재적 신호(Signal)와 크레딧/샘플링 노이즈(Noise)의 비율을 의미합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 Muon 최적화 기법이 대규모 사전 학습(Pre-training)에서는 성공적이나, Reinforcement Learning(RL) 기반의 사후 학습(Post-training) 단계에서는 성능 향상이 불확실하고 때로는 불안정하다는 문제를 해결하고자 합니다. 기존 연구들은 RLVR 환경에서 Muon 사용 시 그래디언트 노이즈 증폭으로 인한 실패 사례를 보고해왔으나, 이러한 실패가 모든 RL 환경에 일반화되는지, 아니면 특정 이득 추정기(Advantage Estimator) 구조와 연관되어 있는지는 명확하지 않았습니다. 저자들은 이득 추정 방식에 따른 Muon의 적합성을 탐구하여, 단순한 모델 수정이 아닌 최적화기와 추정기의 상호작용을 체계적으로 분석할 필요성을 제기합니다 [Figure 1].

Figure 1: 알고리즘별 Muon 성능 프리뷰

Figure 1 — 알고리즘별 Muon 성능 프리뷰

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Qwen2.5-0.5B-Instruct 모델을 사용하여 ALFWorld 환경에서 GRPO, GiGPO, GraphGPO 알고리즘을 각각 적용한 후, 정책의 Hidden 가중치 행렬에만 Muon을 적용하고 나머지 매개변수(Embeddings, Norms 등)는 AdamW로 유지하는 방식을 제안합니다. 실험 결과, GiGPO 환경에서 Muon을 적용했을 때 최종 윈도우 검증 성공률(Validation Success Rate)이 기존 AdamW 대비 0.290에서 0.546으로 약 88%의 상대적 성능 향상을 기록하였습니다 [Figure 2]. 반면, 동일한 높은 학습률(Learning Rate)의 AdamW 컨트롤 실험은 성공률이 0으로 수렴하여, Muon의 성능 향상이 단순히 높은 학습률 때문이 아님을 입증하였습니다 [Table 2]. 추가로, GraphGPO 사용 시 Muon은 정규화된 검증 AUC를 0.400에서 0.556으로 상승시키며 학습 효율을 크게 개선했습니다. 이러한 결과는 Muon의 효용성이 이득 추정기가 제공하는 크레딧의 품질과 밀접하게 연관되어 있음을 시사합니다.

Figure 2: 작업별 검증 성공률 비교

Figure 2 — 작업별 검증 성공률 비교

4. Conclusion & Impact (결론 및 시사점)

본 논문은 Muon이 모든 RL 환경에서 범용적으로 우수한 것이 아니라, 이득 추정기의 구조와 최적화기 설정 간의 긴밀한 상호작용에 따라 성능이 결정된다는 점을 밝혔습니다. 특히 스텝 수준의 정교한 크레딧 할당이 가능한 GiGPOGraphGPO에서 Muon의 정규화 효과가 극대화됨을 확인하였습니다. 본 연구는 향후 에이전트 학습 시스템 설계 시, 최적화기와 이득 추정기를 독립적으로 고려하는 관습에서 벗어나 이들을 공동으로 설계(Co-design)해야 한다는 중요한 통찰을 제공합니다. 이는 더 복잡한 에이전트 작업에서 최적화 효율을 극대화하기 위한 학계 및 산업계의 연구 방향성에 기여합니다.

Figure 3: 최적화기 진단 지표 비교

Figure 3 — 최적화기 진단 지표 비교

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글