[논문리뷰] On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zihan Qiu, Zekun Wang, Xiao Li, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Gated DeltaNet (GDN): 선형 복잡도로 접두사를 고정 크기 상태(fixed-size state)로 압축하는 재귀적 토큰 믹싱 기법으로, 기존의 Full-Attention과 하이브리드로 결합되어 사용됨.
- Qwen Sparse Attention (QSA): 긴 시퀀스 환경에서 토큰 수준의 중요도를 추정하는 경량 인덱서(lightweight indexer)를 활용해 마이크로 블록 단위로 연산 효율성을 최적화하는 Sparse Attention 메커니즘.
- Gated Residual (GR): 잔차 스트림(residual stream)을 4개의 브랜치로 확장하고 엘리먼트 단위 게이트(elementwise gate)를 통해 읽기 경로를 결정하는 구조로, 모델의 학습 안정성을 강화함.
- Muon Optimizer: 2차원 가중치 행렬을 직교화(orthogonalization)하여 학습하는 최적화 기법으로, 기존 AdamW와 결합하여 하이퍼파라미터 최적화와 안정성을 동시에 달성함.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 대규모 Sparse Mixture-of-Experts (MoE) 모델인 Qwen3.8-Flash-Next를 설계하며, 기존 모델 대비 컴퓨팅 예산을 절감하면서도 동등 이상의 성능을 유지하는 것을 목표로 한다. 기존의 Full-Attention은 시퀀스 길이에 따라 연산 비용이 제곱으로 증가하는 문제와 KV cache의 선형 증가 문제가 발생하여 효율적인 긴 문맥 처리에 한계가 있었다. 연구진은 모델 설계 시 다운스트림 성능, 학습/서빙 비용, 그리고 학습 안정성이라는 세 가지 축을 동시에 고려하는 통합적인 설계 프레임워크가 필요하다고 판단하였다. 특히, 정량적인 손실(loss) 감소와 벤치마크 점수 향상이 항상 비례하지 않는다는 점을 지적하며, 각 구성 요소의 최적 균형을 찾고자 하였다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 토큰 믹싱을 위해 4개 레이어 중 3개는 GDN을 사용하고 1개는 QSA 또는 전역 어텐션을 배치하는 GDN Hybrid Architecture를 제안한다 [Figure 1]. QSA는 긴 시퀀스에서 인덱싱 비용을 $O(n^2)$에서 $O(n^2/r)$로 낮추며, GDN 커널인 FlashQLA는 기존 Triton 기반 구현 대비 약 2~3배의 forward 속도 향상을 기록하였다 [Figure 2]. 또한 Gated Residual (GR) 설계를 통해 잔차 경로의 용량을 확대하고 학습 중 spiking 문제를 방지하였다. 실험 결과, Qwen3.8-Flash-Next는 이전 세대 모델인 397B-A17B 대비, 활성화 파라미터는 1/3 수준, 학습 토큰은 1/3 수준, 학습 FLOPs는 약 1/9 수준으로 운영되면서도 14개 벤치마크 중 8개에서 더 우수한 성능을 입증하였다 [Table 1]. QSA 적용 시 일반적인 긴 문맥 벤치마크인 RULER와 MRCR에서 전역 어텐션 대비 일관된 성능 향상을 보였다 [Table 2]. 특히 Muon 옵티마이저를 도입하여 배치 사이즈와 학습률을 최적화함으로써, 초기 학습 시 batch-size warmup 없이도 안정적인 학습이 가능함을 확인하였다.
4. Conclusion & Impact (결론 및 시사점)
본 연구는 대규모 언어 모델의 아키텍처, 효율성, 학습 안정성이라는 다중 설계 목표를 성공적으로 통합한 Qwen3.8-Flash-Next를 제시하였다. 제안된 GDN, QSA, GR, 그리고 Muon 옵티마이저의 조합은 컴퓨팅 자원 효율성을 극대화하면서도 대규모 모델 학습의 안정성을 크게 높이는 레시피를 구축하였다. 이 연구는 향후 초거대 모델 개발 시 성능과 효율성 사이의 절충안을 탐색하는 방식에 있어 중요한 기술적 지침을 제공하며, 특히 추론 효율성과 긴 문맥 처리 능력이 필수적인 산업계 실무 모델 설계에 큰 시사점을 준다.
Part 2: 중요 Figure 정보

Figure 1 — Qwen3.8-Flash-Next 아키텍처

Figure 2 — Gated DeltaNet 토큰 믹서

Figure 3 — Qwen Sparse Attention 개요
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
- [논문리뷰] Dion3: Full-Stack Orthogonal Updates
- [논문리뷰] Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation
- [논문리뷰] Parallax: Parameterized Local Linear Attention for Language Modeling
- [논문리뷰] HodgeCover: Higher-Order Topological Coverage Drives Compression of Sparse Mixture-of-Experts
Review 의 다른글
- 이전글 [논문리뷰] Normalized Low-Rank Adaptation
- 현재글 : [논문리뷰] On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
- 다음글 [논문리뷰] PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback
댓글