---
title: "[논문 AI 리뷰] MUON IS SCALABLE FOR LLM TRAINING TECHNICAL REPORT"
description: "Muon 최적화 알고리즘을 대규모 LLM 학습에 확장하여 AdamW 대비 약 2배의 계산 효율성을 달성하고, 메모리 사용량을 50% 절감한 분산 구현체와 5.7T 토큰으로 학습한 3B/16B MoE 모델 'Moonlight'를 공개함으로써 LLM 학습 비용 절감과 성능 향상을 실증하고, 관련 코드와 체크포인트를 오픈소스로 제공한다."
date: "2025-12-04T14:48:00.000+09:00"
last_modified: "2026-05-15T08:36:00.000Z"
type: "Paper"
tags:
  - "large language model"
  - "distributed deep learning"
  - "Open Source"
categories:
  - "AI논문리뷰"
series:
  - "AI 논문 리뷰"
canonical_url: "https://blog.pieroot.xyz/muon-llm-training"
markdown_url: "https://blog.pieroot.xyz/muon-llm-training.md"
---

# \[논문 AI 리뷰\] MUON IS SCALABLE FOR LLM TRAINING TECHNICAL REPORT

Muon 최적화 알고리즘을 대규모 LLM 학습에 확장하여 AdamW 대비 약 2배의 계산 효율성을 달성하고, 메모리 사용량을 50% 절감한 분산 구현체와 5.7T 토큰으로 학습한 3B/16B MoE 모델 'Moonlight'를 공개함으로써 LLM 학습 비용 절감과 성능 향상을 실증하고, 관련 코드와 체크포인트를 오픈소스로 제공한다.

**한문장 요약**  

이 논문은 Muon 최적화 알고리즘의 대규모 LLM 학습으로의 확장성을 검증하고, AdamW 대비 약 2배의 계산 효율성을 달성하며 메모리 최적화된 분산 구현체와 함께 우수한 성능의 모델을 공개했기 때문에, LLM 학습 최적화 연구자 및 실무자 모두에게 반드시 읽어야 할 중요한 연구입니다.

#### 1. Main Contributions

- **대규모 Muon 확장을 위한 두 핵심 기술 규명**: weight decay 추가 및 행렬 형태에 따른 업데이트 스케일 조정으로, 수십억 파라미터 규모에서 hyper-parameter 튜닝 없이 안정적 학습 가능

- **계산 최적 학습에서 AdamW 대비 약 2배 효율성 달성**: 스케일링 법칙 실험을 통해 동일 성능 달성 시 약 52% FLOPs만 필요함을 검증 (그림 1a)

- **메모리 최적 분산 Muon 구현 개발**: ZeRO-1 스타일로 optimizer state 메모리를 50% 절감하고, 통신 오버헤드를 1-1.25배로 제어하는 분산 알고리즘 설계 (알고리즘 1)

- **Pareto 최전방 모델 공개**: Muon으로 5.7T 토큰 학습한 3B/16B MoE 모델 'Moonlight'를 통해 MMLU 70.0, HumanEval 48.1, GSM8K 77.4 등 동일 규모 모델 대비 압도적 성능 달성 (표 5)

- **오픈소스 자원 공개**: 분산 Muon 구현체, 사전학습/미세조정 체크포인트, 중간 체크포인트 전체 공개로 향후 연구 지원

#### 2. Key Methods and Approach

- **Muon 최적화**: 행렬 파라미터 $W$에 대해 모멘텀 $M_t$를 Newton-Schulz 반복으로 직교화한 $O_t$로 업데이트하는 알고리즘. $X_k = aX_{k-1} + b(X_{k-1}X_{k-1}^T)X_{k-1} + c(X_{k-1}X_{k-1}^T)^2X_{k-1}$ 반복 (N=5)으로 $(M_tM_t^T)^{-1/2}M_t$ 근사

- **스케일링 기법**: 행렬 형태 $[A,B]$에 대해 업데이트 RMS가 $\sqrt{1/\max(A,B)}$가 되는 문제를 해결하기 위해, $0.2 \cdot O_t \cdot \sqrt{\max(A,B)}$로 스케일링하여 AdamW의 RMS(0.2-0.4)와 일치시킴 (식 4)

- **분산 구현**: ZeRO-1 방식으로 모멘텀을 Data Parallel(DP) 그룹에 분할하고, DP gather로 전체 기울기 집계 후 Newton-Schulz 계산, 로컬 파티션만 업데이트하는 방식

- **실험 설계**: 399M~1.5B 파라미터 dense 모델로 스케일링 법칙 구축, DeepSeek-V3-Small 아키텍처 기반 2.4B/16B MoE 모델로 대규모 검증, SVD entropy 분석으로 업데이트 다양성 정량화

#### 3. Main Results and Findings

- **스케일링 법칙**: 계산 예산 $C$에 따른 검증 손실 $L$이 $L_{Muon}=2.506 \times C^{-0.052}$, $L_{AdamW}=2.608 \times C^{-0.054}$로 적합되어, 동일 성능 달성 시 Muon이 약 48% 적은 FLOPs 필요 (그림 3)

- **Moonlight 모델 성능**: 5.7T 토큰 학습 후 MMLU 70.0, MMLU-pro 42.4, BBH 65.2, HumanEval 48.1, GSM8K 77.4, MATH 45.3으로, 동일 FLOPs 대비 Llama-3.2-3B, Qwen2.5-3B, DeepSeek-V2-Lite 대비 전반적으로 우수 (표 5)

- **SVD entropy 분석**: Muon이 AdamW보다 모든 체크포인트에서 attention, expert, router 등 모든 행렬 그룹의 평균 SVD entropy가 높아, 더 다양한 방향으로 최적화함을 검증 (그림 4)

- **분산 효율성**: AdamW 대비 optimizer state 메모리 50% 절감, 통신량 1-1.25배 증가, Newton-Schulz 반복으로 인한 지연은 forward/backward 대비 1-3%로 무시 가능

- **SFT 성능**: Muon 사전학습 + Muon 미세조정 모델이 AdamW 조합 대비 MMLU 55.7 vs 52.0, HumanEval 57.3 vs 53.1로 우수, but 공개 모델(Qwen2.5-7B)에 Muon SFT 적용 시 이점 미미 (표 6, 7)

#### 4. Limitations and Open Questions

- **비행렬 파라미터 의존성**: RMSNorm, 임베딩, LM head 등 비행렬 파라미터는 여전히 AdamW로 최적화해야 하며, 완전한 통합 프레임워크 미구현

- **사전학습-미세조정 불일치**: AdamW로 사전학습된 모델에 Muon 미세조정을 적용하거나 그 반대 경우 성능 이점이 크지 않은 문제가 남아 있으며, 이에 대한 이론적 이해도 부족

- **수학/코드 작업 이점 메커니즘 불명확**: Muon이 수학 및 코드 생성 작업에서 특히 우수한 성능을 보이는 근본적 원인에 대한 심층 분석 부재

- **아키텍처 특수성**: DeepSeek-V3-Small MoE 아키텍처에 집중 검증되었으며, 다른 아키텍처(GPT, Claude 등)로의 일반화 검증은 제한적

#### 5. Professional TL;DR (Overall Summary)

본 연구는 행렬 직교화 기반 Muon 최적화 알고리즘을 대규모 LLM 학습에 처음으로 성공적으로 확장했으며, weight decay와 행렬별 업데이트 스케일링이라는 두 가지 핵심 기술을 통해 AdamW 대비 약 2배의 계산 효율성을 달성함을 스케일링 법칙과 5.7T 토큰 학습한 3B/16B MoE 모델 'Moonlight'로 검증했습니다. 메모리 절감형 분산 구현체와 함께 모델/체크포인트를 전면 공개하여, Muon이 LLM 학습의 새로운 표준 최적화 알고리즘이 될 가능성을 제시합니다.

#### 6. Critical Evaluation

- **문제 정의의 명확성**: Muon의 대규모 확장성 문제를 구체적으로 정의하고, weight decay 필요성과 업데이트 스케일 불일치 문제를 명확히 식별했으며, 각 문제에 대한 해결책을 체계적으로 제시했기 때문에 우수함 → **9/10**

- **독창성/의의**: AdamW 대비 상당한 효율성 개선을 실증하고, 분산 구현이라는 실용적 과제를 해결했다는 점에서 의의가 크나, Muon 자체는 선행 연구 기반 확장이므로 완전한 독창성은 제한적 → **8/10**

- **결과의 타당성**: 5가지 규모의 dense 모델로 스케일링 법칙 구축, 5.7T 토큰 MoE 모델로 대규모 검증, SVD entropy로 메커니즘 분석, 철저한 ablation study로 주장을 뒷받침하여 결과가 매우 견고함 → **9/10**

- **영향력/적용성**: LLM 학습 비용 절감이라는 중대한 실용적 문제를 해결하고 오픈소스로 공개했으나, 비행렬 파라미터 처리와 사전학습-미세조정 불일치 등 완전한 대체에는 한계가 있어 영향력은 다소 제한적 → **8/10**

**강점:**

- 대규모 모델에서 철저한 스케일링 법칙과 벤치마크를 통해 Muon의 우수성을 실증적으로 검증

- 메모리 사용량 50% 절감과 통신 효율성을 달성하는 실용적 분산 구현체 제공

**약점:**

- Muon의 우수성에 대한 이론적 메커니즘 분석(특히 수학/코드 작업에서)이 부족하고, 비행렬 파라미터 처리가 불완전

- 사전학습과 미세조정 간 옵티마이저 불일치 문제를 해결하지 못하고, 이에 대한 근본적 원인 분석이 미흡

**총 점수: 8.5/10**

#### 7. Further Research and Recommendation

- **추가 연구 필요성**: 비행렬 파라미터를 포함한 완전한 Muon 통합, 사전학습-미세조정 불일치의 근본 원인 규명, Schatten norm으로의 일반화 등 해결되지 않은 구조적 문제가 남아있으며, 특히 Muon의 이점을 설명하는 이론적 프레임워크 개발이 시급함 → **추가 연구가 매우 정당화됨**

- **추천 여부**: 대규모 LLM 학습 비용 절감이라는 중대한 실용적 문제를 해결하고, 실제 검증된 구현체와 모델을 공개했기 때문에, 최적화 연구자와 LLM 실무자 모두에게 즉시 적용 및 참고할 만한 높은 가치를 지님 → **매우 강력히 추천함**
