---
title: "[논문 AI 리뷰] Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning"
description: "Nemotron 3 Nano는 MoE 기반 하이브리드 Mamba‑Transformer 아키텍처와 다환경 RLVR 학습을 결합해 3.2 B 활성 파라미터로 31.6 B 규모 모델 성능을 달성하고 추론 처리량을 3.3배 향상시킨 효율적인 에이전트 추론 모델이며, 선택적 FP8 양자화와 1 M 토큰 컨텍스트 지원을 제공하고 전체 코드·모델·데이터를 오픈소스로 공개한다."
date: "2025-12-18T01:40:00.000+09:00"
last_modified: "2026-05-15T08:36:00.000Z"
type: "Paper"
tags:
  - "paper"
  - "large language model"
  - "transformer"
categories:
  - "AI논문리뷰"
series:
  - "AI 논문 리뷰"
canonical_url: "https://blog.pieroot.xyz/nemotron-3-nano"
markdown_url: "https://blog.pieroot.xyz/nemotron-3-nano.md"
---

# \[논문 AI 리뷰\] Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Nano는 MoE 기반 하이브리드 Mamba‑Transformer 아키텍처와 다환경 RLVR 학습을 결합해 3.2 B 활성 파라미터로 31.6 B 규모 모델 성능을 달성하고 추론 처리량을 3.3배 향상시킨 효율적인 에이전트 추론 모델이며, 선택적 FP8 양자화와 1 M 토큰 컨텍스트 지원을 제공하고 전체 코드·모델·데이터를 오픈소스로 공개한다.

**한문장 요약**  

이 논문은 MoE(Mixture-of-Experts) 기반 하이브리드 Mamba-Transformer 아키텍처와 다환경 RLVR(Reinforcement Learning from Verifiable Rewards) 학습을 결합하여 3.2B 활성 파라미터로 31.6B 규모 모델의 성능을 달성하고 추론 처리량을 3.3배 개선한 효율적인 에이전트 추론 모델을 제시하므로, 실무자와 연구자 모두에게 반드시 읽어야 할 가치가 있습니다.

#### 1. Main Contributions  

- **MoE 하이브리드 아키텍처 혁신**: Mamba-Transformer 하이브리드에 128개 전문가 중 6개만 활성화하는 세밀한 MoE 구조를 적용해 전체크

rge

A.

E. Prompt

J. The user-2.5B, 2025c.

Zhang/5. 2025.0.2. URL https://arxiv.org/abs/2410.15124.

V1.5. In-ChatGPT.2K. https://arxiv.org/abs/2505.15124.

- **대규모 사전학습 효율성**: 25조 토큰(23.5조 다양성 + 1.5조 고품질)으로 학습하되 활성 파라미터를 절반 이하로 줄여 이전 세대 대비 정확도 향상 및 1M 토큰 컨텍스트 지원

- **다환경 RLVR 프레임워크**: 수학, 코드, 도구 사용 등 모든 환경에서 동시에 안정적 학습을 보장하는 통합 RLVR 파이프라인과 커리큘럼 기반 난이도 조절 기법 제안

- **생성형 보상 모델 기반 RLHF**: GenRM(Generative Reward Model)과 원형 비교 전략으로 O(N²) 복잡도를 O(N)으로 감소시키고 Group Relative Length Control으로 과도한 추론 길이를 30% 감소

- **선택적 FP8 양자화**: 어텐션 계층과 이전 Mamba 계층은 BF16 유지, 나머지는 FP8로 양자화해 99% 정확도 회복률로 처리량 극대화

- **완전한 오픈소스 공개**: HuggingFace에 기반 모델, 미세조정 모델, FP8 양자화 모델 체크포인트와 함께 학습 레시피, 코드, 대부분의 데이터셋 공개

#### 2. Key Methods and Approach  

**아키텍처**: 52층 하이브리드 Mamba-Transformer 구조에 MoE 계층을 통합. 128개 라우터블 전문가 중 6개 활성화(4.7% 활성률)하고 2개 공유 전문가 추가. Mamba-2 상태 공간 모델과 GQA(Grouped Query Attention) 조합으로 선형 복잡도와 긴 컨텍스트 처리 능력 확보. 위치 임베딩, 드롭아웃, 선형층 편향 제거하고 RMSNorm 정규화 사용.

**사전학습**: Warmup-Stable-Decay 학습률 스케줄러로 25조 토큰 학습(LR 1e-3 → 1e-5). 2단계 커리큘럼(1단계: 23.5T 다양성, 2단계: 1.5T 고품질)과 121B 토큰 LC-Phase(512k+4k 혼합 시퀀스)로 1M 컨텍스트 확장.

**사후학습**:  

1) **SFT**: 18M 샘플에 대해 13,000스텝, 256K 시퀀스 길이로 에이전트 작업 중심 학습  

2) **RLVR**: 128프롬프트/스텝, 프롬프트당 16생성으로 동기식 GRPO(Generalized Reward Policy Optimization) 실행. 커리큘럼 샘플링으로 초기에는 쉬운 샘플, 후반에는 어려운 샘플 비중 증가  

3) **RLHF**: Qwen3-235B-A22B-Thinking-2507 기반 GenRM 학습 후 원형 비교로 16개 응답 간 16회 비교만 수행. Group Relative Length Control으로 추론 길이 상대적 패널티 부과.

**양자화**: ModelOpt와 Megatron-LM으로 PTQ(Post-Training Quantization) 수행. 어텐션과 선행 Mamba 6개층은 BF16 유지, 나머지 가중치·활성화·KV 캐시는 FP8로 변환.

#### 3. Main Results and Findings  

**성능 지표**:  

- **추론**: AIME25 89.06%(도구 미사용) → 99.17%(도구 사용), GPQA 73.04% → 75.00%, LiveCodeBench 68.25%, SciCode 33.28%, Humanity's Last Exam 10.57% → 15.48%  

- **에이전트**: SWE-Bench 38.76%, TauBench 평균 49.04%, BFCL v4 53.76%  

- **지시 준수**: IFBench 71.51%, Arena-Hard-V2 평균 67.65%  

- **긴 컨텍스트**: RULER @ 1M 86.34%, AA-LCR 35.85%  

- **다국어**: MMLU-ProX 평균 59.50%, WMT24++ 86.20%

**처리량**: 단일 H200 GPU에서 8K 입력/16K 출력 시 Qwen3-30B-A3B-Thinking-2507 대비 3.3배, GPT-OSS-20B 대비 2.2배 처리량 향상. FP8 양자화로 BF16 대비 99% 정확도 유지하면서 배치 크기 증가 가능.

**비교 기준**: Qwen3-30B-A3B-Thinking-2507, GPT-OSS-20B 모델 대비 대부분 벤치마크에서 동등 또는 우수한 성능을 보이면서도 활성 파라미터는 3.2B로 절반 이하.

#### 4. Limitations and Open Questions  

- **긴 컨텍스트 성능 변동**: LC-Phase 이후 RULER @ 256K/512K에서 약간의 성능 저하 발생(256K: 82.92%→75.44%). 512k+4k 혼합 전략으로 완화했으나 완전한 회복은 미달성.  

- **품질 필터링 한계**: 번역된 문서 중 일부 무의미한 대화/광고가 Nemotron-CC 품질 분류기에서 높은 점수를 받아 LLM 기반 재필터링으로 10.6% 토큰 제거 필요. 대규모 웹 크롤 데이터의 자동 품질 평가 신뢰성 문제 여전히 존재.  

- **RLHF 길이 제약**: Group Relative Length Control이 과도하게 짧은 응답을 유도할 가능성 있으며, 복잡한 추론이 필수적인 작업에서는 성능 저하 위험.  

- **계산 비용 투명성**: 다환경 RLVR 학습의 실제 GPU 시간과 에너지 소비량에 대한 구체적 수치 미제공.

#### 5. Professional TL;DR (Overall Summary)  

NVIDIA의 Nemotron 3 Nano는 31.6B 파라미터 중 3.2B만 활성화하는 MoE 하이브리드 Mamba-Transformer 아키텍처로, 25조 토큰 사전학습과 다환경 RLVR 및 GenRM 기반 RLHF를 통해 수학/코딩/에이전트 작업에서 SOTA에 준하는 성능을 달성하면서도 동급 모델 대비 최대 3.3배 높은 추론 처리량을 실현한다. 1M 토큰 컨텍스트 지원과 선택적 FP8 양자화를 통한 효율성 개선, 완전한 오픈소스 공개(체크포인트·데이터·코드)는 연구자와 실무자가 접근 가능한 강력한 에이전트 추론 모델의 새로운 기준을 제시한다.

#### 6. Critical Evaluation  

- **문제 정의의 명확성**: 에이전트 추론 모델의 효율성과 처리량 개선이라는 목표를 처리량·정확도·컨텍스트 길이 등 구체적 지표로 명확히 정의하고, 모든 실험에서 공정한 비교를 위해 표준 평가 프로토콜과 오픈소스 도구(Nemo Evaluator SDK)를 사용했습니다. → **9/10**  

- **독창성/의의**: MoE를 하이브리드 Mamba-Transformer에 통합하고 모든 환경에서 동시 학습하는 다환경 RLVR 프레임워크를 제안한 점, GenRM에 원형 비교와 Group Relative Length Control을 결합한 RLHF 방식은 기존 연계 학습 방식과 차별화된 기여입니다. 실용적으로 3.3배 처리량 향상은 에지 디바이스 및 대규모 배포에 직접적 영향을 미칩니다. → **9/10**  

- **결과의 타당성**: 25개 이상의 벤치마크에 대해 재현 가능한 설정(샘플링 전략, few-shot 수, 온도 등)을 명시하고, BF16/FP8 비교, 커리큘럼 vs 랜덤 샘플링, RLVR vs SFT 등 다양한 내부 검증을 수행했습니다. 다만 일부 벤치마크(GPT-OSS-20B의 RULER)는 직접 평가 불가능으로 인한 비교 누락이 있습니다. → **8/10**  

- **영향력/적용성**: 완전한 오픈소스 공개(Apache 2.0 유사 라이선스 가정)로 연구 커뮤니티의 직접적 활용 가능성이 높으며, 1M 컨텍스트와 3.3배 처리량 개선은 실제 에이전트 시스템 구축에 즉각적 경제적 가치를 제공합니다. 다국어 성능은 영어 중심으로 제한적입니다. → **8/10**

**강점**:  

- 탁월한 효율성-성능 균형: 3.2B 활성 파라미터로 30B급 성능과 3.3배 처리량 달성  

- 체계적 오픈소스 공개: 모델뿐 아니라 학습이지문서, 데이터셋, 평가 도구 전체 공개로 재현성 및 확장성 보장  

**약점**:  

- 긴 컨텍스트 확장 후 일부 길이에서 성능 저하 발생, 완벽한 확장 기술 검증 미완료  

- 실패 사례 및 모델의 한계에 대한 심층 분석 부족, 안정성 평가가 주로 벤치마크 중심  

**총점**: **8.5/10**

#### 7. Further Research and Recommendation  

**추가 연구 필요성**: MoE 라우팅 최적화, 긴 컨텍스트 성능 회복을 위한 CPT 전략 개선, 다국어 능력 균형, RLVR의 환경 간 상호작용 메커니즘 규명 등이 향후 연구 주제로 남습니다. 특히 Group Relative Length Control의 과도한 제약 가능성과 GenRM의 보상 해킹 저항성에 대한 장기간 안정성 연구가 필요합니다.  

**추천 여부**: 본 논문은 효율적 대규모 언어 모델 설계와 RL 기반 사후학습의 새로운 기준을 제시하며, 실용적 가치와 연구적 깊이를 동시에 갖추었으므로 **강력히 추천**합니다. 특히 에지 AI, 비용 효율적 에이전트 시스템 개발자와 MoE/하이브리드 아키텍처 연구자에게 필독을 권장합니다.
