---
title: "[논문 AI 리뷰] Mercury: Ultra-Fast Language Models Based on Diffusion"
description: "확산 기반 대형 언어 모델인 Mercury Coder는 Transformer 구조에 확산 과정을 결합해 토큰을 병렬 생성함으로써 코딩 작업에서 기존 자기회귀 모델 대비 8‑10배 빠른 처리량(최대 1109 tokens/sec)과 동일한 품질을 달성했으며, OpenAI API와 호환되는 실용적인 대체 솔루션으로 실제 개발 환경에서도 높은 Elo 점수와 최소 25 ms 지연시간을 기록한다."
date: "2025-11-11T22:42:00.000+09:00"
last_modified: "2026-05-15T08:36:00.000Z"
type: "Paper"
tags:
  - "large language model"
  - "deep learning"
  - "transformer"
categories:
  - "AI논문리뷰"
series:
  - "AI 논문 리뷰"
canonical_url: "https://blog.pieroot.xyz/mercury-diffusion"
markdown_url: "https://blog.pieroot.xyz/mercury-diffusion.md"
---

# \[논문 AI 리뷰\] Mercury: Ultra-Fast Language Models Based on Diffusion

확산 기반 대형 언어 모델인 Mercury Coder는 Transformer 구조에 확산 과정을 결합해 토큰을 병렬 생성함으로써 코딩 작업에서 기존 자기회귀 모델 대비 8‑10배 빠른 처리량(최대 1109 tokens/sec)과 동일한 품질을 달성했으며, OpenAI API와 호환되는 실용적인 대체 솔루션으로 실제 개발 환경에서도 높은 Elo 점수와 최소 25 ms 지연시간을 기록한다.

**한문장 요약**  

이 논문은 확산(diffusion) 기반 언어 모델이 자기회귀(AR) 모델에 비해 코딩 작업에서 최대 10배 빠른 속도(1109 tokens/sec)로 동등한 품질을 달성할 수 있음을 실증했으므로, 생성 AI의 효율성 한계를 돌파하려는 실무자와 연구자 모두에게 반드시 읽어야 할 중요한 연구입니다.

---

#### 1. Main Contributions

- **상업적 규모의 확산 기반 대형언어모델(dLLM) 최초 구현**: Transformer 아키텍처를 유지하면서도 확산 과정을 통해 병렬 토큰 생성을 실현한 Mercury Coder 모델군을 공개함

- **극한적 추론 속도 달성**: Mercury Coder Mini가 H100 GPU에서 1109 tokens/sec, Small이 737 tokens/sec을 기록하며 기존 속도 최적화 모델 대비 평균 10배 빠른 처리량을 달성함

- **속도-품질 프론티어 재정의**: 독립 평가 기관 Artificial Analysis의 코딩 벤치마크에서 속도 최적화 모델(GPT-4o Mini, Claude 3.5 Haiku)과 동등한 품질을 유지하면서도 3-10배 빠른 응답 속도를 보임

- **실제 개발 환경 검증**: Copilot Arena에서 Mercury Coder Mini가 품질 순위 2위(993 Elo)를 기록하는 동시에 평균 25ms의 최저 지연시간을 달성해 실제 개발자 선호도에서 압도적 우위를 입증함

- **기존 생태계와의 완전 호환성**: OpenAI API 표준을 완전히 지원하며, RLHF/DPO 등 기존 LLM 정렬 기법을 그대로 적용할 수 있는 드롭인 방식의 대체 솔루션으로 설계됨

---

#### 2. Key Methods and Approach

Mercury 모델은 **확산 과정(diffusion process)** 을 통해 잠재변수 $z_t$를 점진적으로 노이즈에서 데이터 분포로 역변환하는 방식으로 작동함. 전방 노이즈 과정 $q(z_t|z_{t-1})$과 역방 복원 과정 $p_\theta(z_{t-1}|z_t)$을 정의하며, 손실 함수 $L(x) = -E_t[\gamma(t) \cdot E_{z_t\sim q}\log p_\theta(x|z_t)]$를 최소화하여 학습함. 핵심은 기존 확산 모델을 **코딩 데이터에 맞게 확장**하고, Transformer 기반의 **병렬 디노이징 네트워크**를 구현하여 여러 토큰을 동시에 예측한다는 점임. 추론 시에는 **동적 배치 및 페이징을 지원하는 독점 엔진**을 사용해 GPU 연산 자원을 최대화하며, 코스-투-파인(coarse-to-fine) 생성 전략으로 생성 품질과 속도의 균형을 조정함.

---

#### 3. Main Results and Findings

- **정량적 성능**: Mercury Coder Mini는 HumanEval 88.0%, MBPP 77.1%, MultiPL-E 74.1%를, Small은 HumanEval 90.0%, MBPP 76.6%, MultiPL-E 76.2%를 달성하여 GPT-4o Mini(88.0%/74.6%/72.0%) 및 Claude 3.5 Haiku(86.0%/78.0%/72.3%)와 **동등한 코드 생성 정확도**를 보임

- **속도 우위**: Artificial Analysis의 독립 평가에서 Mini는 1109 tokens/sec, Small은 737 tokens/sec을 기록하며, 동급 모델 대비 **8-10배 빠른 처리량**을 달성함 (예: GPT-4o Mini 171 tokens/sec, Claude 3.5 Haiku 61 tokens/sec)

- **멀티언어 지원**: MultiPL-E 벤치마크에서 6개 언어(C++, Java, JavaScript, PHP, Bash, TypeScript) 평균 성능이 Mini 74.1%, Small 76.2%로, Gemini 2.0 Flash Lite(79.5%)에 근접하면서도 **훨씬 빠른 속도**를 유지함

- **FIM(Fill-in-the-Middle)**: Mini 82.2점, Small 84.8점으로 Codestral 2501(82.5점)을 **뛰어넘는 최첨단 성능**을 달성함

- **실제 사용성**: Copilot Arena에서 Mini는 Elo 점수 993으로 2위를 차지하면서도 평균 지연시간이 **0.25초로 가장 빠른 모델**임을 입증함

---

#### 4. Limitations and Open Questions

- **모델 규모 제한**: 현재 Mini와 Small만 공개되어 있으며, 70B~405B 규모의 대형 모델이나 일반 자연어 처리를 위한 모델은 아직 검증되지 않아 **확산 방식의 극한적 스케일링 특성**이 불명확함

- **훈련 비용 및 안정성 미공개**: 수조 개의 토큰으로 학습했다고 언급했으나, 자기회귀 모델 대비 **실제 훈련 컴퓨트 비용 증가분**이나 수렴 안정성에 대한 구체적 데이터가 제시되지 않음

- **추론 엔진의 독점성**: 속도 향상의 핵심인 동적 배치 및 커스텀 커널 구현 세부사항이 **비공개**이므로 재현성과 커뮤니티 연구 진입 장벽이 존재함

- **벤치마크 범위 제한**: 코딩 작업에만 집중 평가되었으며, 수학적 추론, 장문 이해, 다국어 등 **다른 영역에서의 성능**은 검증되지 않음

---

#### 5. Professional TL;DR (Overall Summary)

Mercury는 Transformer 아키텍처에 확산 과정을 결합해 병렬 토큰 생성을 실현한 최초의 상업적 규모 dLLM으로, 코딩 작업에서 기존 자기회귀 모델을 10배 속도로 대체할 수 있음을 입증함. Mercury Coder Mini/Small은 HumanEval 등 주요 벤치마크에서 GPT-4o Mini 수준의 품질을 유지하면서도 1109 tokens/sec의 처리량과 25ms 지연시간을 달성해 실제 개발 환경(Copilot Arena)에서 품질 2위, 속도 1위를 기록함. 기존 API 표준과 완전 호환되며 RLHF/DPO 정렬이 가능하지만 독점 추론 엔진과 일반 언어 모델에 대한 검증 부재 등 한계가 존재함.

---

#### 6. Critical Evaluation

- **문제 정의의 명확성**: 코딩 도메인의 높은 지연 민감성을 명확히 지적하고, 확산 모델의 병렬 생성이 이를 해결할 수 있음을 논리적으로 제시했으며, 평가 지표(throughput, pass@1)와 비교 대상을 체계적으로 설정했으나, 훈련 비용이나 에너지 효율성 같은 다른 중요한 운영 지표는 언급되지 않음 → **8/10**

- **독창성/의의**: 이미지/비디오 생성에서 성공한 확산 모델을 **대규모 언어 모델로 처음 성공적으로 확장**했으며, 기존 AR 모델과의 호환성을 유지하면서도 극적인 속도 개선을 달성했다는 점에서 방법론적 돌파구를 제시함. 다만 확산 언어 모델 자체는 새로운 개념이 아니므로 근본적 아이디어의 신선함은 제한적임 → **9/10**

- **결과의 타당성**: Artificial Analysis와 Copilot Arena라는 **두 개의 독립적 제3자 평가**를 통해 결과를 검증했으며, 다양한 벤치마크(HumanEval, MultiPL-E, FIM 등)에서 일관된 성능을 보였으나, 추론 속도 측정 조건(배치 크기, GPU 수)이나 훈련 데이터 구성이 공개되지 않아 완전한 재현성은 제한됨 → **7/10**

- **영향력/적용성**: 실제 API 서비스로 배포 가능한 수준의 성능을 보이며, 코딩 보조 도구 시장의 **지연시간 문제를 실질적으로 해결**할 수 있는 잠재력을 가짐. 그러나 아직 일반 언어 모델로의 확장이 검증되지 않았고, 독점 기술 의존도가 높아 광범위한 연구 커뮤니티 영향력은 제한적임 → **8/10**

**강점**:

- **실용적 돌파구**: 기존 AR 모델을 완전히 대체하면서도 10배 속도 향상이라는 압도적 성능 개선을 달성함

- **생태계 호환성**: Transformer 기반 설계와 OpenAI API 표준 준수로 기존 인프라와의 무리 없는 통합이 가능함

**약점**:

- **재현성 부족**: 핵심 성능 요소인 독점 추론 엔진과 훈련 세부사항이 비공개이므로 학술 연구 진입 장벽이 높음

- **범용성 미검증**: 코딩 도메인에만 집중되어 있어 일반 자연어 이해, 수학, 다국어 등 다른 작업에서의 성능을 예측할 수 없음

**총점**: **8.0/10**

---

#### 7. Further Research and Recommendation

**추가 연구 필요성**: 확산 언어 모델의 **스케일링 법칙**이 자기회귀 모델과 근본적으로 다른지, 일반 언어 작업에서도 동일한 효과를 보이는지, 그리고 훈련 컴퓨트 비용이 선형적 증가보다 효율적인지 검증해야 함. 또한 **멀티모달 확산**과의 시너지 가능성, 그리고 엣지 디바이스 배포 시 메모리 효율성도 중요한 연구 방향임.

**추천 여부**: **강력히 추천함**. 이 논문은 생성 AI의 근본적인 효율성 문제에 대한 실용적이고 실행 가능한 해결책을 제시하며, 특히 코딩 보조 도구 개발자나 대규모 AI 서비스 운영자에게는 **즉각적인 실무 적용 가치**가 매우 높음. 다만 학술 연구자는 재현 가능한 공개 구현이 부족하다는 점을 감안해야 함.
