NVIDIA Nemotron TwoTower
2026년 7월 2일, NVIDIA는 이산 확산(Discrete Diffusion) 기반의 새로운 언어 모델 아키텍처인 Nemotron TwoTower을 공식 발표했습니다. 이는 더 큰 모델이 아닌 완전히 새로운 추론 패러다임으로, 이중 탑 설계를 통해 맥락 모델링과 텍스트 생성을 분리하여 98.7%의 벤치마크 품질을 유지하면서 2.42배의 추론 처리량 향상을 달성했습니다.
한국 AI 개발자와 기업에게 이는 모델 품질을 희생하지 않으면서 LLM 추론 비용을 절반 이상 줄일 수 있음을 의미합니다.
'확산 언어 모델'이란 무엇인가?
기존 LLM은 자기회귀(Autoregressive, AR) 방식으로 토큰별로 텍스트를 생성합니다. 즉, 한 번에 하나의 토큰만 예측할 수 있어 단순하지만 순차 실행으로 인해 속도가 제한됩니다.
Nemotron TwoTower는 이산 확산 방식을 채택했습니다. 모델이 전체 텍스트 블록을 한 번에 생성한 후, 반복적인 디노이징을 통해 점진적으로 최적화합니다. 이는 이미지 생성의 확산 모델과 유사하지만 이산 텍스트 토큰에 적용됩니다.
핵심 혁신은 이중 탑 설계에 있습니다:
| 구성 요소 | 역할 | 훈련 여부 |
|---|---|---|
| 맥락 탑 (AR) | 입력 맥락 이해 | ❌ 동결 |
| 디노이징 탑 (Diffusion) | 출력 생성 및 최적화 | ✅ 훈련 (2.1T 토큰만) |
맥락 탑은 입력을 이해하는 표준 자기회귀 모델이고, 디노이징 탑은 새로 훈련된 확산 모델로 출력 생성을 담당합니다. 두 모델이 분리되어 디노이징 탑만 훈련하면(2.1T 토큰 대 백본의 25T 토큰), 훈련 비용을 크게 절감할 수 있습니다.
모델 사양
| 항목 | 사양 |
|---|---|
| 개발사 | NVIDIA |
| 아키텍처 | 하이브리드 Mamba-2 / Transformer / MoE 이중 탑 |
| 총 파라미터 수 | 600억 (탑당 30B) |
| 활성 파라미터 수 | 약 30억 (토큰당 탑당 ~3B) |
| 레이어 수 | 탑당 52개 (23 Mamba-2 + 6 Self-Attention + 23 MoE) |
| 전문가 수 | 128 (6 라우팅 + 2 공유) |
| 라이선스 | NVIDIA Nemotron 오픈 모델 라이선스 (상업적 사용 가능) |
| 하드웨어 요구 사항 | 2x 80GB GPU (확산 모드) / 1 GPU (AR 폴백) |
| 출시일 | 2026년 7월 2일 (NVIDIA AI 발표) |
성능 비교
추론 속도
| 지표 | Nemotron TwoTower | AR 베이스라인 | 향상도 |
|---|---|---|---|
| 생성 처리량 | 2.42x | 1x | +142% |
기본 구성(gamma=0.8, 블록 크기 16, BF16, 2xH100)에서 Nemotron TwoTower의 벽시계 시간 기준 생성 처리량은 표준 자기회귀 모델의 2.42배입니다.
벤치마크 품질
| 벤치마크 테스트 | TwoTower | AR 베이스라인 | 보존율 |
|---|---|---|---|
| MMLU | 78.24 | 78.56 | 99.6% |
| HumanEval | 75.58 | 79.27 | 95.3% |
| GSM8K | 90.14 | 92.49 | 97.5% |
| 종합 | — | — | 98.7% |
종합 벤치마크 품질 보존율은 **98.7%**입니다. 코드 및 수학 과제에서 약간의 하락이 있지만( HumanEval -3.7pp, GSM8K -2.3pp), 상식 추론 및 다국어 과제는 안정적이거나 약간 향상되었습니다.
의미와 영향
1. 추론 비용 50% 이상 절감 가능
2.42배의 처리량 향상이 실제 배포로 전환된다면, 동일한 하드웨어로 2.42배의 사용자 요청을 처리하거나 절반의 하드웨어로 동일한 처리량을 달성할 수 있습니다. LLM을 대규모로 배포하는 기업에게 이는 막대한 비용 최적화 기회입니다.
2. 훈련 효율성의 돌파구
디노이징 탑은 2.1T 토큰만 필요로 합니다(백본은 25T 토큰 필요). 이는 다음과 같습니다:
- 기존 모델에서 확산 버전을 파생하는 비용을 줄일 수 있음
- 특정 과제에 대해 디노이징 탑을 빠르게 훈련할 수 있음
- 사전 훈련 비용 대비 추론 이점의 비율이 매우 높음
3. MoE + Mamba + 확산의 융합
Nemotron TwoTower는 전문가 혼합(MoE), Mamba 상태 공간 모델, 이산 확산 세 가지 기술을 하나의 아키텍처에 통합한 첫 번째 모델입니다. 이는 미래 LLM 아키텍처 설계에 새로운 방향을 제시합니다.
하드웨어 요구 사항
| 모드 | 최소 하드웨어 | 설명 |
|---|---|---|
| 확산 모드 (완전) | 2x 80GB GPU | 2.42배 가속 효과 |
| AR 폴백 모드 | 1x 80GB GPU | 표준 자기회귀 추론 |
확산 모드는 2장의 80GB GPU(예: H100 또는 A100)가 필요하며, 이는 소비자용 하드웨어 배포를 제한합니다. 하지만 기업용 배포에서는 합리적인 요구 사항입니다.
사용 시나리오 추천
| 사용 시나리오 | 추천 선택 | 이유 |
|---|---|---|
| 고처리량 추론 서비스 | Nemotron TwoTower | 2.42배 가속, 비용 최적 |
| 저지연 단일 요청 | 표준 AR 모델 | 확산 모드는 반복 오버헤드 있음 |
| 코드 생성 | 표준 AR 모델 | HumanEval 3.7pp 하락 |
| 대규모 배치 처리 | Nemotron TwoTower | 처리량 이점 극대화 |
| 소비자용 배포 | AR 폴백 모드 | 1GPU만 필요 |
결론
Nemotron TwoTower는 더 큰 모델이 아닌 더 빠른 추론 방식입니다. 이는 증명합니다:
핵심 결론:
- 2.42배 추론 가속, 품질 98.7% 보존 – 속도와 품질을 모두 달성 가능
- 이중 탑 분리 설계 – 맥락 이해와 텍스트 생성 분리, 훈련 효율성 극대화
- 디노이징 탑만 훈련(2.1T 토큰) – 기존 모델 파생 비용 극저
- Mamba + MoE + 확산 삼위일체 아키텍처 – LLM 아키텍처 설계의 새로운 패러다임
- 상업적 라이선스 오픈소스 – 프로덕션 환경에서 사용 가능
한국 기업에게 Nemotron TwoTower는 주목할 만한 옵션을 제공합니다: 기존 모델을 변경하지 않고 아키텍처 업그레이드를 통해 추론 비용을 크게 절감할 수 있습니다. 확산 추론을 지원하는 하드웨어가 더 많아짐에 따라, 이는 LLM 배포의 표준 최적화 수단이 될 수 있습니다.
관련 기사
- Kimi K2.7 Code, GitHub Copilot 진출: 오픈소스 모델 최초 주요 개발 도구 체인 통합
- Claude Sonnet 5 발표: Anthropic 최강 중간 모델이 GPT-5.5를 전면 초월
- 미퇀 LongCat-2.0: 1.6조 파라미터 모델 전량 국산 칩으로 훈련, MIT 오픈소스
에디터의 시각
확산 기반 언어 모델은 아직 초기 단계지만 추론 가속 2.42배는 매력적입니다. 다만 '98.7% 품질 유지'라는 숫자는 다소 의심스럽습니다—어떤 벤치마크로 측정했느냐에 따라 결과가 크게 달라져야 합니다. 그래도 NVIDIA가 새로운 아키텍처 방향을 탐색하는 것은 평가할 만합니다.
로딩 중...