오픈소스

NVIDIA Nemotron TwoTower

2026년 7월 2일, NVIDIA는 이산 확산(Discrete Diffusion) 기반의 새로운 언어 모델 아키텍처인 Nemotron TwoTower을 공식 발표했습니다. 이는 더 큰 모델이 아닌 완전히 새로운 추론 패러다임으로, 이중 탑 설계를 통해 맥락 모델링과 텍스트 생성을 분리하여 98.7%의 벤치마크 품질을 유지하면서 2.42배의 추론 처리량 향상을 달성했습니다.

한국 AI 개발자와 기업에게 이는 모델 품질을 희생하지 않으면서 LLM 추론 비용을 절반 이상 줄일 수 있음을 의미합니다.

'확산 언어 모델'이란 무엇인가?

기존 LLM은 자기회귀(Autoregressive, AR) 방식으로 토큰별로 텍스트를 생성합니다. 즉, 한 번에 하나의 토큰만 예측할 수 있어 단순하지만 순차 실행으로 인해 속도가 제한됩니다.

Nemotron TwoTower는 이산 확산 방식을 채택했습니다. 모델이 전체 텍스트 블록을 한 번에 생성한 후, 반복적인 디노이징을 통해 점진적으로 최적화합니다. 이는 이미지 생성의 확산 모델과 유사하지만 이산 텍스트 토큰에 적용됩니다.

핵심 혁신은 이중 탑 설계에 있습니다:

구성 요소역할훈련 여부
맥락 탑 (AR)입력 맥락 이해❌ 동결
디노이징 탑 (Diffusion)출력 생성 및 최적화✅ 훈련 (2.1T 토큰만)

맥락 탑은 입력을 이해하는 표준 자기회귀 모델이고, 디노이징 탑은 새로 훈련된 확산 모델로 출력 생성을 담당합니다. 두 모델이 분리되어 디노이징 탑만 훈련하면(2.1T 토큰 대 백본의 25T 토큰), 훈련 비용을 크게 절감할 수 있습니다.

모델 사양

항목사양
개발사NVIDIA
아키텍처하이브리드 Mamba-2 / Transformer / MoE 이중 탑
총 파라미터 수600억 (탑당 30B)
활성 파라미터 수약 30억 (토큰당 탑당 ~3B)
레이어 수탑당 52개 (23 Mamba-2 + 6 Self-Attention + 23 MoE)
전문가 수128 (6 라우팅 + 2 공유)
라이선스NVIDIA Nemotron 오픈 모델 라이선스 (상업적 사용 가능)
하드웨어 요구 사항2x 80GB GPU (확산 모드) / 1 GPU (AR 폴백)
출시일2026년 7월 2일 (NVIDIA AI 발표)

성능 비교

추론 속도

지표Nemotron TwoTowerAR 베이스라인향상도
생성 처리량2.42x1x+142%

기본 구성(gamma=0.8, 블록 크기 16, BF16, 2xH100)에서 Nemotron TwoTower의 벽시계 시간 기준 생성 처리량은 표준 자기회귀 모델의 2.42배입니다.

벤치마크 품질

벤치마크 테스트TwoTowerAR 베이스라인보존율
MMLU78.2478.5699.6%
HumanEval75.5879.2795.3%
GSM8K90.1492.4997.5%
종합98.7%

종합 벤치마크 품질 보존율은 **98.7%**입니다. 코드 및 수학 과제에서 약간의 하락이 있지만( HumanEval -3.7pp, GSM8K -2.3pp), 상식 추론 및 다국어 과제는 안정적이거나 약간 향상되었습니다.

의미와 영향

1. 추론 비용 50% 이상 절감 가능

2.42배의 처리량 향상이 실제 배포로 전환된다면, 동일한 하드웨어로 2.42배의 사용자 요청을 처리하거나 절반의 하드웨어로 동일한 처리량을 달성할 수 있습니다. LLM을 대규모로 배포하는 기업에게 이는 막대한 비용 최적화 기회입니다.

2. 훈련 효율성의 돌파구

디노이징 탑은 2.1T 토큰만 필요로 합니다(백본은 25T 토큰 필요). 이는 다음과 같습니다:

  • 기존 모델에서 확산 버전을 파생하는 비용을 줄일 수 있음
  • 특정 과제에 대해 디노이징 탑을 빠르게 훈련할 수 있음
  • 사전 훈련 비용 대비 추론 이점의 비율이 매우 높음

3. MoE + Mamba + 확산의 융합

Nemotron TwoTower는 전문가 혼합(MoE), Mamba 상태 공간 모델, 이산 확산 세 가지 기술을 하나의 아키텍처에 통합한 첫 번째 모델입니다. 이는 미래 LLM 아키텍처 설계에 새로운 방향을 제시합니다.

하드웨어 요구 사항

모드최소 하드웨어설명
확산 모드 (완전)2x 80GB GPU2.42배 가속 효과
AR 폴백 모드1x 80GB GPU표준 자기회귀 추론

확산 모드는 2장의 80GB GPU(예: H100 또는 A100)가 필요하며, 이는 소비자용 하드웨어 배포를 제한합니다. 하지만 기업용 배포에서는 합리적인 요구 사항입니다.

사용 시나리오 추천

사용 시나리오추천 선택이유
고처리량 추론 서비스Nemotron TwoTower2.42배 가속, 비용 최적
저지연 단일 요청표준 AR 모델확산 모드는 반복 오버헤드 있음
코드 생성표준 AR 모델HumanEval 3.7pp 하락
대규모 배치 처리Nemotron TwoTower처리량 이점 극대화
소비자용 배포AR 폴백 모드1GPU만 필요

결론

Nemotron TwoTower는 더 큰 모델이 아닌 더 빠른 추론 방식입니다. 이는 증명합니다:

핵심 결론:

  • 2.42배 추론 가속, 품질 98.7% 보존 – 속도와 품질을 모두 달성 가능
  • 이중 탑 분리 설계 – 맥락 이해와 텍스트 생성 분리, 훈련 효율성 극대화
  • 디노이징 탑만 훈련(2.1T 토큰) – 기존 모델 파생 비용 극저
  • Mamba + MoE + 확산 삼위일체 아키텍처 – LLM 아키텍처 설계의 새로운 패러다임
  • 상업적 라이선스 오픈소스 – 프로덕션 환경에서 사용 가능

한국 기업에게 Nemotron TwoTower는 주목할 만한 옵션을 제공합니다: 기존 모델을 변경하지 않고 아키텍처 업그레이드를 통해 추론 비용을 크게 절감할 수 있습니다. 확산 추론을 지원하는 하드웨어가 더 많아짐에 따라, 이는 LLM 배포의 표준 최적화 수단이 될 수 있습니다.


관련 기사

에디터의 시각

확산 기반 언어 모델은 아직 초기 단계지만 추론 가속 2.42배는 매력적입니다. 다만 '98.7% 품질 유지'라는 숫자는 다소 의심스럽습니다—어떤 벤치마크로 측정했느냐에 따라 결과가 크게 달라져야 합니다. 그래도 NVIDIA가 새로운 아키텍처 방향을 탐색하는 것은 평가할 만합니다.

댓글 (0)

공유:XHatena

댓글 작성

로딩 중...