DeepSeek 개발의 고속 MoE 기초 모델. 284B 파라미터(13B 활성화)이며, 100만 토큰 컨텍스트를 지원. Pro의 27% FLOPs로 동등한 성능을 발휘합니다.
파라미터
2840
컨텍스트
1M
라이선스
MIT
출시일
2026-04-24
벤치마크 성능
AA Intelligence Index
—
LMArena Elo
—
HLE
—
ARC-AGI-2
—
SWE-bench Verified
—
GPQA Diamond
—
MMLU-Pro
—
LiveCodeBench
—
AIME 2025
—
MATH-500
—
일본어 처리 능력
Multilingual model with strong Japanese language processing capabilities.
API 가격
입력 가격 (1M 토큰당)
$0.14
출력 가격 (1M 토큰당)
$0.28
과금 모드: standard
강점
약점
활용 사례
심층 분석
Arena Elo
1436
BenchLM 기준 36,817표 집계
SWE-bench Verified
79.0%
Think Max 모드
입력 가격
$0.14/1M
캐시 미스 기준, 캐시 히트 시 $0.028/1M
출력 가격
$0.28/1M
V4-Pro 대비 약 12배 저렴
컨텍스트 윈도우
100만 토큰
네이티브, V3.2 대비 FLOPs 약 10% 수준
GPQA Diamond
88.1%
Think Max 모드
강점
- ・출력 토큰 100만 개당 $0.28로 압도적인 가격 대비 성능 — Claude Opus 대비 약 90배 저렴
- ・CSA+HCA 하이브리드 어텐션으로 추론 비용을 크게 낮춘 네이티브 100만 토큰 컨텍스트 윈도우
- ・MIT 라이선스 오픈 가중치로 자체 호스팅 가능(약 158GB FP4+FP8), 일반 GPU에서 구동 가능
약점
- ・사실 회상 격차가 큼 — SimpleQA-Verified 34.1% 대 Pro 57.9%로 고위험 지식 작업에 제약
- ・복잡한 에이전틱 작업에서 Pro에 크게 뒤처짐(Terminal-Bench 2.0: 56.9% 대 67.9%)
- ・프리뷰 상태로 가격과 API 동작이 불안정할 수 있으며 아직 GA 아님
경쟁사 비교
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| DeepSeek V4 Pro | ~1550 (추정) | 80.6% | 90.1% | $1.74/$3.48 |
| GPT-5.4 xHigh | ~1674 (추정) | N/A | 93.0% | ~$5/$30 |
| Claude Opus 4.6 Max | ~1619 (추정) | 80.8% | 91.3% | ~$15/$25 |
DeepSeek V4 Flash는 V4 제품군의 효율성 특화형 모델로, 순방향 패스당 활성 파라미터가 13B에 불과한 284B 파라미터 MoE(혼합 전문가) 모델입니다. 2026년 4월 24일 프리뷰로 출력되었으며, 대량·비용 민감한 프로덕션 워크로드의 스위트 스팟을 노리면서도 네이티브 100만 토큰 컨텍스트 윈도우를 유지합니다. 핵심 혁신은 압축 희소 어텐션(CSA)과 고도 압축 어텐션(HCA)을 결합한 하이브리드 어텐션 아키텍처로, 100만 토큰에서 단일 토큰 추론 FLOPs를 이전 세대 V3.2의 약 10%로 줄여 초장문 컨텍스트를 경제적으로 가능하게 합니다.
Flash는 성능이 낮아진 Pro가 아니라, 충분한 사고 예산을 주면 유계 작업에서 비슷한 추론 성능을 내는 별도 학습 모델로 명확히 포지셔닝됩니다. Think Max 모드에서 LiveCodeBench 91.6%, MMLU-Pro 86.2%를 기록해 1.6T 파라미터 Pro와 1~3점 차입니다. 다만 전문가 풀이 작아 Flash는 두 축에서 떨어집니다. 깊은 사실 회상(SimpleQA-Verified 23.8점 격차)과 복잡한 다단계 에이전틱 작업(Terminal-Bench 2.0에서 11점 격차)입니다. DeepSeek 공식 문서도 이 경계를 명시적으로 인정합니다.
가격 모델은 매우 공격적입니다. 입력 $0.14/M, 출력 $0.28/M으로 출력 기준 서구 폐쇄형 대안보다 약 90107배 저렴합니다. 여기에 MIT 라이선스 오픈 가중치와 NVIDIA B200·H100 모두에서 vLLM·SGLang 배포 지원이 더해져, V4 Flash는 고처리량 프로덕션 시스템을 위한 프론티어 인접 성능에 가장 비용 효율적인 경로입니다. 대부분 팀에 권장되는 아키텍처는 하이브리드 라우팅입니다. 트래픽의 7080%는 Flash를 기본으로, 복잡한 에이전틱·지식 집약 작업에만 Pro로 격상합니다.
출처
- DeepSeek V4 Flash Model Card (HuggingFace)
- BenchLM: DeepSeek V4 Flash Profile
- Lambda: DeepSeek V4 Flash Deployment Guide
- DeepSeek Performance Review: V4 Pro & Flash Tested
- WaveSpeed: DeepSeek V4 Pro vs Flash Production Guide
- Syntax Dispatch: DeepSeek V4 Review
- Lushbinary: V4-Pro vs V4-Flash Benchmarks & Pricing
- Convly AI: V4-Pro vs V4-Flash Comparison
- BenchLM: V4 Flash vs V4 Pro Comparison
분석 생성일: 2026-08-07