Moonshot AI가 개발한 최신 고성능 모델. K2.5의 개선판으로 더 높은 성능을 구현합니다.
파라미터
1
컨텍스트
256K
라이선스
https://huggingface.co/moonshotai/Kimi-K2-Base/raw/main/LICENSE
출시일
2026-04-20
벤치마크 성능
AA Intelligence Index
—
LMArena Elo
—
HLE
—
ARC-AGI-2
—
SWE-bench Verified
—
GPQA Diamond
—
MMLU-Pro
—
LiveCodeBench
—
AIME 2025
—
MATH-500
—
일본어 처리 능력
General multilingual model. Basic Japanese processing is possible, but inferior to specialized models.
API 가격
입력 가격 (1M 토큰당)
$0.95
출력 가격 (1M 토큰당)
$
과금 모드: standard
강점
약점
활용 사례
심층 분석
Arena Elo
1462
코딩 하위아레나: 1514; BenchLM 전체 24위, 검증 11위
SWE-Bench Pro
58.6%
#1 — GPT-5.4(57.7%)·Claude Opus 4.6(53.4%) 상회
SWE-Bench Verified
80.2%
Claude(80.8%)·Gemini(80.6%)와 사실상 동점
DeepSearchQA (F1)
92.5%
Claude(91.3%)·GPT-5.4(78.6%) 선두
입력 가격 (공식 API)
$0.60/1M
Claude Opus 4.6($5/1M) 대비 약 8배 저렴
아키텍처
1T params (32B active)
MoE; 256K 컨텍스트; 오픈웨이트(Modified MIT)
강점
- ・최고 수준의 오픈웨이트 코딩 모델 — $0.60/1M 입력으로 모든 프런티어 경쟁자 상회하는 SWE-Bench Pro
- ・뛰어난 에이전틱·장기 실행 — 300 서브에이전트 스웜, 13시간 자율 코딩 데모, 최강 DeepSearchQA 및 HLE-with-tools 점수
- ・완전 오픈소스(Modified MIT)에 MoonViT 통한 네이티브 비디오/이미지 입력, 8×H100에 INT4 양자화로 배포 가능
약점
- ・순수 추론에서 GPT-5.4·Gemini 3.1 Pro에 뒤짐 (HLE no-tools: 34.7% vs 44.4%; AIME: 96.4% vs 99.2%)
- ・생태계·문서가 중국 우선 성향; 영어 엔터프라이즈 지원·컴플라이언스 도구가 OpenAI/Anthropic보다 덜 성숙
- ・장황한 출력(AA Intelligence Index 평가에서 ~160M 토큰, 중앙값의 4배)이 프로덕션 비용을 부풀리고 다운스트림 파싱 이슈 유발
경쟁사 비교
| Model | Arena | GPQA | Price |
|---|---|---|---|
| GPT-5.4 (xhigh) | N/A | 92.8% | ~$5/~$15 |
| Claude Opus 4.6 (max effort) | N/A | 91.3% | $5/$25 |
| Gemini 3.1 Pro (thinking high) | N/A | 94.3% | N/A |
Kimi K2.6은 2026년 4월 20일 Moonshot AI가 출시한, 2026년 중반 기준 가장 강한 오픈웨이트 코딩·에이전틱 모델이다. 토큰당 32B 파라미터만 활성화하는 1조 파라미터 Mixture-of-Experts 아키텍처를 바탕으로, 밀집 32B 모델에 가까운 추론 비용으로 프런티어급 성능을 낸다. 실제 소프트웨어 엔지니어링을 가장 잘 대표하는 벤치마크 SWE-Bench Pro(58.6%)에서 GPT-5.4와 Claude Opus 4.6을 포함한 모든 비교 모델을 앞서며, Moonshot 공식 API 기준 Claude Opus 4.6 대비 입력 토큰당 약 8배 저렴하다($0.60/1M vs $5/1M).
모델의 설계 철학은 순수 추론 천장보다는 실용적 장기 실행에 맞춰져 있다. Agent Swarm 아키텍처로 최대 300개 병렬 서브에이전트까지 수평 확장하며, 프로덕션 환경에서 며칠 단위 자율 운영을 시연했고, Zig 같은 틈새 언어를 포함한 프로그래밍 언어 전반에서 강한 일반화를 보인다. 도구 사용과 다단계 검색이 필요한 에이전틱 벤치마크(HLE with tools: 54.0%, DeepSearchQA: 92.5%)에서 모든 독점 경쟁자를 앞선다. 256K 컨텍스트, MoonViT 통한 네이티브 멀티모달 입력, Modified MIT 라이선스 하의 완전 오픈소스 릴리스는 인프라 통제가 필요한 팀에 독보적 위치를 제공한다.
트레이드오프는 명확하다. 도구 없는 순수 추론 — 대학원 수준 과학(GPQA Diamond: 90.5% vs Gemini 94.3%), 경쟁 수학(AIME: 96.4% vs GPT-5.4 99.2%), 가장 어려운 지식 벤치마크(HLE without tools: 34.7% vs Gemini 44.4%) — 에서 독점 모델이 유의미한 우위를 유지한다. 프로덕션 AI 시스템을 구축하는 팀에게 K2.6은 다중 모델 스택의 실행 엔진으로 이해하는 것이 최선이다. 구조화 코딩·에이전틱 워크플로·비용 민감 배치 작업은 K2.6으로 라우팅하고, 정확도가 타협 불가능한 고위험 단일 턴 추론은 프런티어 독점 모델에 남겨두라.
출처
- Kimi K2.6 Tech Blog: Advancing Open-Source Coding
- unsloth/Kimi-K2.6 · Hugging Face
- BenchLM: Kimi K2.6 Profile
- BenchLM: Claude Opus 4.6 vs Kimi K2.6
- VerdictPal: Kimi K2.6
- Hyperstack: Kimi K2.6 Benchmarks Comparison
- AIToolsRecap: Kimi K2.6 Review 2026
- RoborRhythms: Kimi K2 Review After 30 Days
- Ofox AI: Kimi K2.6 vs Claude Opus 4.6
- Merge.dev: Kimi K2.6 vs Claude Sonnet 4.6
분석 생성일: 2026-08-05