Moonshot AI에서 개발한 고성능 언어 모델. Moonshot의 최강 모델이며, 오픈 소스 1T 파라미터 MoE 구조입니다.
파라미터
Undisclosed
컨텍스트
라이선스
Proprietary
출시일
2026-04-01
일본어 처리 능력
General multilingual model. Basic Japanese processing is possible, but inferior to specialized models.
API 가격
이 모델의 API 가격 정보는 현재 공개되지 않았습니다
강점
약점
활용 사례
심층 분석
LM Arena Code Elo
1526
전체 10위(Instant 변형), 형제 K2.5 Thinking은 7위(1550)
SWE-Bench Verified
76.8%
Claude Opus 4.5: 80.9%, GPT-5.2: 80.0% 대비
AIME 2025
96.1%
Thinking 모드, GPT-5.2: 100% 대비
입력 가격
$0.60/1M
Claude Opus 4.5($15/1M) 대비 약 25배 저렴
컨텍스트 윈도우
256K tokens
Gemini 3 Pro: 1M, Claude 4.5: 200K 대비
GDPval-AA Elo
1309
프론티어 랩 이후 2위 오픈 가중치 모델
전체 / 활성 파라미터
1T / 32B
MoE: 전문가 384개, 토큰당 8개 선택
강점
- ・업계 선도적 Agent Swarm 능력: 최대 100개 병렬 하위 에이전트로 병렬화 가능 과제에서 약 4.5배 가속
- ・공격적인 저가 API($0.60/1M 입력)와 Modified MIT 라이선스 하의 오픈 가중치 제공
- ・MoonViT 네이티브 멀티모달 구조(15T 비전-텍스트 토큰으로 종단 훈련)로 이미지/비디오 이해와 비전 투 코드 워크플로 우수
약점
- ・극단적 출력 장황함(중앙값 대비 약 6배 토큰 생성)으로 저렴한 토큰 단가에도 실제 비용과 지연 증가
- ・높은 자체 호스팅 요구: INT4 양자화 가중치도 약 630GB 저장과 8x H100/H200 GPU 필요, 어텐션 레이어는 BF16 유지
- ・도구 호출 신뢰성 문제: 에이전트 워크플로에서 약 12% 실패율, 가끔 목표 이탈과 불일치 라우팅 출력
경쟁사 비교
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| GPT-5.2 (xhigh) | ~1580* | 80.0% | 92.4% | $2.50/$10.00 |
| Claude Opus 4.5 | ~1570* | 80.9% | 87.0% | $15.00/$75.00 |
| Gemini 3 Pro | ~1560* | 76.2% | 91.9% | $1.25/$5.00 |
| DeepSeek V3.2 | ~1540* | 73.1% | 82.4% | $0.27/$1.10 |
Kimi K2.5 Instant는 Moonshot AI의 플래그십 오픈 가중치 모델의 빠른 응답 변형으로, 토큰당 320억 파라미터만 활성화하는 1조 파라미터 Mixture-of-Experts 구조다. 2026년 1월 27일 출시되었으며, 텍스트와 함께 네이티브 멀티모달(이미지 및 비디오) 입력을 제공하는 최초의 Moonshot 모델로, 통합 비전 능력을 갖춘 선도적 오픈 가중치 모델이 되었다. Instant 변형은 사고망 추론을 비활성화해 속도와 비용 효율에 우선순위를 두며, 챗봇, 빠른 코드 생성, 실시간 비서 같은 대화형 앱을 목표로 한다.
이 모델의 가장 독특한 혁신은 Agent Swarm으로, 프론티어 모델 중 유일한 능력이다. Parallel-Agent Reinforcement Learning(PARL)로 최대 100개 병렬 하위 에이전트를 오케스트레이션해 병렬화 가능한 연구와 분석 과제에서 약 4.5배 가속을 낸다. 공격적인 API 가격($0.60 per 1M 입력 토큰, Claude Opus 4.5 대비 약 25배 저렴)과 결합해 Kimi K2.5 Instant는 오픈 가중치 경제성으로 프론티어급 추론이 필요한 팀을 위한 매력적인 틈새를 차지한다.
하지만 모델에는 실제 트레이드오프가 있다. 출력 생성은 극도로 장황(Artificial Analysis 평가 모음에서 약 8,900만 토큰, 중앙값 모델의 약 6배)해 비용 이점을 일부 잠식한다. 자체 호스팅은 상당한 GPU 인프라(INT4 가중치 약 630GB, 8대 고성능 GPU)가 필요하고, 에이전트 워크플로는 약 12% 도구 호출 실패율을 겪으며, 영어 작성 품질은 Claude와 GPT에 뒤처진다. 256K 컨텍스트 윈도우는 크지만 Gemini의 1M보다 4배 작다. 이 제약을 관리할 의향이 있는 팀, 특히 에이전트나 멀티모달 파이프라인을 구축하는 팀에게 K2.5 Instant는 경쟁 오픈 가중치 모델이 제공하지 못하는 능력을 준다.
출처
- MoonshotAI/Kimi-K2.5 GitHub Repository
- Kimi K2.5 - Everything you need to know (Artificial Analysis)
- What Is Kimi K2.5? Architecture, Benchmarks & Implications (Clarifai)
- Kimi K2.5 for Developers: Strengths, Limits, and Where It Fits (Propel Code)
- Kimi K2.5 Review: 12 Strong Wins, Pricing, And Swarm Risks (BinaryVerse AI)
- Kimi K2.5 Review: Moonshot AI's Open-Weight Agentic Model Tested (OpenAIToolsHub)
- Kimi K2.5 - AI Model Library (Vast.ai)
- Kimi K2.5 review: stronger, still not a legend (OraCore.dev)
- Moonshot AI's Kimi K2.5 Deploys 100 Sub-Agents (Techloy)
- Kimi K2.5 Guide: Features, Benchmarks, Pricing & Uses (GUVI)
분석 생성일: 2026-08-22