Alibaba가 개발한 최신 에이전트 특화 모델. 고급 에이전트 워크플로우 및 추론 능력을 구현합니다.
파라미터
Undisclosed
컨텍스트
라이선스
Proprietary
출시일
2026-05-20
일본어 처리 능력
Multilingual model with strong Japanese language processing capabilities.
API 가격
입력 가격 (1M 토큰당)
$2.5
출력 가격 (1M 토큰당)
$
과금 모드: standard
강점
약점
활용 사례
심층 분석
Artificial Analysis 지능 지수
56.6
218개 이상 순위 모델 중 종합 5위, 중국 모델 중 최고, Qwen3.6 Max Preview 대비 +4.8
Arena AI Elo
~1,489 (종합 14위)
수학 7위, 전문 프롬프트 9위, 소프트웨어·IT 9위, WebDev Arena는 1,541 Elo로 4위
SWE-Bench Verified
80.4%
SWE-Bench Pro: 60.6%, SWE Multilingual: 78.3%, 국내 모델 선두
GPQA Diamond
92.4%
박사 수준 추론, Claude Opus 4.6(91.3%) 상회, GPT-5.5(93.6% 아님 93.6%) 하회
입력/출력 가격
$2.50 / $7.50 per 1M tokens
캐시 입력 $0.25/1M(90% 할인), Claude Opus 4.7 가격의 약 절반
컨텍스트 윈도우
1M tokens
Qwen3.6 Max Preview의 256K 대비 4배, 최대 출력 64K~66K 토큰
강점
- ・프론티어 모델 중 최고의 가격 대비 지능 비율 — 출력 비용 약 3분의 1로 Claude Opus 4.6을 여러 벤치마크에서 상회하거나 맞먹음
- ・100만 토큰 컨텍스트와 1,000회 이상 도구 호출로 입증된 35시간 자율 실행 등 탁월한 장시간 에이전틱 능력
- ・업계 선두의 절제 성향 — AA-Omniscience에서 프론티어 모델 중 가장 낮은 환각률(22.9%), 강한 GPQA Diamond(92.4%)와 HMMT(97.1%) 점수
약점
- ・비전 기능이 전혀 없는 텍스트 전용 — 이미지 이해·UI 스크린샷·컴퓨터 사용 에이전트가 필요한 작업은 모두 불가
- ・추론 모드의 높은 장황함으로 벤치마크 중앙값 2,600만 대비 약 9,700만 출력 토큰 생성, 지연(10~45초 사고 오버헤드)과 작업당 API 비용 크게 증가
- ・오픈 가중치 없음 — 독점 API 전용 접근으로 이전 Qwen 출시와 달리 로컬 배포·파인튜닝·오프라인 사용 제한
경쟁사 비교
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| GPT-5.5 (OpenAI) | ~1,550+ | N/A (published) | 93.6% | $5.00/$30.00 |
| Claude Opus 4.7 (Anthropic) | Top 5 | 64.3% (Pro) | ~91–92% | $5.00/$25.00 |
| Gemini 3.1 Pro Preview (Google) | Top 10 | N/A | N/A | N/A (preview) |
| Gemini 3.5 Flash (Google) | Top 10 | N/A | N/A | $1.50/$9.00 |
| DeepSeek V4 Pro | Below Qwen3.7-Max | N/A | N/A | $1.74/$3.48 |
Qwen3.7-Max-Preview는 알리바바의 플래그십 독점 추론 모델로, 2026년 5월 20~21일 항저우 클라우드 서밋에서 출시되었습니다. '범용 채팅 비서'가 아닌 '에이전트 기반'으로 포지셔닝되어 장시간 자율 코딩, 과학적 추론, 오피스 워크플로 자동화를 목표로 합니다. Artificial Analysis 지능 지수에서 56.6(종합 5위)을 기록해 해당 리더보드에서 순위가 가장 높은 중국 모델입니다. 100만 토큰 컨텍스트(전 세대의 4배), GPQA Diamond 92.4%, SWE-Bench Verified 80.4%를 달성했고, 알리바바 자체 Zhenwu M890 가속기에서 35시간 자율 코딩 실행을 내부 테스트로 입증했습니다.
모델은 시장에서 독특한 스위트 스팟을 점합니다. Claude Opus 4.7이나 Gemini 3.1 Pro Preview의 원천적 지능에 근접하면서 입력 토큰은 약 절반, 출력 토큰은 3분의 1 비용입니다. 공격적인 프롬프트 캐싱($0.25/1M 캐시 입력, 90% 할인)은 수백 턴에 걸쳐 긴 컨텍스트를 다시 읽는 에이전트 워크플로에 특히 매력적입니다. 모델은 OpenAI와 Anthropic API 규격을 모두 네이티브 지원해 Claude Code 같은 도구에 드롭인 통합이 가능합니다. 다만 텍스트 전용(비전 없음)이고, 매우 장황한 추론 흔적을 만들어 토큰 비용을 늘리며, 매우 높은 절제율(48% 시도율)로 환각은 줄이지만 지식 회상 작업의 유용성을 제한합니다.
알리바바의 출시는 상위 계층은 폐쇄 가중치·수익 창출 모델로, 하위 계층은 오픈 가중치로 유지하는 전략적 전환을 뜻합니다(발표된 27B dense·35B MoE 모델은 확정 출시일 없음). Qwen3.6에서 Qwen3.7로의 한 달 주기는 공격적인 개발 속도를 보여줍니다. 엔지니어링 팀에게 Qwen3.7-Max는 텍스트 전용 에이전틱·코딩 워크로드를 위한 가장 강력한 비용 최적화 프론티어 옵션이나, 비전·최고 절대 지능·저지연 채팅이 필요한 팀은 다른 대안을 고려해야 합니다.
출처
- Alibaba's Latest Proprietary Model, Qwen3.7-Max, Challenges U.S. Rivals — The Batch (DeepLearning.AI)
- Qwen 3.7 Max Preview: Benchmarks, Rankings & Open Weights — Bytepith
- Qwen Introduces Qwen3.7-Max: A Reasoning Agent Model With a 1M-Token Context Window — MarkTechPost
- Qwen3.7-Max Performance Benchmarks: Terminal Bench Leader, SWE Scores & 35-Hour T-Head PPU Run — TheRouter.ai
- Qwen3.7-Max Review 2026: Benchmarks, Pricing, Verdict — FelloAI
- How to Use Qwen3.7-Max: Qwen Chat, Pricing & Benchmarks — 7minAI
- Qwen 3.6 Max (preview) vs Qwen3.7 Max: Benchmarks, Pricing, Speed — BenchLM.ai
- Qwen 3.7 Max Review: The $2.50 Model That's Beating Claude Opus 4.6 at Half the Price — MEFAI
- Qwen3.6 Max Preview vs Qwen3.7 Max: Pricing, Benchmarks & API Compared — OminiGate
- Alibaba Cloud Qwen3.7-Max-Preview Debuts on Arena AI — ITHome
- Qwen3.7 Official Blog Post — Qwen (Alibaba)
분석 생성일: 2026-08-06