Alibaba Cloud (Qwen Team)독점

Qwen3.8-Max-0902

이 모델 비교

Qwen3.8-Max-0902는 2026년 9월 2일 Alibaba Cloud가 Qwen3.8-Max의 포스트트레이닝 리프레시로 배포한 모델이다. 2.4T 파라미터(활성 95B) MoE 기본 구조는 8월 12일 체크포인트와 동일하지만, Code Arena 블라인드 WebDev 리더보드에서 1,691점 1위에 올랐으며 TerminalBench 3.0을 11.3에서 29.0으로 끌어올렸다. 컨텍스트(100만 토큰)와 $2/$6 가격은 동일, 베이징·싱가포르·버지니아의 OpenAI/Anthropic 호환 엔드포인트로 API 전용 제공된다. 새로운 오픈 웨이트는 공개되지 않았으며 다운로드 가능한 체크포인트는 여전히 8월 12일 버전이다.

파라미터

2.4T total / 95B active (MoE)

컨텍스트

1M (991K input / 131K output / 262K reasoning budget)

라이선스

Closed (API-only via QwenCloud)

출시일

2026-09-02

API 가격

입력 가격 (1M 토큰당)

$2

출력 가격 (1M 토큰당)

$6

과금 모드: blended $5/MTok, cache read $0.17

강점

  • Code Arena WebDev 1,691점 1위 — 중국계 모델 최초 블라인드 1위
  • TerminalBench 3.0 2.6배 상승 (11.3 → 29.0), QwenSWEbench V2 70.0 도달
  • OpenAI·Anthropic 호환 API, Claude Code·Codex·Qoder·Qwen Code 직접 통합
  • 실효 $5/MTok, 리더보드 파레토 전선 최고 가격 대비 점수

약점

  • 오픈 웨이트 없음, API 전용(중국 인프라·중국 사법관할권)
  • Opus 5 Max 대비 WebDev 3점 리드는 신뢰구간 내 (±19점)
  • TerminalBench·DeepSWE·에이전트 협업 벤치는 여전히 Opus 5 Max에 뒤짐
  • '0902' 접미사는 버전이 아니라 날짜 스탬프, 동일 문자열에서도 행동이 조용히 바뀔 수 있음

활용 사례

  • Code Arena WebDev 1위가 중요한 프론트엔드·저장소 단위 코딩
  • 장기 다단계 사무 자동화 (CoWorkBench류)
  • $6/출력 토큰의 비용 민감 코드 리뷰·리팩터링 계층
  • Claude Code·Codex·Qoder의 OpenAI 호환 백엔드로 직접 투입

심층 분석

컨텍스트 윈도우

100만 토큰

최대 입력 991K; 출력 131K; 추론 예산 262K; 텍스트/이미지/영상 입력

API 가격

$2 / $6 per 1M

입출력/백만 토큰; 실효 $5/MTok; 캐시 읽기 $0.17

Code Arena WebDev

1위 1,691

블라인드 리더보드 1위; Opus 5 Max를 3점 앞서

TerminalBench 3.0

29.0

이전 Qwen3.8-Max 체크포인트 11.3에서 2.6배

파라미터

2.4T 총 / 95B 활성

MoE; Qwen3.8-Max 동일 아키텍처의 포스트트레이닝 리프레시

라이선스

비공개 (API 전용)

새 오픈 웨이트 공개 없음; 8/12 체크포인트가 최신

강점

  • 타깃팅된 코딩 향상: TerminalBench 3.0은 11.3에서 29.0으로 2배 이상, QwenSWEbench V2는 70.0. 가격은 $2/$6 그대로.
  • Code Arena WebDev 1,691점 1위. 블라인드·실사용자 투표 리더보드를 정상을 처음 차지한 중국계 모델.
  • 리더보드 파레토 전선에서 실효 $5/MTok으로 최상의 가격-점수 비율. Fable 5.1 입력 비용의 약 1/5.
  • 바로 통합 가능: OpenAI·Anthropic 호환 API와 Claude Code, Codex, Qoder, Qwen Code 클라이언트 지원.

약점

  • 오픈 웨이트가 아닌 API 전용(중국 인프라). 모든 호출이 중국 사법관할권에 속한다.
  • Opus 5 Max 대비 WebDev 3점 리드는 신뢰구간 내(±19점, 1,389투표 vs Opus의 1만+). 과대 해석 금지.
  • Qwen 자체 비교표에서도 다수 행(TerminalBench, DeepSWE, CoWorkBench, Toolathlon)에서 Opus 5에 여전히 뒤진다.
  • '0902'는 버전이 아니라 날짜 도장. 동일 모델 문자열에 묶인 행동이 예고 없이 바뀔 수 있다. 스냅샷을 고정하라.

경쟁사 비교

ModelArenaSWEGPQAPrice
Qwen3.8-Max-0902WebDev 1위 1,69170.0 (QwenSWE V2)N/A$2/$6
Claude Opus 5 MaxWebDev 1,68870.0 (QwenSWE V2)N/A$10/$50
Kimi K3 MaxWebDev 1,674N/AN/AN/A
GLM-5.3 Flash57 (AA Index)63.4 (Z.ai)N/A$0.15/$0.50

Qwen3.8-Max-0902는 2026년 9월 2일 출시된 Alibaba 2.4T 파라미터 플래그십의 포스트트레이닝 리프레시다. 동일한 100만 컨텍스트, 동일한 $2/$6 가격으로 Code Arena WebDev 리더보드 1,691점 1위에 올랐다. 블라인드·실사용자 투표 리더보드를 1위로 처음 장악한 중국 개발 모델이며 자체 직전 체크포인트에서 22점 상승을 이뤄냈다. 핵심은 새 아키텍처가 아니라 이제 인지되는 모델 품질의 큰 비중이 포스트트레이닝이며 그게 가격 동결과 함께 제공된다는 점이다.

분석 생성일: 2026-09-06