Alibaba Cloud (Qwen Team)プロプライエタリ

Qwen3.8-Max-0902

このモデルを比較

Qwen3.8-Max-0902 は、2026 年 9 月 2 日に Alibaba Cloud が公開した Qwen3.8-Max のポストトレーニング更新版。基本アーキテクチャ(2.4T パラメータ、95B 活性 MoE)は 8 月 12 日版と同じだが、Code Arena WebDev で 1,691 点の首位を獲得し、TerminalBench 3.0 を 11.3 から 29.0 に伸ばした。100 万トークン文脈と $2/$6 価格は据え置きで、北京・シンガポール・バージニアの OpenAI / Anthropic 互換エンドポイントから利用できる。API 専用で新たなオープンウェイトは公開されていない(8 月 12 日のチェックポイントが最新)。

シェア:XはてブLINE

パラメータ

2.4T total / 95B active (MoE)

コンテキスト長

1M (991K input / 131K output / 262K reasoning budget)

ライセンス

Closed (API-only via QwenCloud)

リリース日

2026-09-02

API料金

入力料金(1Mトークンあたり)

$2

出力料金(1Mトークンあたり)

$6

課金モード: blended $5/MTok, cache read $0.17

強み

  • Code Arena WebDev 1,691 点で首位(中国系モデル初のブラインド首位)
  • TerminalBench 3.0 が 11.3 から 29.0 に 2.6 倍、QwenSWEbench V2 は 70.0 に到達
  • OpenAI / Anthropic 互換 API、Claude Code / Codex / Qoder / Qwen Code を直接統合
  • 実効 $5/MTok、リーダーボードの Pareto 前線で最高価格対スコア

弱み

  • オープンウェイトなし、API 専用(中国法管轄下で運用)
  • WebDev での 3 点リードは信頼区間内(±19 点)、過剰評価に注意
  • Opus 5 Max 比で TerminalBench・DeepSWE・エージェント協調系ベンチは劣後
  • 「0902」はバージョンではなく日付スタンプ — 同じ文字列でも挙動が変わるスナップショット

活用例

  • フロントエンド / リポジトリ単位のコーディング(Code Arena WebDev 首位)
  • 長期・マルチステップの業務自動化(CoWorkBench 系)
  • コードレビュー / リファクタリングの低コスト層($6 / 出力トークン)
  • Claude Code / Codex / Qoder から OpenAI 互換 API 経由での直接利用

深度分析

コンテキスト窓

100万トークン

最大入力991K;出力131K;推論予算262K;テキスト/画像/動画入力

API価格

$2 / $6 per 1M

入出力/100万トークン;実効$5/MTok;キャッシュ読み$0.17

Code Arena WebDev

1位 1,691

ブラインド首位;Opus 5 Maxを3点上回る

TerminalBench 3.0

29.0

前チェックポイント11.3から2.6倍

パラメータ

2.4T総数 / 95B活性

MoE;Qwen3.8-Maxと同構成の後学習更新

ライセンス

非公開(API専用)

新たなオープン重みなし;8/12チェックポイントが残る

強み

  • 的を絞ったコーディング向上:TerminalBench 3.0が2倍以上(11.3→29.0)、QwenSWEbench V2は70.0。価格据え置きの$2/$6。
  • Code Arena WebDev首位1,691。このブラインド・実ユーザー投票リーダーボードで首位を取った初の中国系モデル。
  • 実効$5/MTokでリーダーボードのパレート最適。Fable 5.1の入力約1/5。
  • そのまま組み込み:OpenAI互換・Anthropic互換APIに加えClaude Code、Codex、Qoder、Qwen Code対応。

弱み

  • オープン重みなしのAPI専用(中国インフラ)。すべての呼び出しが中国法の管轄下にある。
  • Opus 5 Maxに対するWebDevの3点リードは信頼区間内(±19点、票1,389対Opusの1万超)。過大評価しないこと。
  • Qwen自身の比較表でも大部分の行(TerminalBench、DeepSWE、CoWorkBench、Toolathlon)でOpus 5に劣る。
  • 「0902」はバージョンではなく日付印。同じモデル文字列で挙動が予告なく変わる恐れあり。スナップショットを固定せよ。

競合比較

ModelArenaSWEGPQAPrice
Qwen3.8-Max-0902WebDev 1位 1,69170.0(QwenSWE V2)N/A$2/$6
Claude Opus 5 MaxWebDev 1,68870.0(QwenSWE V2)N/A$10/$50
Kimi K3 MaxWebDev 1,674N/AN/AN/A
GLM-5.3 Flash57(AA指数)63.4(Z.ai)N/A$0.15/$0.50

Qwen3.8-Max-0902は2026年9月2日に公開されたAlibabaの2.4Tパラメータ旗艦の後学習更新。同一の100万コンテキスト、同一の$2/$6で、Code ArenaのWebDevリーダーボードで1,691点の首位に立った。ブラインドの実ユーザー投票リーダーボードで首位を取った初の中国系モデルであり、自前チェックポイントから22点の躍進だ。物語は新アーキテクチャではなく、知覚されるモデル品質の大きな部分が今や後学習であり、それが価格据え置きで届くということ。

分析生成日: 2026-09-06