速報

Grok 4.7とSol安値: AI最新ニュース 9月24日

Grok 4.7とSol安値: AI最新ニュース 9月24日

今週の本質はベンチマークじゃない

xAIが日曜日にGrok 4.7を出し、月曜日にはAnthropicがClaude Opus 5.5を、OpenAIがGPT-6 SolとLunaを約90分差で投入した。2日で3つのフロンティア研究室、3つの旗艦モデル。私が本当に面白いと思ったのは、どれも「世界最速」を看板にしていないことだ。そろって「安全」を前面に出した。

Grok 4.7の発表は、コーディングのスコアと同じくらい「これまでで最も較正された安全機構」に紙面を割いた。OpenAIのSol/Luna資料は拒否の巻き戻り率や模擬掲示板テストを持ち出す。AnthropicはOpus 5.5を公開前にMETRとFrontier Designに通している。競っているはずの3社が、戦いの場に揃ってガードレールを引き合わせて現れるとき、「競争」という言葉は振付されたものに見え始める。

私は何週間も、アクセス層と評価ゲートは安全ではなく商業的な調整弁だと書いてきた。今週はその証拠として最も明白だ。

Grok 4.7:最新の挑戦者

xAIの新モデルは万能旗艦ではなく、コーディングと知識ワーク特化だ。仕様は具体的だ。コンテキストは50万トークン、テキストと画像入力でテキスト出力、出力上限なし、推論強度は低/中/高(既定)/xhigh。価格は入力100万トークン2ドル、キャッシュ済み入力0.50ドル、出力6ドル(200k未満)、それ以上は倍額。高速版は出力速度を2倍にして価格も2倍。

xAIが公表した数字(ベンダー値として扱え)では、CursorBench 4.0は46.3%。Grok 4.6の40.4%、Claude Fable 5.1最大の51.8%に対して、コーディングでAnthropicとの差を詰めたが届かず。DeepSWE v1.1(高)は65.2%から71.0%に上昇。Terminal-Bench 4.0は20.3%から38.0%へ飛躍——Fableの57.9%には及ばないものの、エージェント的ツール操作でこれまで惨敗していたモデルの大きな一歩。EEBenchは64.0%でFableの56.4%を上回る。

見るべきは安全スタックだ。xAIはLatchBio生物安全スコア62.4%、HackerBench v0.3で高リスクの二重用途プロンプトのうち通過したのは3.3%と主張する。またGrok Botハーネス(エージェント実行環境)をネイティブに理解する。これが肝だ。Grok 4.7はチャット箱に座るためではなく、永続するクラウドマシン上のチームメイトとして動くために作られた。Cursor、Grok Build、Grok API、サードパーティ製ハーネスで即日提供。

値下げ競争は脇役

皆が料金表を見つめている。Solは2ドル/10ドル、Lunaは0.10ドル/0.50ドル、Opus 5.5は4ドル/20ドル。私はこれを昨日扱った。新しいのは「調整」だ。3社が48時間の枠内に旗艦を落とし、それぞれ外部評価者のはんこを押してある。独立評価が規制の後付けではなく、出荷機能になりつつある。OpenAIはAnthropicがMETRを前面に出した同じ日に「第三者評価の原則」を公表した。

それは本物の安全文化の変化か、四半期で最も高価なPRか。私の賭けは「両方、しかもPRこそが狙い」だ。

クイック・スキャン

  • 阿里巴巴はQwen3.8-Maxの0902チェックポイントを更新。2.4兆パラメータ、100万トークン文脈、CodeArenaは22ポイント増の1691で価格は据え置き。Qwen3.8 27Bも同時公開。(ベンダー値)
  • MetaのMuse Spark 1.3は1.2比でトークン使用を約25%、ツール呼び出しを約20%削減し、20人以上の話者識別を持つMuse Voice Transcribeを追加したとされる。(報道値、ベンダー確認要)
  • ある実務者ノートは、OpenAIが本日9月24日付でSora APIを停止すると書いている。だがOpenAIのニュースページに9月23日時点で停止の告知はない。ベンダーが認めるまで未確認として扱うべきだ。
  • AppleのiOS 27.2ベータは中国向けにモーションデータ制限を追加し、「振って広告を開く」挙動を無効化する。広告テクノロジーとのいたちごっこがここまで来た小さな、だが示唆に富むサインだ。

編集者の視点

日本の読者にとって、この一週間の実務的な意味は性能表より調達経路にある。Opus 5.5はAmazon BedrockとGoogle Cloudで提供されるから、既存のクラウド契約の枠内でそのまま入る。Grok 4.7はAPIとCursor経由、Sol/LunaはOpenAI API専用だ。つまり「どのモデルが良いか」ではなく「どのクラウドの契約を持っているか」が選択を決める。私の予測はこれだ。3か月以内に、この3社のうち少なくとも1社が独立監査の公表後に安全に関する主張のいずれかをこっそり修正する。今週の同期は競争ではなく、規制当局に向けて笑い方を覚えたカルテルのそれだ。私が見るのはベンチマーク表ではなく、監査ログである。

スポンサーリンクおすすめのAIツールを見る

コメント (0)

シェア:Xはてブ

コメントを投稿

読み込み中...