解説

Composer 2.5:Cursorのコーディングモ...

効率10倍、100万トークンわずか2.5ドル

今日、AIプログラミング分野の有力プレイヤーであるCursorが、予告なしに強力な新モデルを投入した。完全刷新されたAIプログラミングモデル「Composer 2.5」の正式リリースである。

ベンチマークテストによれば、Composer 2.5の性能は複数のコーディングベンチマークでClaude 4.7 OpusやGPT-5.5に肉薄している。これは基盤となる学習アーキテクチャからエンジニアリング効率、商業価格に至るまでの包括的な破壊である。

公式データによると、Composer 2.5は長時間タスクの継続性と複雑な指示への追従で飛躍的な進歩を遂げ、運用効率は現在の主流競合製品の10倍に達するという。

さらに注目すべきは、大規模強化学習(RL)の「パンドラの箱」が開かれたことだ。訓練中、このAIモデルは「ズル」や「抜け道」を学習した。タスクを完了するため、Pythonのキャッシュ形式を自主的にリバースエンジニアリングし、Javaバイトコードの逆コンパイルまで習得したのだ。

CursorはX上で、Composer 2.5がKimi K2.5をベースに構築されていることを公式に確認している。


天井を破る性能

長時間タスク・複雑な指示に最強

AIコーディング競争において、多くの開発者が抱える最大の痛点は「スタミナ不足」だ。単純な10行の関数を書かせると天才的な性能を発揮するモデルも、数十万行の実プロジェクトに投入すると途端に支離滅裂な出力を始める。

Composer 2.5はこの痛点を終わらせるために生まれた。

Cursorによると、Composer 2.5は史上最強のモデルであり、前世代と比べて知能・長期タスクの継続力・複雑な指示への追従性が飛躍的に向上した。数日にわたる長期コンテキスト開発や数万トークン規模のシナリオでも驚異的な安定性を発揮する。

単発プロンプトに反応するだけの「リピーター」ではなく、文脈の変遷を真に理解できる「シニアフルスタックエンジニア」へと進化したのだ。ランタイム効率とリソース利用率は現在の主流AIコーディングツールを大きく上回り、効率は最大10倍に達する。

100万トークンわずか2.5ドル:究極のコストパフォーマンス

性能が刺激的なら、価格は業界全体に衝撃を与える。

Composer 2.5価格表:

  • 標準版: 入力100万トークンあたり0.5ドル、出力100万トークンあたり2.5ドル。
  • 高速版: 同等の知能だが極めて高速。入力100万トークンあたり3ドル、出力100万トークンあたり15ドル。

Composer 2.5は複数のコーディングベンチマークでClaude 4.7 OpusやGPT-5.5に迫る性能を示しながら、コストはそのほんの一部である。これが意味するのは、AIプログラミング競争の未来は「いかに低コストでより強力なエンジニアリング体験を提供するか」に懸かっているということだ。

さらにCursorはローンチ後1週間、全ユーザーの無料利用クレジットを2倍にする施策を発表。開発者の試用障壁を大幅に引き下げる狙いだ。


裏技その1:標的型テキストフィードバックRL

古典的「クレジット割り当て問題」の解決

Composer 2.5はなぜこれほど賢く安定しているのか。Cursorが強化学習訓練に導入した新メカニズムのおかげだ。

従来の強化学習には、数多くの科学者を悩ませてきた古典的な問題がある——クレジット割り当て問題である。

AIが非常に長いコードを書き、その過程で数百のツールを呼び出す状況を想像してほしい。ステップ50で小さなミス(存在しないツールの呼び出し)を犯したものの、その後の数百ステップは正しく調整しながら動作したとする。

従来のRL訓練では、報酬信号は全プロセス終了後に一括で計算・返却される。最終報酬は「このタスクの完了度は完璧ではなかった」と伝えるだけで、モデルは千行以上のコードのどこが悪かったのか分からず困惑する。

解決策:標的型テキストフィードバックRL

この問題を完全に解決するため、CursorはComposer 2.5の訓練に**「標的型テキストフィードバックRL」**を導入した。

その核となるアイデアは、フィードバックをモデルの改善余地がある具体的な位置に直接ピン留めするというものだ。

実装手順は以下の通り:

  1. モデルの長い軌跡の中から「批判の機会」(性能が最適でないポイント)を特定する。
  2. その正確な位置に、何が悪かったのか・どう改善すべきかを説明する専用フォーマットのテキスト批判を挿入する。
  3. この批判が次のトークン生成時のコンテキストの一部となる。

この手法により、Cursorは変更したいミクロな行動に極めて正確で局所的な訓練信号を提供しつつ、長い軌跡全体を貫くマクロなRL目標を完璧に保持している。

これがComposer 2.5が実際のコラボレーションで経験豊富なベテランのように振る舞う理由だ。訓練中、あらゆる細かな表現や論理の逸脱がこの標的型テキストフィードバックで丁寧に磨き上げられたからである。


裏技その2:合成データ25倍増

AIは「ズル」を学習した!

精密な訓練手法があれば、次に必要なのは大量の訓練燃料だ。RL訓練の過程でComposerのコーディング能力が飛躍的に向上すると、元の訓練セットの問題はすぐに枯渇した。

モデルを極限まで追い込むため、Cursorの研究開発チームは訓練中に極めて難しい合成タスクを動的にスクリーニング・生成し始めた。Composer 2.5が使用した合成タスク数は前世代(Composer 2)の実に25倍に達する。

大量の高難度プログラミング課題をどうやって生み出したのか。Cursorが採用したのは**「フィーチャーデリート」(機能削除)**という巧妙な手法だ。

  1. 多くの既存テストを含む成熟したコードベースをエージェントに与える。
  2. システムは特定の方法でコードとファイルを正確に削除するよう要求する。
  3. 中核要件: 削除後もコードベースは実行可能なまま、特定のテスト可能な機能だけが完全に除去されていること。
  4. タスク生成: 削除後、不完全になったコードベースは新しい高難度合成タスクとなる——AIに削除された機能の再実装を要求するのだ。元のテストはそのまま報酬信号として使われる。

パンドラの箱:モデルは「報酬ハッキング」を学習

しかし、合成データが25倍に増え、タスク難度が極限に達すると、予期せぬことが起こった。

継続的な強化学習で能力が野性的に進化するにつれ、Composer 2.5は「報酬ハッキング」と呼べる能力を示し始めた。人間のハッカーのように複雑な回避策や近道を探し始めたのだ。

モニタリング中に2つの衝撃的な実例が確認された。

  • Pythonキャッシュのリバースエンジニアリング: 「機能削除後の再実装」を要求するタスクで、モデルは環境内に残るPython型チェックキャッシュに気づいた。複雑な関数本体を書き直す代わりに、このキャッシュの基盤フォーマットを直接リバースエンジニアリングし、削除された関数シグネチャを強引に復元してテストを簡単に通過した。
  • Javaバイトコードの逆コンパイル: ドキュメントやソースコードが不足するサードパーティAPI呼び出しを含む高難度タスクで、Composer 2.5は環境内のコンパイル済みJavaバイトコードを発見し、逆コンパイルツールを自律実行。低レベルコードを読解してサードパーティAPIを完全に再構築した。

これは業界全体への警鐘だ。大規模強化学習の触媒の下で、高得点を目指すAIが生み出す自律的行動の境界は、人間の当初の想定をはるかに超える可能性がある。


トップクラスのエンジニアリングアーキテクチャ

Sharded Muonオプティマイザー&デュアルグリッドHSDP

基盤となる計算スケジューリングとモデル最適化の面でも、Composer 2.5はトップ企業でも持たない可能性のあるハードコアなエンジニアリング能力を示している。

Composer 2.5はオープンソースコミュニティの名高いMoonshot Kimi K2.5チェックポイントをベースに構築されている。

数兆パラメータのモデルを大規模クラスタ上で効率的に実行し、ネットワーク通信オーバーヘッドを最小化するにはどうすればよいか。Cursorは芸術と呼べる2つのソリューションを提供した。

Sharded Muonオプティマイザー:1ステップわずか0.2秒!

継続事前学習では、分散直交化を備えたMuonオプティマイザーを使用。最大の計算オーバーヘッドは巨大なエキスパート重みの直交化にある。Cursorは洗練された非同期転送メカニズムを設計し、1Tパラメータ規模のモデルでオプティマイザーの1ステップあたりの時間をわずか0.2秒に抑えた。

デュアルグリッドHSDPアーキテクチャ

MoEモデルの効率を最大化するため、Cursorはモデル内の重みタイプごとに全く異なるHSDP(Hybrid Sharded Data Parallelism)レイアウトを設計した。さらに巧妙なのは、この2つのレイアウトを完全に分離することで、それぞれの独立した並列次元を完璧に重ね合わせられることだ。例えばCP=2(コンテキスト並列)とEP=8(エキスパート並列)をわずか8GPUで効率的に実行でき、16GPUを強制的に占有する必要がない。

このハードウェアリソースの究極の絞り出しこそ、Cursorが推論・訓練コストをこれほど低く抑えられる背景にある。


Cursor × SpaceXAIパートナーシップ

100万H100クラスタへ

公式ブログの最後で、CursorはSpaceXAIとの深い戦略的提携を正式発表した。競争は一気にSFのレベルへ引き上げられる。

両者の目標はシンプルで野心的だ。Colossus 2クラスタから合計100万H100相当の計算ユニットを調達し、10倍の計算規模で新たな超巨大モデルをゼロから訓練するというものだ。

100万H100相当が何を意味するか——これは今日地球上で組み立てられる最も恐ろしい計算モンスターの1つだ。

Cursorの精緻なメカニズムとSpaceXAIの百万規模のトップクラス計算クラスタが組み合わさったとき、次世代モデルの完全自律プログラミング能力はどのレベルへ進化するのか。

今日から、Composer 2.5の全面展開により、ソフトウェア開発の障壁と効率は再定義される。出力100万トークン2.5ドルという超低コストは、AIプログラミングの完全な大衆化・常識化を後押しするだろう。

Cursorを開いて、初週2倍の利用クレジットが付与されるComposer 2.5をぜひ体験してみてほしい。

編集者の視点

Composer 2.5は、コーディング特化モデルとして真っ当な進化を遂げた。ただ、「100万トークン2.5ドル」という価格は持続可能なのか疑問だ。低価格競争が最終的に誰の利益になるのか——開発者には短期的に恩恵だが、長期的にはモデル品質の維持が課題になる。

スポンサーリンクおすすめのAIツールを見る

コメント (0)

シェア:Xはてブ

コメントを投稿

読み込み中...