AIエージェント

AIエージェント開発の最新動向 2026年版:ランタイム・エンジニアリングへの転換と優先すべき7つの要素

エグゼクティブ・サマリー

過去2年間、AIエージェントの開発の重点は、「より強力なモデルにいくつかの関数を接続する」ことから、「モデルを回復可能・監視可能・管理可能・スケーラブルなランタイムシステムに組み込む」ことに明確に移行してきました。業界を最も強く示すシグナルは、モデル能力の向上だけでなく、OpenAIがBackgroundモード、Sessions、Agents SDK、Tracing、Evalsを第一級の開発基盤として整備したこと、AnthropicがSkills、MCP、Memory、Compaction、Context Editing、Advisor、Managed Agentsを順次補完したこと、そしてGoogleがADK、A2A、Agent Runtime、Sessions、Memory Bank、Agent Gateway、Observabilityを一つのプラットフォームとして組織化したことに表れています。Microsoft、LangGraph、Qwen-Agent、Alibaba Cloud百炼(Bailian)、Cozeなどもそれぞれ、マルチエージェント、回復可能な実行、オープンソースローカライゼーション、ワークフローのプラットフォーム化において、同じ進化のカーブを補完しています。言い換えれば、業界はエージェントを「プロンプト・テクニック」から「ランタイム・エンジニアリング」へと再定義しているのです。

本レポートの全体的な判断は、ほとんどの製品チームにとって最優先すべきは、いきなり任意の自律型マルチエージェントを作ることではなく、以下の7つの基本事項を堅固に実装することです:長時間実行とコンテキスト・エンジニアリング、グラウンディングとエージェント型RAG、ツールとプロトコルの相互運用性、セキュリティと実行隔離、評価と監視可能性、オーケストレーションとモデルルーティング、そして開発者体験とデプロイメントインフラです。Anthropicは明確に「最もシンプルな実現可能な解決策」を見つけ、ワークフローとエージェントを区別することを推奨しています。OpenAIは、マルチエージェントをhandoffsとagents-as-toolsの2つの明確なモードに分解し、Alibaba Cloud百炼もエージェント、ワークフロー、ハイコードアプリケーションを並列する3つのモードとして整理しています。プラットフォーム横断的なコンセンサスが形成されつつあります:まずワークフロー、次にエージェント;まず評価、次に自律化;まずガバナンスの境界を設け、次に権限を委譲する。

優先度について、本レポートは「長時間実行とコンテキスト・エンジニアリング」「グラウンディングとエージェント型RAG」「評価と監視のクローズドループ」「セキュリティ/権限/実行隔離」を最上位に位置づけます。これらの能力は、製品がデモ段階から本番環境に移行できるかどうかを直接左右するからです。永続的なセッション、チェックポイント、コンテキスト圧縮、状態復元機能がないと、エージェントは複数ターンや長時間タスクにおいて記憶喪失、ドリフト、または再作業を起こします。グラウンディングがなければ、エージェントは新しい情報やプライベートな知識を信頼性高く処理できません。評価とトレーシングがなければ、チームはモデル、ツール、検索、プロンプトのどこを最適化すべきかを知り得ません。サンドボックス、承認、ポリシーゲートウェイがなければ、副作用のあるあらゆるエージェントは企業のリスク審査を通過することが難しくなります。OpenAI、Anthropic、Googleの3社の公式ドキュメントは、いずれもこれらの能力をプラットフォームレベルの特性として前面に配置し、「追加コンポーネント」とは位置付けていません。

コスト最適化の主流方向も変化しています。業界はもはや「より小さなモデルへの切替」という単一戦略に主に依存するのではなく、プロンプトキャッシュ、コンテキスト編集、ツールの動的ロード、モデルルーティング、カスケード、そしてアドバイザー=エグゼキューターのデュアルモデルモードを組み合わせて使用しています。AnthropicのTool Searchドキュメントによれば、複数サービスのツール定義は容易に約55kトークンを消費し得ますが、動的なオンデマンドロードにより通常85%以上のツールコンテキストを削減できます。OpenAIのPrompt Cachingドキュメントでは、入力コストを最大90%、レイテンシを最大80%低減できると述べています。AnthropicのAdvisorツールは、「高知能モデルが中途戦略指導のみを行い、低コストモデルが主体の出力を生成する」という内蔵モードを実現しています。コスト/レイテンシの最適化は、「モデル選択」から「ランタイムおよびコンテキスト最適化」へと拡大しました。

製品チームに1つの総合的なアドバイスをするとすれば、それはこうです:エージェントを「外部アクション能力を持つ回復可能なワークフローシステム」として捉え、「自ら考え出すチャットモデル」として捉えないこと。真の競争力は、フレームワークの名前ではなく、タスクの成功基準、ツールインターフェース、状態レイヤー、承認境界、評価のクローズドループ、そしてデプロイメントランタイムへのエンジニアリングの度合いによって築かれます。Anthropicは、フレームワークが不要な抽象化を生み出しがちであることを明確に指摘しています。LangGraph、OpenAI Agents SDK、Google Agent Platformの方向性もまた、ビジネスの成否は結局のところruntime、traces、evals、state、policyに依存し、「いくつのエージェントを使用したか」には依存しないことを証明しています。

研究方法と根拠

本レポートは、公式ドキュメント、公式エンジニアリングブログ、技術レポート、そして直近2年のベンチマーク/論文を主要な根拠としています。Anthropic、OpenAI、Google Cloud、Microsoft AutoGen、Model Context Protocolの公式仕様、そして最近2年の公開ベンチマーク(OSWorld、τ-bench、BFCL、SWE-bench Verified、TheAgentCompany)を優先的に使用しました。同時に、Alibaba Cloud百炼、Coze、Qwen-Agent、Qwen Codeといった中国語の公式ソースを補足として加え、ワークフローのプラットフォーム化、MCP接続、スキル体系、そしてローカル/オープンソース化における中国市場のエンジニアリング実践を観察しました。

ユーザーの関心事項と比較して、本レポートは特に、「經常的に過小評価されているが、すでに主流プラットフォームの内蔵能力となっている」 3つの方向性を強調しています。第一はコンテキストエンジニアリングと状態の耐久性です。Anthropicは2025年に、「コンテキストエンジニアリング」をプロンプトエンジニアリングから明確に区別しました。LangGraph、OpenAI、Googleもまた、durable execution、sessions、resume、background modeをランタイムレイヤーに前面配置しています。第二はプロトコルの相互運用性です。MCPはツール/データ接続の標準となりつつあり、Googleが導入したA2Aはエージェント間通信の標準化を目指しています。第三は実行隔離とガバナンスです。Claude Code、Codex、Google Agent Gatewayに至るまで、業界はサンドボックス、承認、監査、IAMを本番環境向けエージェントの必須条件と見做しています。

業界の進化と優先度の判断

大多数の予算、業界、技術スタックが未確定の製品チームに対して、以下の表のようにリソース投入の優先順位をつけることを推奨します。その根拠は「学問的に最もクールかどうか」ではなく、実際の製品成功率、管理可能性、単位経済、そしてデリバリー・リスクへの限界効果です。特に強調したいのは、マルチエージェントや複雑なオーケストレーションが最優先ではないということです。Anthropicのマルチエージェントシステムの実践では、初期バージョンが単純なクエリに対して過剰なサブエージェントを作成し、終りのない検索や相互干渉を引き起こすことが指摘されています。つまり、前述の状態管理、ツール、評価、セキュリティレイヤーがなければ、マルチエージェントは複雑性を増幅するだけだということです。

優先度方向現時点で優先すべき理由代表的な適用場面
最高長時間実行、状態の耐久性、コンテキストエンジニアリング主流プラットフォームがすべて、sessions、checkpoints、background mode、compaction、context editingを第一級の能力として実装。これはデモから本番への最大の断層を示す。リサーチ、カスタマーサービス、コーディング、承認フロー、長文フォーム処理
最高グラウンディングとエージェント型RAG公式プラットフォームがcitations、web/file search、grounding、knowledge baseを同時に強化。「現実世界の証拠を接続する」ことがエージェントの標準装備であり、オプションの強化ではない。企業ナレッジアシスタント、レポート生成、オペレーション分析
最高評価、監視可能性、最適化のクローズドループOpenAI Evals/Tracing、Google Online Monitors、AnthropicのツールUX最適化事例が示す通り:トレースと評価がなければ、問題がモデル、ツール、検索、オーケストレーションのどこにあるのかを知ることはできない。すべての本番環境向けエージェント
最高セキュリティ、権限、実行隔離、ガバナンスCodex/Claude/Googleはすべて、サンドボックス、承認、ゲートウェイ、IAM、監査専用モードを本番環境への前提条件としている。アクションを起こす能力が高ければ高いほど、まず権限を制限する必要がある。コーディングエージェント、企業オペレーションエージェント、MCP接続
高ツール使用、スキル/プラグイン、プロトコル相互運用性MCP、Skills、Tool Search、A2A、Agent 2.0はすべて「拡張性のプラットフォーム化」を指向。ビジネスが複数のシステムに接続する必要が生じると、このレイヤーはすぐにボトルネックとなる。内部システム統合、企業オートメーション
高オーケストレーション、モデルルーティング、Advisor、マルチエージェントタスクの複雑さと単位コストが上限に達し始めると、workflow、handoff、route、cascade、advisorが構造的な利益を生み始める。複雑なリサーチ、コードエージェント、混合SLA製品
高開発者体験、デプロイメント、インフラ複数環境、複数テナント、複数チームの協業が始まると、runtime、ワークフローのバージョニング、非同期実行、トポロジー、サンドボックスプロバイダーの抽象化がデリバリー速度と運用コストを決定する。プラットフォームチーム、企業への本格導入

重点方向と方法の比較

長時間実行、状態の耐久性、コンテキストエンジニアリング

長時間実行は「特殊な要件」からエージェント製品の中核的要件へと変化しました。OpenAIのBackgroundモードは数分レベルの複雑なタスク専用に設計され、その非同期ポーリング機構がレスポンスを一時保存するためZDRとは互換性がないと明記しています。OpenAI Agents SDKは、sessions、conversationId、previousResponseIdを異なる持続化戦略として位置付けています。LangGraphはthread、checkpoint、super-step、pending writes、タイムトラベルデバッグを基盤レイヤーに落とし込んでいます。Anthropicはさらに、compaction、context editing、memory tool、そして複数コンテキストウィンドウ向けのinitializer/coding-agentハーネスを体系的なソリューションとして提供しています。業界はもはや「1つのコンテキストウィンドウで1つのことを完了する」という前提ではなく、タスクがウィンドウ、ターン、プロセスを跨いで持続するという前提に立っています。

这类のシステム設計の鍵は、「履歴をプロンプトに結合する」ことだけでなく、ワーキングメモリ、回復可能な状態、成果物の状態、長期記憶を分離して管理することです。Anthropicのlong-runningハーネスの事例では、compactionだけでは不十分で、初期化エージェントがinit.sh、進捗ログ、機能チェックリスト、gitコミット基線を作成し、後続のエージェントが素早く引き継げるようにする必要があると説明しています。Anthropicのmemory toolは、モデルが自動的に/memoriesディレクトリをチェックして記憶を読み書きできるようにします。Google Agent Platformは、long-running agents、Sessions、Memory Bankを別々にモデル化しています。Mem0が代表する研究方向は、全トランスクリプトの再生ではなく、選択的な抽出、統合、検索を試みています。真に成熟したシステムは、「コンテキスト」を無限に積み重ねるチャット履歴ではなく、希少なリソースとして扱います。

この方向の主要な指標として、少なくともタスクの跨回復成功率、平均回復時間、コンテキスト圧縮後の回帰エラー率、キャッシュヒット率、成功タスクあたりのトークンコスト、そして人間への引き継ぎ率を追跡することを推奨します。未解決の問題は主に、要約のドリフト、状態の再現時の整合性、記憶汚染、プライバシー保持期間、そして異なるレイヤーの状態間の競合の解消です。Anthropicも、compactionは現在も同じリクエストモデルを使用して要約を行っており、より安価なサマライザーに単独で切り替えられないこと、context editingがtool resultsをクリーンアップする際にプロンプトキャッシュに影響を及ぼすことを明確に指摘しています。

グラウンディングとエージェント型RAG

主流プラットフォームの実際の方向性は、「長コンテキストが検索を置き換える」のではなく、長コンテキスト、検索、外部ツールが連携して動作することです。Anthropicはcitations、search results、web fetch、web searchをグラウンディング面として実装し、GoogleはGrounding with Google Searchと企業データ接続を、ハルシネーションの低減と最新情報の導入のための鍵と明確に位置付けています。Alibaba Cloud百炼は知識ベース(RAG)を、プライベートデータと最新情報を補完するための核となる能力として定義し、Qwen-AgentはハイブリッドRAGとエージェントベースの分解を強調し、1M以上のトークンを含むドキュメントを処理し、一部のベンチマークでネイティブの長コンテキストモデルを上回ることができます。これは、業界が「単一のtop-k検索」から、エージェント型検索、動的検索、階層型検索、グラフ検索、そして反省型検索の段階に入ったことを示しています。

方法論的に見ると、直近2年のRAGの方向性は5つの類型に概括できます。第一はハイブリッド検索+リランキング+引用で、依然としてほとんどの製品の基礎的な形態です。第二はRAPTORのような階層的な要約ツリーで、長文書の異なる抽象レベルをすべて検索空間に組み込みます。第三はGraphRAGで、知識グラフを通じて「ローカルなヒット」を「グローバルな発見」に拡張します。第四はCRAGで、軽量の評価器で検索の失敗を判断し、必要に応じてWeb検索やドキュメント修正をトリガーします。第五はAdaptive-RAG/選択的検索で、まず問題の複雑さを判断し、次に検索を行うかどうか、またどの程度の検索強度を採用するかを決定します。これらに共通するのは、検索が固定的に発生するのではなく、ルーティングと検証が必要な意思決定プロセスとして扱われることです。

ツール使用、スキル/プラグイン、プロトコル相互運用性

ツールレイヤーの進化は、「プライベートなプラグインエコシステム」から「プロトコル化された相互運用性」へと移行しつつあります。MCPは公式に、AIアプリケーションをデータソース、ツール、ワークフローに接続するためのオープンスタンダードと定義しており、AnthropicはMCPを「AIのUSB-C」と直接表現しています。OpenAI Agents SDKもMCPをツールの接続面としており、Googleは2025年にA2Aを導入し、異なるフレームワークやベンダーのエージェントが相互に発見し、協力し、タスクを委任できるようにすることを目指しています。一方、AnthropicのSkills、Qwen-Agent、百炼Agent 2.0、Cozeスキルはすべて、「パッケージ化可能な能力ユニット」が初期の緩いプラグインに取って代わりつつあることを証明しています。ツールレイヤーはもはや従属物ではなく、エージェント製品の主要な拡張インターフェースとなっています。

この方向性において、最も重要なエンジニアリングの認識は、ツールインターフェース自体がプロンプトエンジニアリングであり、通常、メインのプロンプトよりも重要であるということです。Anthropicの「writing effective tools for agents」とマルチエージェント研究システムは、ツールの記述の質がツール選択の質を決定することを強調しており、専用のtool-testingエージェントを構築さえしています。1回のツール記述の書き換えにより、後続エージェントのタスク完了時間が40%低下したとの報告もあります。AnthropicのTool Searchドキュメントはさらに、非常に具体的な量的証拠を提供しています。典型的な複数サービスのツールセットは約55kトークンを前もって消費してしまい、コンテキスト内の可視ツールが30~50個を超えると、正しいツール選択能力は明らかに低下しますが、動的なオンデマンドロードにより定義コンテキストを85%以上削減できます。言い換えれば、ツールが多すぎても自然と能力が強化されるわけではなく、モデルの判断を損なう可能性があるのです。

同時に、業界は「ツールの粒度」についてもますます明確になっています。Anthropic Skillsはファイルシステムベースのプログレッシブ・ディスクロージャーを使用し、最初は約100トークンのメタデータのみをロードし、スキルがトリガーされた後にSKILL.md命令をロードし、リソースファイルはオンデマンドでアクセスします。Cozeスキルは「特定ドメインの知識ベース+ツールキット」をパッケージ化し、システムが関連性に基づいて自動インストールとトリガーを許可します。Qwen-Agentは、Function Calling、MCP、Code Interpreter、RAGなどの能力を1つのエージェントフレームワークに統合しています。方向性は非常に明確です:能力ユニットは宣言可能、発見可能、オンデマンドでロード可能、バージョン管理可能でなければなりません。

セキュリティ、権限、実行隔離、ガバナンス

エージェントがファイルの読み取り、システムの呼び出し、Webページの操作、コマンドの実行を行うようになると、セキュリティの問題は「出力が不適切かどうか」ではなく、「実際の副作用を引き起こしたかどうか」になります。そのため、セキュリティの主線はコンテンツセキュリティから実行境界セキュリティへと拡大しています。OpenAIは、信頼できない変数をdeveloper messagesに入れてはならないと明確に要求しています。developer messagesはより高い優先度を持つからです。OpenAIのGuardrails and human reviewドキュメントは、input/output/tool guardrailsとhuman approvalsを分けて管理し、Codexドキュメントはサンドボックスモードと承認ポリシーを相互補完する2層の制御として位置付け、デフォルトではネットワークアクセスを無効にしています。AnthropicのClaude Codeはデフォルトで厳格な読み取り専用モードであり、bashコマンドなどの追加アクションに対して項目ごとの承認を要求します。Google側では、Tool Governance、Agent Gateway、IAM policy、SPIFFEベースのAgent Identityを強化しています。これは、本番環境向けエージェントのデフォルトの態度が「権限を開放し、後から防御を補う」から「デフォルトで最小権限とし、必要に応じてアップグレードする」へと転換したことを示しています。

ここで最も重要なエンジニアリング原則は3つあります。第一に、信頼できないテキストが直接高権限のアクションを駆動してはならない。第二に、副作用のあるあらゆるアクションは、本番環境において構造化された検証または人間の承認を有すべきである。第三に、実行はサンドボックス/コンテナ/VM/ゲートウェイの後方に隔離されなければならない。Anthropicのcode execution toolはサンドボックスコンテナ内で実行され、特に複数の実行環境を同時に提供すると、モデルが環境の状態を混同する可能性があると警告しています。OpenAIのSandboxAgentも「エージェントハーネスとサンドボックスコンピューティング」を明確に分離しています。Magentic-Oneドキュメントは、Webページのプロンプトインジェクションを受ける可能性があることを公開しています。最も信頼性の高いシステムとは、「モデルが決して回避されない」のではなく、回避されたとしても権限を越えることができないシステムです。

評価、監視可能性、持続的最適化のクローズドループ

エージェントエンジニアリングは、完全にeval-driven developmentの段階に入っています。OpenAIの公式評価ガイドラインは、「タスクを定義し、evalを実行し、結果を分析し、改善を繰り返す」ことを標準的なフローとして記述し、これが振る舞い駆動開発(Behavior-Driven Development)に似ていると明記しています。OpenAI Agents SDKはデフォルトでトレーシングを有効にし、LLM生成、ツール呼び出し、handoff、ガードレールなどのspanを追跡します。Google Agent Platformの監視可能性パネルは、平均レスポンス品質、安全性指標、ハルシネーション率、ツール使用品質、p50/p95/p99レイテンシ、エラー率を直接オンライン監視として表示します。Anthropicは、tool-testingエージェントとプロンプト/ツールの反復を通じてツールの人間工学を継続的に最適化しています。由此可见、評価はモデル選択の付属品から、ランタイムの一部へと昇格しました。

同時に、ベンチマークの形態も显著に拡大しています。BFCLは関数/ツール呼び出し能力を評価し、τ-benchはAPI呼び出しを伴うタスクに焦点を当てています。


関連記事

スポンサーリンクおすすめのAIツールを見る

コメント (0)

シェア:Xはてブ

コメントを投稿

読み込み中...