OpenAIは2026年9月10日、Agents APIをパブリックβとして提供すると発表した。モデル呼び出し、ツール、バックグラウンド実行、ファイル処理、長時間の状態管理を開発者が個別に組み合わせなくても、複数工程の仕事を行うエージェントを作れるようにする。Codexで使われるharness、ツールとサブエージェントの協調に加え、OpenAI管理のサンドボックス、自社インフラ、パートナー環境という実行経路を示した。パブリックβは統合と検証を始められる段階であり、すべてのAPIが重要業務向けに安定したことを意味しない。

Agents APIは開発のどこを解決するのか

従来のチャットAPIは、アプリがプロンプトを送り、回答を受け取り、次の処理を外部コードで決める一問一答に近い。Agents APIは、モデルが制御された実行の中でファイルを読み、ツールを使い、別のエージェントを呼び、進捗を返し、長時間処理を続ける方向だ。権限、ツールの境界、エラー処理、最終承認は開発者が定義する必要がある。

この抽象化の価値は、「モデルの回答」から「観測できる実行」へ移せることにある。例えば調査エージェントが検索、ファイル整理、要約を順に行い、その途中状態をアプリで表示・審査できる。モデルに無制限のPC権限を与えるのではなく、記録と制限が可能なツール操作を一つのフローにまとめる仕組みだ。

ランタイムとCodexとの接続

OpenAIは、エージェントが隔離環境でコードを実行し作業を扱える管理型サンドボックスを説明している。データやネットワークをより管理したいチームは、自社インフラやパートナー環境を選べる。APIはテキスト用エンドポイントの集合にとどまらず、実行ライフサイクル、ファイル、ツール権限も製品の一部になる。

OpenAIがCodexのharnessを例にするのは、ツール、ファイル、隔離ワークスペースを使う長時間エージェントの実例だからだ。ただし開発者がデモをそのままコピーすべきではない。ファイルの読み書き、リクエスト送信、外部サービス呼び出しができるツールごとに、明確なスキーマ、権限モデル、復旧策が必要になる。

パブリックβの意味

今回は少数招待者だけへのデモではなく、パブリックβだ。開発者は公式ドキュメントでプロトタイプを作り、長い処理、ツールエラー、中間結果の扱いを観察できる。一方、βではAPI、料金、利用可能モデル、サンドボックスの制限、安全動作が変わる可能性があるため、本番検証では実行ログとコスト監視も最初から用意したい。

重要業務では、パブリックβになったからといってガバナンスが不要になるわけではない。どの操作に人の承認を要求するか、どのデータを境界外へ出さないか、失敗時にどう停止するか、生成ファイルやコード、外部操作をどう検証するかはチームが決める。管理型ランタイムは基盤運用を減らすが、製品責任をなくすものではない。

開発者はどう受け止めるべきか

Agents APIの実務的な意味は、一度きりのプロンプト技法から、実行を再現・観測・制限・評価できるシステム工学へ移ることにある。まずは調査要約、データ整理、テスト支援、社内ワークフローなど、低リスクで元に戻せる仕事から始め、書き込みや外部操作を段階的に追加するのがよい。

モデル比較の軸も増える。どのモデルが最も良い回答をするかだけでなく、どの実行環境なら許容コストでタスクを終え、失敗時に人へ制御を戻し、監査に十分な証跡を残せるかを問う必要がある。エージェントをデモから製品へ移す際に見落とされやすいが、重要な部分だ。

Agents APIの公式発表を見る