OpenAIは2026年9月10日、GPT‑Live‑1をAPIで提供すると発表しました。外部の開発者は、話しながら聞き続け、割り込み、間、背景雑音を扱える全二重音声アプリを構築できます。単に音声をテキスト化し、文字モデルへ送り、再び音声へ戻す連結サービスを増やしたのではありません。会話のフロントエンドとバックエンド推論を組み合わせられる構造です。音声レイヤーは1分0.05ドル、バックエンドモデルとツールは別料金とOpenAIは示しています。
GPT‑Live‑1は開発者に何を提供するのか
全二重とは、片方が話し終わるまで待つのではなく、利用者の音声を受け取りながら応答を生成できることです。GPT‑Live‑1は音声の文字起こしと応答テキストを提供し、ターン検出やキーワードバイアスにも対応します。明示的な発話区切りを捨てる必要はありませんが、音声対話を無線機のような一往復に固定せずに済みます。
OpenAIはWebRTC、WebSocket、電話利用を接続先として挙げており、ブラウザーのデモだけを想定していません。実運用では音声ストリーミング、通話品質、文字起こしの誤り、音声利用の同意、データ保存、有人転送を処理する必要があります。モデルが提供するのは会話能力であり、完成したコンタクトセンターや通信規制対応のパッケージではありません。
会話とアクションをレイヤー分離
GPT‑Live‑1は自然な会話を担当する音声フロントエンドで、深い推論、データ検索、ツール呼び出しはGPT‑6 Astraなどのバックエンド文字モデル、または開発者自身のモデルやAgentへ委譲できます。音声モデルは聞き取り、応答、割り込み、話し方に集中し、タスク状態、権限、ツール実行はアプリ側が管理する構造です。
タスクに応じてバックエンドを変えられるのが利点です。単純な照会で毎回高価な推論を使わず、複雑な仕事だけ強いモデルへ回せます。一方で責任は開発者側に戻ります。利用者が音声を遮ったとき、バックエンドの処理をキャンセル、再試行、継続するかをアプリが定義しなければなりません。会話が自然になってもツール操作が自動的に安全になるわけではありません。
1分0.05ドルは音声レイヤーの料金
OpenAIの料金説明では、GPT‑Live‑1のフロントエンド音声レイヤーは1分0.05ドルで、秒単位で課金されます。10分の音声対話なら、このレイヤーだけで約0.50ドルです。ただし総額ではなく、バックエンドのGPTモデル、関数ツール、電話事業者、文字起こし、保存が別に課金される可能性があります。
OpenAIは、Speakの初期評価で従来のターン制システムより語学学習者への割り込みが約80%減ったと説明し、Full Duplex Benchでは30ポイントの改善を報告しています。いずれも同社またはパートナーの評価で、全用途に対する独立した保証ではありません。導入前には通話時間、言語、雑音、ツール成功率を自社の条件で試す必要があります。
本当に音声製品は自然になるのか
GPT‑Live‑1の価値は、音声製品を「答えられる」から「割り込みや待ち時間の中でも仕事を完了できる」へ進められるかで決まります。サポート、予約、語学学習、電話Agentでは、硬い発話の交代を減らせることが体験改善につながる可能性があります。開発者には新しい料金モデルと二層構造に伴う状態管理・安全責任も増えます。音声フロントエンドの大きな更新であって、バックエンドの権限管理や有人対応を自動化するものではありません。
