OpenAI 於 2026 年 9 月 10 日宣布 GPT‑Live‑1 進入 API,讓外部開發者建立全雙工語音應用:模型可以在聆聽時持續說話,也能處理打斷、停頓和背景噪音。這次發布的重點,不是再加一個把語音轉文字、送進文字模型、再轉回語音的串接服務,而是把對話前端和後端推理拆成可組合的兩層。OpenAI 官方已標出前端語音層每分鐘 0.05 美元;後端模型和工具使用量另計。
GPT‑Live‑1 對開發者開放了什麼?
全雙工(full-duplex)的意思,是系統可以同時接收使用者聲音並產生回應,不必嚴格等一方說完才輪到另一方。GPT‑Live‑1 仍提供轉錄文字和回應文字,也支援 turn detection 與 keyword biasing,所以開發者不必放棄明確的回合控制;差別在於語音互動本身不再被固定成對講機式的一來一往。
OpenAI 也把 WebRTC、WebSocket 和電話情境列為可用方向,代表它不只針對瀏覽器展示。實際產品仍要處理音訊串流、通話品質、轉錄錯誤、語音同意、個資保存和真人轉接;模型本身提供的是對話能力,不是完整的客服平台或電信合規方案。
前端對話與後端行動分開處理
GPT‑Live‑1 負責自然對話的前端聲音層,較深的推理、資料查詢和工具呼叫則可委派給 GPT‑6 Astra 等後端文字模型,或開發者自己的模型與 Agent。這種拆分讓語音模型專注在聽懂、回應、打斷和語氣;長時間的任務狀態、權限與工具執行由應用程式掌控。
這個架構的好處是可以依任務換後端:簡單查詢不必每次都啟動高成本推理,複雜工作才交給更強的模型。但它也把責任推回開發者:使用者打斷聲音時,後端任務是否取消、重試或繼續,必須由程式明確管理;如果沒有權限邊界,語音互動變自然不會自動讓工具操作變安全。
每分鐘 0.05 美元只是語音層費用
OpenAI 官方定價寫明,GPT‑Live‑1 的前端語音層是每分鐘 0.05 美元,按秒計費。換句話說,一段 10 分鐘的語音互動,單看這個前端層約為 0.50 美元;但這不是完整成本,後端 GPT 模型、函式工具、電話供應商、轉錄或儲存費用都可能另外計算。
OpenAI 自己提到 Speak 的早期評估中,GPT‑Live‑1 相較舊式回合系統讓語言學習者被打斷的情況減少近 80%;OpenAI 也公布全雙工測試提升 30 個百分點。這些是公司或合作方的評估,不是所有場景的獨立基準。真正上線前,應用團隊仍要用自己的通話長度、語言、噪音和工具成功率做壓力測試。
它真的會讓語音產品更自然嗎?
GPT‑Live‑1 的實際價值,要看它能否讓語音產品從「能回答」變成「能在打斷與等待中可靠完成工作」。對客服、預約、語言學習和電話 Agent,少一點僵硬輪流說話可能確實改善體驗;對開發者,新的成本模型和雙層架構也代表更多狀態管理與安全責任。它是語音前端的重大更新,不是把後端任務、權限治理和真人服務全部自動化。
