TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

OpenAI 把全雙工語音模型 GPT-Live-1 開放進 API:每分鐘 0.05 美元、按秒計費只買聽與說,推理與工具自選後端模型另外計價,打斷處理與電話線路支援到位,Yelp Host 與 Speak 已率先上線。
用 AI 摘要這篇文章:
台北時間 9 月 11 日凌晨 1 點 20 分,OpenAI 的開發者帳號 @OpenAIDevs 在 X 上發文,開場只有短短一行:「GPT-Live-1 is now available in the API」。這個兩個月前先在 ChatGPT 上線的全雙工語音模型,正式開放給所有 API 開發者,而且計費結構和直覺想的不一樣:每分鐘 0.05 美元買到的只有「聽與說」這一層,真正負責思考的後端模型由開發者自己挑選,費用另外計算。
換句話說,OpenAI 把「會講話的介面」變成 API 目錄裡可以單獨下單的品項。語音層和推理層從此分家,架構上怎麼拆,帳單上就怎麼拆。這對已經有一套文字代理工作流的團隊最有感:原本的流程不必重寫,把語音當成一層皮套上去,後端繼續用自己選的模型和工具。
發布的時間點也值得記一筆。9 月 8 日 OpenAI 才推出 ChatGPT Images 2.5,9 月 10 日這天又連發多項更新,API 端有 Agents API 公開測試,產品端同日發表 ChatGPT Work 資料代理;GPT-Live-1 的 API 版就掛在同一天的 changelog 上。
GPT-Live-1 不是全新模型。7 月 8 日,Sam Altman 在 X 上宣布「GPT-live(下一代語音)今天在 ChatGPT 上線」,還補了一句自己的使用感想:他一向偏好打字而不是對著 AI 說話,但這次他覺得這個習慣會改變。當時的安排是 Go、Plus、Pro 訂閱用戶預設使用 GPT-Live-1,免費用戶拿到輕量版 GPT-Live-1 mini。OpenAI 也給了規模數字:每週有超過 1.5 億人透過語音與聽寫功能和 ChatGPT 交談。
消費端和 API 版有一個關鍵差異:後端模型誰決定。7 月上線時 OpenAI 明講,GPT-Live 背後搭配的是 GPT-5.5,之後會隨新模型推出持續更新,使用者無從選擇。這次進 API,後端變成開發者的選擇題:官方文件建議從 GPT-5.6 Terra 起步,成本敏感的場景可以考慮 GPT-5.6 Luna;官方部落格舉的例子,是把排程、訂單更新這類高流量任務交給 Luna、把需要推理的複雜客訴留給 GPT-6 Astra(這個模型的 落地應用案例我們先前整理過)。甚至不一定要用 OpenAI 的模型:走用戶端委派模式,後端接第三方模型或自家代理框架都可以。
兩個月的中間還有一條治理線索。7 月 31 日 OpenAI 在原始公告上追加更新:GPT-Live 產生的語音加入 SynthID 浮水印,並開放驗證 API,讓開發者與組織能把來源檢查放進自己的工作流。這條更新明載 SynthID 浮水印適用於 GPT-Live 經 ChatGPT Voice 與 OpenAI API 產生的音訊,API 版出生就在這套設計之內。
要理解 GPT-Live-1 在解決什麼,可以先看官方對三種語音架構的分工。最傳統的串接式管線,是語音轉文字、語言模型想答案、文字再轉語音,三段接力,每個交接都會掉時間、掉脈絡;上一代的 Realtime API 把這三件事收進單一模型,延遲變短,但本質上仍是輪流發言的對講機邏輯,模型要等你說完才開口,而「說完」的判定靠靜音偵測,一個猶豫或一點背景雜音就可能被誤判。
GPT-Live-1 走的全雙工(full duplex)是另一回事:同一個模型持續處理進來和出去的音訊,邊說邊聽。官方在消費端公告裡描述,模型每秒可以做多次互動決策,決定要開口、繼續聽、停頓、打斷對方,還是呼叫工具。這讓「插話」變成合法操作:使用者可以在 AI 唸到一半時補一句「改成六點半」,不必等它講完整段。
從官方文件與客戶描述看,全雙工帶來的不只是可以插話。模型會在聆聽時發出「嗯」「了解」這類短應答(官方文件稱為 backchannel),也會在你思考時安靜等待。Yelp 在新聞稿裡描述了電話端的版本:來電者可以中途換話題、對旁邊的人說句話再回來,語音 AI 還能從語氣察覺興奮、不耐煩或沮喪並調整回應;配合 Yelp 自家疊上去的語言加強層,能用接近任何語言接聽,不因語言隔閡漏掉客戶。
量化數字方面,OpenAI 在公告中宣稱,GPT-Live-1 在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 個百分點,主要增益在輪替延遲與互動行為;搭配 GPT-6 Astra(中等推理力度)在 Tau3 語音代理評測拿下榜首。要注意這些是官方自辦的評測,獨立第三方的覆核結果目前沒有公開數字,官方也沒有揭露打斷反應的毫秒級數字,只給了相對指標。
落地場景裡最有參考價值的是語言學習平台 Speak 的數字。OpenAI 引述 Speak 的早期評估:導入後系統給了學習者更多思考時間,打斷次數比先前的輪替式系統減少將近八成。這是客戶端數字,同樣由 OpenAI 轉述,不是獨立驗證,但至少給了「全雙工到底改善什麼」一個可追蹤的指標:打斷變少、等待變自然,而不是回答變快。
對開發者還有一項容易漏看的實用能力:GPT-Live-1 原生輸出語音辨識逐字稿與回應文字,不必再外掛一套轉錄服務。它對電話號碼、訂單編號這類英數字元的辨識有特別加強,也支援關鍵詞偏置,可以把自己產品裡的專有名詞先餵給它,降低專有名詞被聽錯的機率。它本質上不是輪替式模型,但仍原生支援發言權判定,需要明確輪次邊界的流程(例如逐步確認的表單填寫)照樣建得起來。
計費是這次發布裡最實用的資訊。官方模型頁寫得明確:語音連線階段(session)每分鐘 0.05 美元,按秒計費,時間不會進位到整分鐘;後端模型與工具的用量走各自的正常計價,完全分開。換算一下,連續講一個小時的語音層是 3 美元,而這只是「聽與說」的費用,推理成本要再按後端模型的 token 計價疊上去。

配額以併發連線數計算,不看 token。免費層不支援這個模型;付費層從 Tier 1 的 25 個併發連線起跳,Tier 5 到 500 個。要在產品裡做多線客服的團隊,先對照自己的用量等級,再評估尖峰時段的併發需求。
聲音的部分,官方從原本少數幾個即時語音,擴充到更多口音、方言與語言的選擇,並預告未來幾個月會繼續增加。想要客製聲音(例如品牌專屬的聲線)沒有自助流程,要聯繫銷售談資格與申請。企業如果不想自己組架構,另有 OpenAI Presence 這條官方代管路線,用 GPT-Live-1 驅動即時語音互動,細節同樣透過帳戶團隊接洽。
官方文件裡有一句話,值得每個要做語音代理的人抄下來:你的應用程式擁有權限、確認動作、私有函式執行與持久任務狀態。更具體的還有下一句:打斷語音輸出,並不會自動取消後端正在跑的工作。

這兩句畫出的邊界很實際。使用者對著電話喊「等等,先不要訂」,前端會停下來聽,但後端那張已經送出的查詢或預約建立,取消邏輯要你自己寫。模型保證的是對話不中斷、工作不卡死,不保證商業規則自動正確。官方文件也提醒,詳細的業務規則該放在後端的提示詞裡,說話的風格才放在語音層的提示詞,兩層分工不要混。
文件裡另一個容易被忽略的提醒,是審核後端結果不等於審核模型說出口的每個字。官方明講:檢查後端輸出是一個獨立決定,它不會替 GPT-Live 說的每句話背書,也不保證驗證執行期間模型會保持沉默。要防止代理在驗證還沒完成時先把優惠方案唸出口,得靠播放控制這類伺服器端機制自己攔。換個說法:語音層的流暢和治理的嚴謹,是兩條要分開驗收的線。
和自家產品線的取捨,官方文件給了一張清楚的對照:GPT-Live 適合「全雙工對話加獨立後端」,保留你既有的文字工作流;Realtime API 適合把語音、推理、工具全交給同一個模型;串接式管線留給需要逐步檢查、替換每個環節的場景。沒有誰取代誰,是採購清單上的三種不同單元。
首波客戶名單裡最有畫面的是 Yelp。依 Yelp 官方新聞稿,旗下餐廳語音接聽產品 Yelp Host 與服務業通訊平台 Hatch 都已完成 GPT-Live-1 整合,在這個模型最早部署的解決方案之列。Yelp Host 從 2025 年 10 月上線至今,已處理超過 100 萬通餐廳電話;Hatch 則是 2018 年創立、2026 年加入 Yelp 的平台,管理語音、簡訊、電子郵件與網頁等通路。
Yelp 產品長 Akhil Kuduvalli Ramesh 在新聞稿裡的定位很直白:GPT-Live-1 改變的是每一通電話的對話感,而 Yelp Host 的價值在於對每家餐廳營運的理解。大規模生產測試的初期結果,是通話處理表現改善、轉接次數減少;來電者開始用完整的自然句子說話,而不是對著機器蹦關鍵詞,通話後的逐字稿也更乾淨。Hatch 執行長 Chris Bache 的說法則點出分工:聲音模型讓對話變自然,但懂水電行的排班規則與緊急派工邏輯,是他們累積多年的營運智慧。
電話場景正好踩在 GPT-Live-1 的支援範圍內。連線方式有四條路:瀏覽器用 WebRTC、伺服器端用 WebSocket、既有多媒體管線可以接 LiveKit、Twilio、Telnyx、Daily 與 Pipecat 這些合作夥伴,電話整合另有 Telephony 與 SIP 的文件。對要經營預約型電話業務的團隊來說,現在多了一個不必自己拼裝全雙工能力的選項。
想試的人,入口都在官方文件:GPT-Live 指南提供 WebRTC 快速上手,模型頁有計價與配額細節,從 Realtime 或文字代理搬遷另有遷移指南。實作可以先從代管後端的 Responses 委派模式起步,需要自己控制後端上下文或接第三方模型時,再換用戶端委派;兩種模式在建立連線階段時就決定,中途切換要重開新的連線。不過在同一種模式內,後端模型、提示詞與工具清單可以用 session.update 在通話中途更換,不必掛斷重連。
評測方法官方也給了原則,對自建測試的團隊直接可用:對話品質和任務結果要分開量,聽起來自然的回應不能證明工具真的執行、狀態真的改變;量延遲時,要把真正有用的口頭答案和「嗯,我查一下」這種應答分開計時,早一聲應答不代表結果早到。
還沒定案的部分,目前是這些。聲音與語言清單官方明說會持續擴充,現在看到的選項不是最終狀態;免費層目前不支援;打斷處理與通話品質的表現,公開資訊只有官方評測與客戶轉述數字,沒有第三方覆核。價格與建議後端的名稱(Terra、Luna 這類)隨版本更迭變動的機會不低,動手前值得再對一次官方頁面。
整體看,這次發布真正的變動,是語音互動層在 OpenAI 的 API 裡成為可以單獨採購、單獨計費、後端完全自選的單元。會講話的介面變得容易取得了,治理與正確性的責任,則明文留在整合的人身上。