剛剛,OpenAI 突然宣佈新一代語音模型 GPT-Live 上線!
剛開始覺得:“不就是新的語音模式嗎?”
但實際上,這可能是 ChatGPT 自 GPT-4 以來,互動方式的一次重大升級。
OpenAI 在部落格上直接表明:邁入人機互動的新紀元。
我們的願景是實現真正自然的人與人工智慧互動:一個與人工智慧協作如同與他人合作般流暢且響應迅速的世界,而推理和複雜任務執行則無縫地在背景中進行。
那麼這次的 GPT-Live 到底有那些改進?為什麼能被認為是 OpenAI 最智能的語音模型?
GPT-Live:就像人和人打電話一樣
一句話概括:GPT-Live 是 OpenAI 全新一代的語音模型,專門用來驅動 ChatGPT 的“語音模式”,核心賣點是讓 AI 說話更像真人聊天。
底層是全雙工架構。通俗地說,就是“邊聽邊說”,就像人和人打電話一樣,你說話的時候它能同時在理解你的意思,甚至會自然地給你一句“嗯”“好的”這樣的回應詞,讓人感覺到“它真的在認真聽”,而不是等說完才反應過來。
GPT-Live 可以每秒鐘做出多次互動決策,例如是否說話、繼續聆聽、暫停、打斷或呼叫工具。
目前 OpenAI 推出了兩個版本:GPT-Live-1 將成為支援 Go、Plus 和 Pro 使用者的 ChatGPT 語音默認模型,GPT-Live-1 mini 將成為免費使用者的默認型號。
為什麼 GPT-Live 被認為是OpenAI最智能的語音模型?
OpenAI 官方把 GPT-Live 稱為“我們最智能的語音模型”,這個說法不是白說的:如果遇到需要聯網搜尋、複雜推理或者更‘燒腦’的任務時,GPT-Live 不會幹等著,而是把任務悄悄‘外包’給背後更強大的前沿模型去處理。等待結果的過程中,GPT-Live 依然可以繼續跟你聊天,維持對話的流暢度,等答案出來了,再自然地把結果帶回對話裡。
簡單說就是:前台負責“聊得自然”,後台負責“想得深”。
再說說和上一代的區別。ChatGPT 語音功能這些年其實經歷了三代:
最早的 Standard Voice Mode:“語音轉文字→大模型處理→文字轉語音”三段拼接,處理完一句再處理下一句,延遲明顯,對話體驗生硬。
2024 年上線的 Advanced Voice Mode(也就是很多人熟悉的GPT-4o 語音):速度快了很多,也能識別語氣和情緒,一度讓人眼前一亮。但它本質上依然是“輪流發言”,必須等你說完才會開始回應(檢測到靜音)。因此短暫停頓或背景噪聲可能被誤判為說話結束,導致打斷。
現在的 GPT-Live:徹底取消了“輪流發言”的限制,改成持續處理輸入的同時生成輸出,是真正意義上的"邊聽邊說"。
測評資料怎麼說:邁入人類與 AI 互動的新時代
OpenAI 官方還進行了人工偏好測試。在測試中,評測員分別體驗 GPT-Live 與上一代 Advanced Voice Mode(AVM)的語音對話,然後選擇自己更喜歡的一方。
結果顯示,GPT-Live-1 在 75.7% 的對比中勝出,GPT-Live-1 mini 的偏好率也達到 69.2%。
評測員還從對話流暢度和交流舒適度兩個維度,對三個模型進行 7 分制評分。結果顯示,GPT-Live-1 的流暢度得分達到 4.96 分,明顯高於 AVM 的 3.80 分;交流舒適度則獲得 5.19 分,同樣領先於 AVM 的 3.82 分。
甚至還有GPQA、BrowseComp、τ³-Voice Telecom等多向測試:
GPQA 測試涵蓋生物學、化學和物理學的專家級科學推理能力,GPT-Live-1 在 GPQA 測試中表現遠超AVM:
BrowseComp旨在評估智能網路搜尋和尋找難以定位的資訊的能力,GPT-Live-1 在 BrowseComp 測試中比AVM表現出色:
τ³-Voice Telecom旨在評語音代理在真實的、多輪電信支援任務中的表現,GPT-Live-1 在 τ³-Voice Telecom 上的表現優於AVM:
語音 AI 賽道:可不止 OpenAI 一家
有沒有其他 AI 巨頭做語音模型?
有,而且這條賽道現在擠滿了玩家。2026 年上半年可以說是是語音 AI 競爭最密集的半年之一:
- Google Gemini Live:2024 年就已經對標當年的 GPT-4o 語音模式推出,今年 3 月又發佈了 Gemini 3.1 Flash Live,把過去需要語音識別、大模型、語音合成多個模組串聯的即時語音鏈路,折疊進單一的原生音訊模型。5 月的 Google I/O 上,Google進一步開放了 Live API,支援模型主動發起對話、自動識別語種、即時多語言翻譯。
- Grok:Grok Voice 是馬斯克 xAI 推出的即時語音對話模式,主打把複雜推理放在後台完成、不拖慢響應速度。7 月初,xAI 又為 Grok 語音新增了 21 種多語言音色,進一步補齊了海外多語種場景的短板。
- Meta:佈局則更偏向社交和硬體。近兩年 Meta 主要推進的是:Meta AI 語音助手、整合到 WhatsApp、Messenger、Instagram 等產品、與 Ray-Ban 智能眼鏡深度結合,實現語音問答、拍照識別和視覺 AI。
一位投資人直言:“2026年是語音助手真正變得優秀的一年。”
網友:GPT-Live 還會不會頻繁打斷使用者?
在這個評論區,網友最關心的是:GPT-Live 會不會頻繁打斷對話。
“我喜歡語音功能,但它最大的問題是,每次我說話那怕只有短暫的停頓,它都會打斷我。”
“這很酷,但它在處理打斷方面還可以做得更好。”
當然,還有一些對 GPT-Live 的期待:
“如果它能在嘈雜擁擠的場所也能正常工作,讓我可以和它通話,我會更加印象深刻。”
“它需要視覺輸入才能知道何時有人想要打斷。如果沒有視覺輸入,它總會有些偏差。”
寫在最後
GPT-Live 推出後,OpenAI 總裁 Greg Brockman 發文:“在我們自己的測試中,感覺我們對它的瞭解還只是冰山一角。”
關於 AI 的“下一代入口”一直是全球科技公司的爭奪戰場。如果 GPT-Live 的潛力能夠持續釋放,那麼語音互動或許有可能成為 AI 的下一代入口。
“智能、功能強大的即時語音技術很有可能成為消費級人工智慧的最終目標。這將為市場參與下一階段的建設提供理由。”
語音真的能成為 AI 的“下一代入口”嗎?還是說,沒有視覺輸入,語音永遠只是半條腿走路? (51CTO技術堆疊)
