
OpenAI API 迎來新一波語音智慧升級,這次重點放在即時語音互動、即時翻譯與即時轉錄。根據 AlternativeTo 與 OpenAI 官方說明,新增的三個模型分別是 GPT-Realtime-2、GPT-Realtime-Translate 與 GPT-Realtime-Whisper,目標是讓開發者建立能聽懂語音、即時回應、翻譯多語對話,並把語音內容同步轉成文字的應用。對客服、教育、活動、媒體與創作者平台而言,這代表語音 AI 不再只是單純問答,而是更接近可在對話中完成任務的互動介面。

GPT-Realtime-2 讓語音代理能邊聽邊推理
GPT-Realtime-2 是這次更新中最接近「語音代理核心」的模型。OpenAI 表示,它可用於即時語音互動,在對話中持續推進流程,並能處理使用者修正、打斷與較複雜的請求。官方也加入 adjustable reasoning effort,讓開發者可在 minimal、low、medium、high 與 xhigh 之間選擇推理強度,以便在延遲與複雜任務之間取得平衡。對需要查詢資料、呼叫工具或維持長時間語音會話的產品來說,這類能力能讓 AI 助理更像真正的線上服務人員。
即時翻譯支援 70 多種輸入語言
GPT-Realtime-Translate 則鎖定跨語言溝通。官方指出,這個模型支援 70 多種輸入語言與 13 種輸出語言,可在使用者說話時保持對話節奏並輸出翻譯內容。這對跨境銷售、國際客服、線上教育、會議活動與影音平台特別有價值,因為使用者不必等待事後翻譯或字幕製作,就能在接近即時的狀態下理解對方語意。若搭配文字轉錄,平台也能同步保存多語對話紀錄,方便後續摘要、搜尋或知識管理。
GPT-Realtime-Whisper 主打低延遲轉錄
第三個新模型 GPT-Realtime-Whisper 是低延遲串流語音轉文字模型,可在使用者說話的同時產生轉錄。這讓即時字幕、會議紀錄、課堂筆記、客服摘要與醫療、銷售、招募等高頻語音流程更容易自動化。TechCrunch 也將這次更新解讀為 OpenAI 把 real-time audio 從簡單 call-and-response 推向能 listen、reason、translate、transcribe 與 take action 的語音介面,顯示 OpenAI 正在把語音 API 從單一功能擴展為完整工作流程基礎設施。
價格與安全機制同步公開
計費方面,GPT-Realtime-2 採 token 用量計費,官方標價為每 100 萬 audio input tokens 32 美元、cached input tokens 0.40 美元,以及每 100 萬 audio output tokens 64 美元;GPT-Realtime-Translate 為每分鐘 0.034 美元,GPT-Realtime-Whisper 為每分鐘 0.017 美元。OpenAI 也強調 Realtime API 具備多層安全防護,包含 active classifiers,可在偵測到違反有害內容準則的對話時停止互動。對企業開發者來說,這次更新的關鍵不只在模型能力,而是把即時語音、合規告知、安全管控與成本模型一起帶進 API 部署決策。

新聞資料來源
https://alternativeto.net/news/2026/5/openai-api-adds-gpt-realtime-2-live-translation-and-transcription-models/
https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/
https://techcrunch.com/2026/05/07/openai-launches-new-voice-intelligence-features-in-its-api/
