ChatGPT 變身全能語音特工?OpenAI 密謀用嘴控制一切,Anthropic 緊咬跟進
7 月 23 日,研究帳號 @testingcatalog 在 X 平臺指出,ChatGPT 程式碼引用中出現 Codex Realtime Voice Mode 的新標記,顯示 OpenAI 正在開發以即時語音驅動 Codex Agent 的功能。

7 月 23 日,研究帳號 @testingcatalog 在 X 平臺指出,ChatGPT 程式碼引用中出現 Codex Realtime Voice Mode 的新標記,顯示 OpenAI 正在開發以即時語音驅動 Codex Agent 的功能。程式碼將這項功能描述為「通用型 agentic 助理」,設計上讓使用者用說話下指令,再由 Codex Agent 跨應用程式執行,場景涵蓋檢視 Slack 訊息、控制 Spotify、瀏覽檔案、管理行事曆、上網瀏覽、購物與外送點餐。若功能成真,ChatGPT Voice Mode 使用者理論上將首次能用口頭語音呼叫 Connectors,也就是 OpenAI 對接外部服務的整合層。
@testingcatalog 的爆料並非官方發布,屬於從程式碼引用推測的功能形態,實際上線時間與介面設計均未確定。目前這項功能尚未出現在 ChatGPT 桌面版,爆料方也指出,更早期版本曾在獨立的 Codex app 中偵測到 Realtime Voice Mode 的開發跡象,並提到可能以「Orb」球形介面或寵物(Pets)造型呈現,但這些形態均未進入正式版本。同在 7 月 23 日,多位 OpenAI 員工在社群上釋出帶有「Codexy」氛圍的暗示,是否與這項功能的推進有關目前仍不明確。Anthropic 方面,也在相近時間開始向部分使用者推出語音模式升級,讓使用者可以在語音對話中呼叫 Opus 與 Sonnet 模型,並觸發 Connectors 與工具完成複雜任務。
兩件事同步浮出,指向一個目前看來正在成形的方向:前沿 AI 廠商正把語音介面從「聊天入口」推向「agent 排程前端」。過去 Voice Mode 最大的限制是只能對話,無法觸發外部工具或服務;若 Connectors 真的進入語音前端,使用者說一句話就能觸發跨平臺的複合任務,門檻比打字更低、觸發頻率理論上也更高。OpenAI 與 Anthropic 同步往這個方向走,對正在評估語音優先工作流或 AI 應用整合策略的工程師與創業者,這是個值得追蹤的架構訊號。但在 OpenAI 正式發布前,具體的 API 規格與整合形式都還是未知數。
