AI-NEWS · 2026年 7月 25日

OpenAI 语音模式:全双工与后台智能体

OpenAI 今天把 GPT-Live 语音模式推到了桌面端,代码库已经合并进 Codex。这次升级把 ChatGPT 从敲键盘的交互,变成了能同时听和说的全双工对话。

全双工意味着 AI 不用等你说完,说完它立马能回,中间没有那种“等它转圈圈”的停顿。这比之前 2024 年刚出语音识别时那种“你说完、它说完、你再开始”的回合制,更像是在跟真人对活。

最关键的改动在后台。以前你发指令,得盯着屏幕看它跑没跑完。现在你口述需求,后台的智能体直接去干活,不用你盯着进度条。比如让我查日历冲突、扫邮箱找航班变动、顺便整理会议笔记,这三个指令丢进去,AI 同时起三个线程去跑。我这会儿不用停,能边喝咖啡边跟它聊别的,或者继续跟同事语音讨论。

这种体验把语音从单纯的“输入通道”变成了“实时操作台”。以前语音只是把声音转成字发出去,还得等回复才能接着说;现在指令发出去就能触发后台执行,不用等结果出来再发下一条。

另外,它把 Chat、Work 和 Codex 串起来了。我在语音里说个想法,它不仅能生成文档,还能直接写代码,甚至能去操作邮件。这种从创意到落地、跨越代码和文档的闭环,是以前单模态没法做到的。

这轮更新把语音交互的门槛彻底打碎了,不再需要用户去控制节奏,也不用担心自己话没说完会不会打断它,也不用频繁切换窗口。

火龙果频道