导语
2026年7月8日,OpenAI发布GPT-Live——一款全双工语音模型。它能同时倾听与说话,自然处理用户的打断,并将复杂任务委托给后台的GPT-5.5处理。目前每周已有超1.5亿人使用ChatGPT语音功能,GPT-Live的发布标志着语音交互从\”轮流说话\”迈向\”连续对话\”。
像打电话一样自然
此前的语音AI多为半双工:用户说完,AI再回应,无法打断。GPT-Live实现全双工——你可以随时插话,AI会像真人一样停下来听你说完再继续。这种\”可打断性\”看似微小,实则是语音交互体验的质变:对话的节奏 control 回到用户手中。
架构上,GPT-Live采用分层设计:前端轻量模型负责实时语音交互,后台GPT-5.5处理复杂推理任务。这种\”快思考+慢思考\”的组合,兼顾了实时性与智能深度。
背景分析:语音是AI的下一个入口
谷歌在7月同步推出更快的Gemini Flash、Lyria 3.5音乐视频生成与Gemini Robotics ER 2具身模型,双方在语音与多模态战线全面开火。语音被视为继文本之后最重要的AI交互入口:开车、做家务、 운동 等场景下,语音是唯一可用的交互方式。
全双工技术的难点在于回声消除、打断检测与话轮转换的实时处理,需要模型与音频工程的深度结合。OpenAI选择此时发布,意在抢占\”语音智能体\”的心智高地。
影响展望
GPT-Live将加速语音AI在客服、教育、陪伴、车载等场景的落地:\”AI电话员\”可能从机械应答变为真正自然的对话者。对硬件厂商,实时语音交互催生对低延迟端侧算力的新需求,AI耳机、智能音箱迎来升级潮。语音交互的终极形态——随时在线的环境智能,正一步步走近。