ChatGPT语音模式支持边听边说,复杂问题转后台推理

ChatGPT的语音交互模式迎来重大升级,如今可以实现边听边说,并将复杂推理任务转交后台专用模型处理。
• 核心发布信息:7月8日,相关AI企业发布了两款语音模型——GPT-Live-1与GPT-Live-1 mini,为重构后的ChatGPT语音功能提供底层支持。与此前的Advanced Voice Mode(AVM)不同,两款模型均可同步处理传入与传出的音频流,而非等待单轮对话结束后再进行处理。通信领域将这种模式称为全双工交互:就像日常打电话一样,收发信号同时进行,而非对讲机式的轮流发言。当遇到需要深度思考的问题时,语音模型会将任务转交GPT-5.5处理,同时自身继续维持对话状态,该系统完全替代了此前的AVM模式。
• 产品细节
• 输入输出:两款模型均支持语音输入与输出,采用连续式音频处理,实现收发同步。在ChatGPT应用中,对话界面会同步展示视觉卡片,涵盖天气、股票、体育、地图等内容,同时支持图片与文件上传,但暂不提供实时视频与屏幕共享功能。官方表示正在推进这两项功能的上线,目前该体验仍可在旧版Standard与AVM模式中使用。
• 功能特性:支持实时翻译功能,内置9种重新优化的预设语音,且均配备了防止模仿真人声音的安全保护机制。GPT-Live-1支持用户自主选择推理强度:Instant模式后台调用GPT-5.5 Instant,Medium与High模式则对应运行GPT-5.5 Thinking;而GPT-Live-1 mini仅支持调用GPT-5.5 Instant。
• 性能表现:在官方测试中,高推理设置下的GPT-Live-1在GPQA测试(涵盖生物、化学、物理的研究生水平科学考题)中得分达84.2%,而前代AVM仅为45.3%。在BrowseComp测试(面向难以获取信息的智能体式网页搜索任务)中,两者差距更为明显:GPT-Live-1高推理模式下正确率达75.2%,而AVM仅为0.7%。人工评审在5到10分钟的配对对话中,75.7%的情况更偏好GPT-Live-1,GPT-Live-1 mini的该比例为69.2%。
• 内容安全表现:两款GPT-Live模型在识别违规内容方面均优于前代AVM,在非法行为(GPT-Live-1识别率97%,AVM为74%)与自我伤害相关内容(96% vs 89%)上提升显著。在对抗性提示场景中提升更为明显:GPT-Live-1识别出84%的心理健康相关违规查询,AVM仅为57%;在自我伤害场景下,GPT-Live-1识别率达98%,AVM为72%。
• 可用性:目前已在全球范围内登陆iOS、Android平台与ChatGPT官网。GPT-Live-1为Go、Plus、Pro付费计划的默认选项,且不收取额外费用;GPT-Live-1 mini则面向免费计划用户开放。暂未推出面向开发者的API,目前面向开发者的语音方案仍为GPT-Realtime-2,已于5月接入Realtime API。
• 未披露信息:官方未公布两款模型的参数量、架构细节、训练数据、知识截止时间、延迟测试数据以及按使用量计费的定价方案。
• 系统运作逻辑:官方发布的GPT-Live系统卡显示,该系统由多个模型集成组成。与前代AVM相比,核心差异有两点:一是采用连续音频处理而非轮次式处理,二是将复杂任务委派给独立的后台模型。
每一款GPT-Live模型在生成自身回复的同时处理传入音频,每秒会多次判断下一步动作,包括继续发言、暂停聆听、等待用户输入、插话、给出反馈性语气词(如“嗯”“对”),或是触发工具调用。
当遇到需要网页搜索、深度推理或多步工具调用的任务时,语音模型会将任务转交GPT-5.5处理,在后台模型运行的同时维持对话状态,待结果返回后再将内容整合进对话中。两个模型共享对话上下文,但由不同的系统编排与提供服务。官方表示,后续会随着新推理模型的发布,将GPT-Live对接更新的模型版本。
安全检查会与对话同步进行,系统会在输入与输出展开的过程中实时审核,可根据情况引导或中断回复、播放语音安全提示、以文字或语音形式展示支持资源,在风险较高的场景下甚至会直接结束对话。
• 行业背景与竞品对比:GPT-Live的两项核心设计——全双工音频处理与推理模型委派,并非全新概念。此前已有多个团队推出类似架构:阿里巴巴的Qwen2.5-Omni Thinker-Talker将文本生成的“思考模块”与语音合成的“说话模块”整合为统一系统;Thinking Machines Lab在TML-Interaction-Small模型中实现了前台交互模型与后台推理器的配对;Kyutai推出的Moshi被作者称为“首个实时全双工口语大语言模型”,于2024年正式发布;英伟达在今年1月推出了基于Moshi的开源权重模型PersonaPlex;谷歌的Gemini Live目前也支持连续对话与摄像头、屏幕共享功能。官方表示,其将这类体验带给了超1.5亿每周使用ChatGPT语音与听写功能的大众用户,这也是其值得自豪的成果。
• 战略布局意义:官方对语音系统的持续投入,或许预示着更大的业务野心。据行业观察,该公司计划在今年年底前推出一款便携无屏幕智能音箱,完全依赖GPT-Live的语音交互,预计该设备将于2027年初上市。据报道,这款设备会随着使用时长不断熟悉用户习惯,实现高度个性化的交互体验,并调用比当前市面智能音箱更强大的AI模型。官方的语音交互战略成败,核心在于能否成功将语音打造为日常生产力的一等交互界面。
• 行业观察思考:任何参与过语音系统开发的团队,都曾花费多年时间处理轮次检测的痛点:调整静默阈值、设置缓冲时长、判断用户停顿是发言结束还是正在思考。全双工模式并不会让这类判断更准确,而是直接消除了这类猜测的必要——模型可以实时决定是继续发言、暂停等待,或是给出反馈语气词。不过,另一个不那么显眼的设计选择或许更具长期价值:由于对话层与推理层实现了解耦,GPT-Live可以无缝继承每一次前沿模型的升级,且无需在快速响应与深度思考之间做出妥协。全双工让语音对话更流畅自然,而任务委派则让对话具备了真正的深度与价值。


