文章摘要
美国时间10月7日,OpenAI宣布将GPT-6全面接入ChatGPT日常对话场景,推出全新智能交互界面Intelligent UI,按付费、免费用户梯队开放不同版本,免费用户也可体验;新增边思边答的渐进式输出能力,联网问答开始回答时间提速44%,同时升级性能与安全,新界面支持生成各类可交互内容与工具。

ChatGPT正在告别千篇一律的纯文字对话窗口,迎来体验层面的全面升级。用户不再只能等待模型输出完整的文字回复,而是可以直接获得可交互、可操作的内容与工具。

美国时间10月7日,OpenAI正式宣布,GPT-6全面接入ChatGPT日常对话场景,同时推出全新的智能交互界面Intelligent UI,这项更新将面向全球超过12亿周活跃用户开放。在此之前,OpenAI已经在今年9月陆续推出了GPT-6 Astra以及针对不同性能和成本需求的GPT-6 Sol、Luna:9月22日发布的Sol和Luna率先进入ChatGPT Work、Codex及API等使用场景,9月29日又发布了GPT-6.1 Sol。本次更新的重点,就是将GPT-6 Sol与Luna引入日常对话,并同步带来Intelligent UI和渐进式回答能力。

根据官方披露的信息,不同用户的更新安排有所区别:付费用户包括Plus、Pro、Business、Enterprise版本,将从10月7日起陆续获得GPT-6 Sol以及智能交互界面;免费的Free和Go用户,则会从10月8日起陆续获得GPT-6 Luna和对应的交互体验;企业工作区的可用情况,则取决于管理员的模型权限设置。其中GPT-6 Sol主要面向更高性能的使用需求,而Luna则更侧重速度和成本效率。

需要注意的是,本次更新也存在一些容易被忽略的使用限制。首先,Intelligent UI主要支持GPT-6的Instant至Extra High推理档位,即便是付费用户,选择最高档的Pro推理模式时,目前暂时无法使用这套新界面,因为该模式仍由GPT-6 Astra驱动。其次,Intelligent UI并没有独立的专属用量额度,但用户仍需遵守原有订阅方案下的模型、工具及功能限制。此外,该功能正在逐步向网页和受支持的新版移动客户端开放,部分旧版macOS和Windows桌面客户端暂时无法使用,需要转到网页版体验。对于不喜欢复杂图形界面的用户,也可以通过网页端设置减少视觉元素,但这一选项不保证所有回答都变成纯文字模式。最后需要区分的是,本次更新主要发生在ChatGPT的Chat对话体验中,ChatGPT Work与Codex的底层模型并不会随着本次发布同步替换。

除了全新的交互界面,GPT-6还有一个更值得关注的变化:推理和回答不必再严格串行。随着推理模型不断升级,模型可以处理更复杂的任务,但用户往往需要等待较长时间才能看到最终答案,尤其是在深度研究、复杂推理、联网检索等场景下,即便已经获得部分有用结果,用户也可能迟迟看不到实质内容。OpenAI这次提出的解决办法,是让GPT-6具备交错执行思考与回答的能力,简单来说就是模型不必把全部思考工作做完之后才开始输出,而是能够根据已经掌握的信息,先生成有价值的部分答案,再继续推理、检索和补充,也就是允许模型分阶段交付用户真正需要的结果。

为了避免回答变得零碎,OpenAI还专门训练模型,让多次增量输出在内容上保持一致性与完整性,尽量减少无意义的过渡语句。官方给出了两项值得关注的内部测试结果:其一,在面向高价值日常Agent任务的评估中,GPT-6 Extra High能够以接近GPT-5.6 Medium的时间开始作答,同时取得优于GPT-5.6 Extra High的总体评分,这意味着至少在这一测试场景下,用户不必为了更强的推理能力,付出同等幅度的首次响应等待时间;其二,在需要联网搜索的问题中,GPT-6 Instant开始回答的平均等待时间,比GPT-5.6 Instant缩短44%,需要强调的是,这里的44%衡量的是回答开始出现的时间,而不是整个搜索任务的总耗时缩短44%。

除了响应速度的提升,OpenAI还改进了GPT-6判断何时需要搜索,以及如何寻找答案依据的能力。按照官方披露的内部困难问题评估,GPT-6比GPT-5.6更有可能正确把握问题关键,并找到能够支持结论的信息。安全方面,OpenAI也更新了GPT-6的训练方案,将Astra系列的部分安全能力引入新模型,重点包括增强对多轮越狱攻击的抵抗能力,减少不诚实或误导性的回答,以及更准确地识别网络攻击、生物安全和暴力相关的高风险请求。与此同时,OpenAI也强调,要避免对正常、无害请求产生不必要的拒绝,模型还被训练为更加明确地说明自身能力边界,例如缺少必要信息或工具时,不再轻易给出看似确定的答案。不过,上述性能与安全结论主要来自OpenAI自身公布的评估,实际使用表现仍有待更多独立测试验证。

过去,ChatGPT主要负责生成文字,即便涉及图片、表格或图表,通常也只是把这些内容插入对话中,用户阅读完毕后,还需要通过新的提示词要求模型继续处理。而Intelligent UI则希望改变这种模式。OpenAI表示,GPT-6现在可以根据用户提出的问题,自主决定采用怎样的呈现方式,将文字、按钮、表单和可交互组件组合在一起,主要分为三类应用场景。

第一类,是把静态知识变成可探索的图解。比如在七速自行车的拆解演示中,ChatGPT不仅能展示自行车的整体结构,还提供车架、车轮、传动系统、刹车等切换按钮,用户点击不同部件,就能查看对应的结构说明,而不必反复追问。面对中心极限定理、蒙提霍尔问题等较为抽象的知识,GPT-6也能生成互动式教学界面,让用户通过切换选项、调整参数,直接观察结果的变化。

第二类,是把生活建议变成能够直接使用的工具。规划旅行时,ChatGPT可以把途经地点标记在地图上,并附上值得绕路参观的景点信息;准备聚餐时,它能够将菜单、烹饪流程与时间安排整合呈现;如果是穿搭建议,也可以通过图片与分组界面,让不同组合一目了然。这里的关键不只是视觉上的丰富,而是模型开始判断什么信息应该放在一起,什么内容需要比较,哪些地方应该允许用户直接操作。

第三类,则更进一步:通过一句自然语言指令,直接生成临时交互工具。OpenAI展示的案例包括退休储蓄计算器、多人餐费分摊器,以及能够在聊天窗口中直接游玩的复古小游戏。过去,用户可能需要打开专门的计算网站,或者让AI编写一段代码再到其他环境执行,而现在可以直接在对话窗口中使用这些工具。

很显然,这已经超出了传统图文回答的范畴。不过需要注意的是,Intelligent UI并不是让GPT-6为每个问题都重新编写一套独立软件。根据OpenAI公布的技术方案,系统底层采用原生、可流式输出的组件库,配合专门的编译器,在模型生成内容的过程中逐步构建界面。组件库负责提供统一的设计元素,模型则判断这些组件应该如何组织、组合,以及如何与内容配合。编译器可以边接收生成内容边呈现界面,而不必等待整个回答彻底完成,这也是它区别于此前AI生成网页代码的一点:用户不必先打开一个编程环境,而是可以直接在对话里使用这些临时生成的交互组件。

过去几十年,人们使用软件通常需要先找到对应的应用,再学习它的功能与操作方式:想算账就打开计算工具,想看地图就进入导航软件,想理解一组复杂数据可能还需要打开电子表格寻找合适的图表功能。而Intelligent UI试图把这个过程倒过来,用户只需要描述自己要解决什么问题,AI再根据需求生成适当的界面与操作方式,让它具备改变一部分轻量级软件的使用方式的潜力,特别是那些低频、临时、需求高度个性化的工具,用户未必还需要专门寻找、安装和学习一款应用。

对OpenAI而言,这也是一次产品竞争逻辑的变化。从更强的模型,到更快的响应,再到能够根据问题临时组织界面的ChatGPT,AI助手正在尝试承担过去由多个独立软件分别完成的任务。OpenAI提出,未来不应该只是人去适应软件,而应该让软件适应人的需求。所以,一个更值得继续观察的问题是:当AI不仅能够回答问题,还能根据问题生成操作界面时,用户还需要多少预先设计好的软件?

以上内容不代表本平台立场,仅供读者参考