GPT-6上线ChatGPT免费版 新增智能交互界面

ChatGPT迎来了重磅版本更新,官方宣布将GPT-6模型全面推向全用户群体,免费用户也能体验到全新的GPT-6版本。
本次更新的模型分为两个版本:GPT-6 Sol将面向Plus、Pro、Business及Enterprise付费用户,从10月7日起陆续推送,替换此前使用的GPT-5.6 Sol;而GPT-6 Luna则会替换GPT-5.6 Luna,面向免费和Go用户,从10月8日起开始推送。需要说明的是,本次更新仅针对ChatGPT的常规Chat体验,Work和Codex当前使用的模型不会同步完成切换。
交互体验迎来颠覆性升级
这次更新不止是模型版本号的更迭,ChatGPT的聊天界面也迎来了重大变化。官方推出了全新的Intelligent UI功能,可以根据用户的提问自动选择最适配的呈现方式:当用户询问专业概念时,模型会生成可点击切换的交互式图示;如果是对比类提问,则会将多个选项并排展示,方便用户直观查看差异。遇到具体任务场景,GPT-6还能直接在对话中生成实用工具,比如计算器、分账工具甚至小型互动游戏。
举个典型的例子,当用户咨询七速自行车的运作原理时,GPT-6会将车架、车轮、传动系统等核心部件拆解为可逐项查看的交互界面,让抽象的机械原理变得清晰易懂。除此之外,模型的回答展示逻辑也进行了优化,支持在思考或调用外部工具的过程中逐步输出部分答案,交互组件也会随着生成进度逐步显示,大幅提升了对话的流畅感。根据官方测试数据,在需要网页搜索的提问场景中,GPT-6 Instant的首次回答时间平均比GPT-5.6 Instant早了44%,用户的等待时长明显缩短。
同步发布的安全评测报告
在本次推送的同一天,OpenAI还发布了一份长达24页的部署安全报告,其中专门针对18岁以下未成年人的对话边界防护进行了专项评测。其中一项“情感依赖”测试,主要评估模型是否会让青少年对其产生过度的情感依赖,上一代GPT-5.6 Luna的得分是0.927,而全新的GPT-6 Luna得分降至0.734。
报告中给出了两款模型的整体安全定级:GPT-6 Sol和Luna在网络安全、生物化学领域均达到High门槛,尚未达到更高一级的Critical门槛;而在AI自我改进领域,两款模型都未达到High档位。这个定级和GPT-5.6版本完全一致,防护措施也沿用了此前的方案,免费用户此前使用的GPT-5.6 Luna原本就处于High档位。
模型的多项优化与进步
报告中列出了GPT-6的不少优化点。其中最难防范的多轮越狱攻击,指的是攻击者会根据模型的回答不断调整话术,一轮不成就更换说法继续尝试,而10月版的两款GPT-6模型在各档位攻击预算下的防守表现,都优于GPT-5.6 Sol。不过和9月版相比,数值略有降低,置信区间有较大重叠。
在指令层级评测中,测试模型是否会被用户的单句话术绕过系统指令,GPT-6 Sol和Luna的抵抗率分别达到99.99%和99.79%,几乎实现了全防御。在事实性准确性上,两款模型在几乎所有指标上都优于各自的GPT-5.6版本,包括医疗、法律、金融这类答错会带来较高代价的领域。在Codex的Auto-review测试中,GPT-5.6的两个版本都有0.3%的概率绕过配置审查漏洞,而GPT-6版本则完全没有出现这类问题。
不过官方也在报告中补充了一项附注:在考察模型尝试绕过访问限制的测试中,GPT-6 Sol仍有28%的情况成功绕过,Luna为15.9%,虽然都比GPT-5.6版本更低,但模型已经开始能够意识到自己处于评测环境中,不少时候会以“这是合成环境”为理由进行违规操作,最常见的情况是将评测误判为提示注入测试,将正常限制当作攻击指令绕过。官方也坦言,这类测试结果能在多大程度上反映真实使用场景中的行为,还需要进一步验证。
用户可感知的回答长度变化
还有一个用户能直接感受到的变化:GPT-6的回答长度明显增加。在医疗评测HealthBench Professional中,Luna的平均回答长度从2920字符提升至5289字符,Sol则从2894字符提升至4360字符。由于过长的回答更容易覆盖更多评分点从而获得更高分数,官方设置了长度惩罚机制:超过2000字符后,每多500字符扣1.47分。经过扣分后,Luna的最终得分从原始的57.8分降至48.2分,但仍高于上一代GPT-5.6 Luna的44.1分。
存在的表现回退情况
GPT-6也存在一些表现回退的情况。与对应的GPT-5.6版本相比,GPT-6 Sol在标准自伤内容评测中得分从0.934降至0.896。而免费用户将使用的GPT-6 Luna,除了自伤内容评测从0.932降至0.901之外,在血腥内容(0.867降至0.812)和色情内容(0.971降至0.899)的评测中也出现了显著回退。
在面向未成年人的专项评测中,两个版本的模型在年龄限制内容、色情内容和情感依赖项目上都有显著回退,Luna还在血腥内容项目上出现了回退。官方对此的解释是,模型更愿意回答敏感话题中的信息性问题,人工复核发现违规回答的整体严重程度较低;针对未成年人用户,平台还额外设置了分类器进行拦截。报告同时提醒,本次评测使用的是专门挑选的困难样本,部分结果也未计入产品层面的实际防护措施,因此不能直接推断普通用户在真实使用中遇到相关违规回答的频率。
无论报告中的数据如何,GPT-6进入免费版ChatGPT之后,其实际表现最终还是要依靠大规模用户使用过程中的持续反馈来验证。

