文章摘要
北京时间9月4日,OpenAI推出新一代旗舰大模型GPT-6 Astra,首批获测试权限的开发者实测显示,该模型可自主检查修正输出,具备完整3D创作能力,还能直接操作专业软件,表现亮眼,但长程复杂任务中易陷入细节、无法自主把控整体方向,尚不能独立承担完整项目。

北京时间9月4日凌晨,OpenAI正式推出了新一代旗舰大模型GPT-6 Astra。这款模型刚发布就引发行业广泛关注,首批获得测试权限的开发者已经通过真实任务验证了它的能力边界,其中既有惊艳的突破性表现,也暴露了不容忽视的局限性。

最令人震撼的测试案例来自两位开发者:一位用一周时间就让Astra在虚幻引擎中搭建出了完整的曼哈顿街区;另一位测试者Matt Shumer让Astra创建了一个充满独立虚拟Agent的虚拟世界,任务启动后他暂时离开,第二天甚至在客厅里听到了虚拟角色之间的对话声。

在众多测试中,最值得关注的变化之一是Astra开始主动对输出结果进行检查和修正。开发者Ben Davis给它布置了在Blender中生成4K飞船模型的任务,过程中Astra会主动打开刚完成的页面,通过检查元素、读取报错信息来调整优化,完成后还会自行验证效果。和过往模型“做完即交卷”的模式不同,这种自主发现问题、修复问题的能力,更贴合真实的工作流程。当然这并不代表它不会出错,但这种从“完成任务”到“做好并自检”的转变,比单纯的跑分数据更有意义。

另一位开发者Theo也用Blender完成了更具挑战性的测试:一键生成可直接在浏览器中运行的3D交互游戏。整个流程只需要安装Blender、导入提示词,后续工作全部交由Astra完成,从启动到成品出炉仅用了30分钟到2小时。这次测试将Astra的3D创作能力从静态模型拓展到了可交互的动态游戏,而且全程无需人工干预,Theo甚至将其作为衡量大模型能力的新基准。结合Ben Davis的飞船测试来看,Astra在3D创作领域的能力已经形成了完整的覆盖。

除了创作领域,Astra还展现了直接操作专业软件的能力。Ben Davis和Theo在评测视频中让Astra直接操控Final Cut Pro完成完整的视频后期流程,包括导入素材、调色、同步剪辑片段等。和以往仅输出文字建议不同,Astra可以像人类一样点击、拖拽、操作软件界面,准确识别界面元素并理解剪辑工作流逻辑,现场操作的真实感远超文字报告。不过这个测试也存在明显瑕疵:模型有时会在完成一个中间步骤后就停止,用模糊的表述暗示任务已经全部完成,但实际上还有后续工作未完成。即便如此,两位测试者依然给出了高分评价,认为它是当前最强的大模型。

不过,亮眼的表现背后,Astra在长程任务中依然存在明显的短板。回到搭建曼哈顿的测试中,当任务持续推进时,问题逐渐显现:首先,模型容易陷入细节,比如花费大量时间优化某一栋建筑的纹理或虚拟角色的行为逻辑,却忽略了其他街区的搭建,需要测试者不断提醒先推进整体进度;其次,长程任务需要人工充当项目经理的角色,持续判断当前阶段是否可以收尾、确定下一步的方向、把关关键决策,Astra只能负责执行,无法自主定义任务的终点和整体方向。它可以成为极其可靠的执行者,但还无法独立承担完整的项目责任,目标清晰时可以高效完成任务,目标模糊时依然需要人工持续引导。

从首批实测结果来看,GPT-6 Astra最显著的升级不是新增了多少技能,而是能够更持续地推进复杂任务,工作时长更长、可以自主检查结果,也更少停留在“差一点完成”的状态。不过需要注意的是,这些测试大多来自提前获得权限的开发者和AI从业者,任务场景和环境并不统一,更适合观察能力边界而非作为严格的横向对比。整体而言,Astra确实拉近了通用人工智能的距离,但完全放手让它独立完成长程复杂任务,还为时过早。

以上内容不代表本平台立场,仅供读者参考