GPT-6屠龙141小时,被苦力怕炸去种土豆

连续奋战六天,最终却落得基地尽毁、前功尽弃的结局——这是前沿AI模型GPT-6 Astra在《我的世界》中的真实测试经历。
141小时的测试过程中,它原本一心朝着击败末影龙的目标推进,眼看屠龙所需的关键物资都已筹备完毕,却被一只自爆苦力怕直接摧毁了基地、储备物资和重生点,六天的努力瞬间化为泡影。
一场屠龙计划,毁于一只自爆小怪
本次测试由某AI研究团队发起,他们的核心目标并非验证模型能否玩转沙盒游戏,而是想探索顶尖自主智能体在开放环境中,长时间自主完成复杂任务的可能性。整个测试仅设置了一个明确的最终目标:击败终极BOSS末影龙,完成游戏通关。
测试初期,Astra的表现十分亮眼:它自主探索地图、收集各类生存资源,很快就集齐了挑战末影龙所需的全部关键物资。为了降低意外损失,测试团队特意开启了“保留物品栏”的游戏设置,即便角色死亡,身上的道具也不会丢失。但Astra却额外给自己加了一道“保险”——它担心随身携带的物资不够稳妥,便将全部储备资源都存进了床边的储物箱。
在Astra看来,这是稳妥的风险管理策略,但在游戏里的自爆怪苦力怕眼中,这简直是送上门的“一锅端”。没过多久,一只苦力怕突然冲向基地引爆自身,不仅储物箱被炸得粉碎,所有储备物资荡然无存,就连附近的重生点也被彻底摧毁。
这次打击让Astra的状态一落千丈,原本专注于通关的目标彻底被打乱。在接下来的游戏时间里,它不再执着于挑战末影龙,转而开始修补基地、补充物资、种植土豆,每次看到苦力怕都会远远绕开,从原本一心屠龙的勇士变成了谨小慎微的农场主。
这次爆炸还让它留下了严重的心理阴影,甚至把远处的甘蔗田误认成了苦力怕,陷入过度警惕的状态。原本的通关任务,彻底变成了求生生存模式。
141小时测试暴露的三大核心能力
这场耗时141小时的测试,实则暴露了自主智能体的三项核心能力:
第一是环境理解能力。面对不同的敌人、地形和资源变化,智能体需要先准确判断当前状况,再制定对应的行动方案。比如遇到近战僵尸时,Astra会主动垫高站位,利用高度优势避免被围攻。
第二是任务拆解能力。“击败末影龙”只是一个单一的最终目标,但从收集资源、制作装备到探索地图,所有中间环节都需要智能体自主拆分任务、排定优先级,一步步推进。
第三是长期持续执行能力。在141小时的测试过程中,游戏环境一直在变化,原定计划也会被各种意外打断,智能体需要不断根据反馈调整策略,才能继续朝着目标前进。
不过这场测试也暴露了一个关键问题:即便智能体拥有出色的规划和解决问题的能力,当任务周期足够长,中途遭遇多次意外后,模型很容易逐渐偏离最初的核心目标。Astra后续的每一项行动单独来看都合情合理,但这些细碎的合理选择积累下来,却让它彻底远离了原本的屠龙任务。
而现实中的长期复杂任务,只会比沙盒游戏更加棘手。
AI落地的核心在于实际应用
这一现象在企业AI落地过程中同样存在。当前AI模型的能力不断提升,但要真正将技术融入业务流程,重新设计业务流程、拆分任务模块、优化团队协作模式,依然是需要重点解决的问题。
不少科技企业都在探索AI落地的有效路径,过去三年就有头部企业一直在深耕这一领域。今年10月,该企业将在深圳、上海举办两场AI实战线下分享会,从理论认知到实操落地,分享自身在AI转型过程中积累的经验与踩过的坑。
如果您正在思考如何将AI技术真正融入企业业务,欢迎报名参与,带着实际问题现场交流。

