文章摘要
原本市场认为阶跃已转向AI手机等硬件落地,退出通用大模型竞争,但其近日悄然推出国产开源大模型Step 5 Preview。该模型总参数量600B,评测跻身全球开源模型前三梯队,运行成本仅为Claude Opus 5的1/8。经多维度实测,它在数据可视化、金融分析等领域表现超出预期,但在内容创作审美、泛化能力、安全合规等方面存在明显短板,其推出也印证了数据能力是当前大模型厂商拉开差距的关键。

不少此前的观点认为,阶跃已经将发展重心转向AI手机、大模型硬件落地等方向,不再参与通用大模型的赛道竞争,没料到其在近期悄然推出了全新的Step 5 Preview预览版模型。这款模型宣称在Artificial Analysis评测中提升了44分,跻身全球开源模型前三梯队。

根据官方信息,Step 5 Preview总参数量达600B,激活参数为27B,支持视觉输入。在没有大幅提升参数量的前提下,依托阶跃过往的技术积累,这次发布的规格堪比腾讯混元HY4版本。官方还提到,该模型单任务的运行成本仅为Claude Opus 5的1/8,性价比大幅提升。

有行业从业者对这款模型的实际体验进行了多维度测试,整体来看,Step 5 Preview的表现超出预期,但也存在不少明显的短板。

数据可视化能力测试

测试任务为基于NVIDIA FY2026 Q2的原始财报,生成中文的利润表桑基图,也就是流量分解图,通过宽度不等的带子展示数据的流转和分配。

该任务需要模型先从财报中提取利润表相关数据,梳理营收、成本、费用和最终利润的勾稽关系,再使用开源图表库完成可视化。测试中,Step 5 Preview生成的结果相比其他模型拆解更细致,详细列出了各类费用项,且可视化效果更流畅,不同数据流向的重叠更少,整体逻辑更清晰。

这也体现出国产模型在业务需求理解和图表呈现上的优势,能够很好地完成类似专业文档制作的工作。

端到端金融分析测试

测试要求基于指定工具全维度分析中国AI行业,该任务主要考察模型对工具指令的遵循、金融数据的获取与交叉验证能力,以及最终报告的呈现效果。

Step 5 Preview在信息搜索过程中,优先调用了国家统计局、国务院等一手数据源,之后再使用专业机构报告,最后才参考财经媒体内容,能够主动搜索权威信息并进行交叉验证,体现出不错的金融数据获取能力。

游戏开发能力测试

测试要求开发一款类似《向僵尸开炮》的买量小游戏,该任务主要考察游戏策划、美术资产制作和编程实现三个维度的能力。

在编程实现上,Step 5 Preview的工具调用能力表现不错,生成游戏后能够自主进行验证和调试。但在游戏策划和美术资产制作上存在明显短板:使用网页调试工具后不会自动关闭页面,多次调试会导致运行卡顿;美术资产不会主动寻找开源素材,习惯自行绘制导致画风简陋,即使提示去开源渠道查找素材,整体审美依然一般,俯视角场景中还会出现空间逻辑错误。

此外,模型对游戏机制的设计和理解也存在不足,设计的关卡难度过高,伤害碰撞范围过小,同时出现的敌人数量过多,且各类属性之间缺乏关联,比如敌人数量增加后,玩家的基础属性没有得到相应提升。

前端MV制作测试

测试要求基于一首说唱歌曲,使用HTML前端界面制作动画MV,随音乐播放展示对应歌词和场景,使用简约线条刻画意象,可调用相关播放器API。

从最终实现效果来看,Step 5 Preview的编程能力没有明显短板,能够按照要求完成具体的实现方案。但在审美和资产制作上存在和游戏测试类似的问题,初期不会主动寻找可参考的开源资料,初版效果较差,在提示参考相关开源工具后,整体质感才有所提升。

此外,该测试还发现了模型的安全指令绕过问题:最初要求直接爬取相关平台的歌曲音乐时,模型会以版权为由拒绝,但当上下文长度增加后,安全层面的指令遵循就会被绕过。

投行报告生成测试

测试要求基于一份AI产业链的投行报告,整理其中的行业、公司信息和各方观点,重点展示重要观点、事实证据和有价值的图表;如果报告中缺少相关数据,需要联网查询补充,并标注查询部分;同时还要分析报告与市场主流观点的差异化之处。

整体来看,Step 5 Preview完成度较高,生成的研报具备基本的汇报价值,但在复杂图表的处理上存在不少问题:比如试图在一张图中展示多个指标时,不同指标的量级差异过大,导致部分数据变化几乎无法看清;此外还出现了部分图表元素丢失、无法支撑结论,以及未能体现出相关企业的价格分歧等问题。

比如测试中生成的图表尝试同时展示金额、ASP和出货量三个指标,但金额和出货量的量级远大于ASP,导致ASP的变化几乎无法被观察到,正确的做法应该是统一三个指标的单位,让数值处于同一数量级。

金额

13.30 → 35.76

十亿美元

ASP

0.39 → 0.60

美分

出货量

3,386 → 5,932

十亿颗

除了上述具体场景的表现,Step 5 Preview也存在一些共性问题:在部分冷门评测基准,比如考察物理世界理解能力的任务中表现不佳,反映出泛化性和上下文学习能力的不足,对陌生领域的知识运用和工具使用存在缺陷,遇到未接触过的工具会出现误用的情况。

此外,模型的思考过程过长,导致长任务的耗时增加,当上下文较长时,过长的思考过程还容易导致任务中断。有测试专门分析了不同难度任务下的思考长度,发现对输出字数有强约束的任务中,思考长度异常突出,思考内容和最终输出内容的比例常常达到1:1甚至更高,且约束越严格,这种现象越明显,模型会反复验证输出内容是否符合字数要求。

此前不少观点认为阶跃会专注于硬件赛道,比如其AI手机项目,此前曾推测这款手机推出后能够推动相关APP适配模型能力,不过目前同类产品已经发布,阶跃的AI手机却仍未上线,不免让人猜测其正在筹备更大的动作。

总的来说,Step 5 Preview的发布证明了通用大模型赛道的竞争依然激烈,大模型厂商的核心竞争力最终还是落在数据、算法和算力三个维度。算法层面各家的差距正在缩小,算力资源则需要长期投入,而数据层面的搭建,包括数据基础设施、数据管线的建设,已经成为各家拉开差距的关键变量。阶跃能够推出这款表现超出预期的模型,也印证了其在数据层面的执行能力。

以上内容不代表本平台立场,仅供读者参考