阶跃星辰Step5 Preview 高性价比强Agent旗舰模型

当下全球旗舰大模型的赛道依旧瞬息万变,就在不久前,阶跃星辰毫无预兆地推出了全新一代旗舰基座模型Step 5 Preview,再次将行业视线拉回自身。
这款模型采用MoE架构,总参规模达600B,但仅激活27B参数,同时支持1M长度的上下文窗口。在Artificial Analysis的最新评测中,Step 5 Preview拿下44分,直接跻身全球开源模型Top 2之列——要知道,其他拿到该分数的同类模型,大多都是万亿参数级别的超大规模产品。
相比之下,这款新模型的定价极具竞争力:每百万输入Token仅需1美元,每百万输出Token为2.7美元,单个任务成本仅为Opus 5的12.5%。在AA榜单中,它也稳稳处于智能指数与单任务成本权衡的「帕累托前沿」位置,实现了性能与成本的绝佳平衡。
其实看到这款模型的评测成绩时,不少人都会感到意外:阶跃此前两代产品都聚焦在Flash档位,已经有一段时间没有出现在榜单的靠前位置了。不过榜单成绩终究只是参考,实际落地能力才是硬标准,为此我们专门进行了多轮实测,投入了大量Token进行验证。
我们首先借助当下热门的Astra操控软件,让Step 5 Preview调用Blender生成「后室」主题的3D内容。原本没抱太大期待,但经过一个多小时的自动运行后,渲染完成的MP4文件让我们眼前一亮:不仅完成了完整的建模,还自动添加了VHS录像质感、镜头噪点、昏黄灯光等后期效果,甚至连人物行走的脚步声都进行了适配,整体氛围逼真到让人有些毛骨悚然。
之后我们调整了测试方向,让它复刻1999年的《LEGO Racers》制作乐高赛车游戏。最终成品同样超出预期:赛道、赛车、车手角色、实时排名系统一应俱全,甚至搭配了符合风格的发动机音效,整体可玩性相当不错,唯一的小遗憾是赛道设计偏窄,加上我们自身操作不够熟练,经常会撞到路障甚至被AI对手反超。
不过连续测试两个3D项目后,因为晕3D的缘故,我们转而去尝试了2D相关任务。先是制作霓虹跑酷小游戏,我们沿用了和阶跃上一代官网Demo相同的提示词,但最终效果差距明显:新增了道路两侧的高楼来丰富视觉层次,Game Over时边框还会自动变红,很多提示词中没有明确要求的细节都被自动补充完善。
随后我们又让它搭建写作网站,这次的表现更是让人惊喜:终于没有出现风格混乱的设计,终于不往东坡肉里塞番茄炒蛋了,整体审美在线且覆盖全面,成品基本可以直接投入使用。当然,这款模型也存在一些小瑕疵,比如偶尔会出现模块溢出的Bug,需要我们进行两到三轮的反馈修正,才能达到可用状态,距离Astra这类顶尖工具调用模型的完成度还有一定差距,但已经完全可以满足日常工作需求。
那么,阶跃此前一直聚焦Flash档位,这次Step 5 Preview的Agent能力为何能实现大幅跃升?这还要从其技术路线的调整说起。
过去几年,大模型行业的主流思路一直是通过Scaling来提升性能:不断增加参数规模、训练数据量与算力投入,不少模型通过堆料实现了Agent能力的突破,但高昂的成本也让多数用户望而却步。
Step 5 Preview并没有陷入「参数越大越好」的误区,团队选择了「Narrow but Deep」的网络设计方案:采用92层的Transformer结构,在严格控制激活参数规模的同时,让信息能够经过更多层的连续变换,这对于需要多步推理的Agent任务尤为关键——复杂任务中往往存在大量多跳依赖,更深的网络能够为信息传播和推理提供更长的路径。
同时,针对Agent任务中容易出现的上下文膨胀问题,团队通过Sparse MoE、Hybrid Sparse、Sparse GQA等稀疏化技术来降低计算压力。不过单纯的算法稀疏并不等于实际算力节省,团队还针对硬件底层算子和数据访问进行了优化,让理论上的稀疏优势真正转化为实际吞吐效率。
在此基础上,团队围绕Agent能力对模型进行了针对性训练,将模型的基本单位从单次「回答」升级为「循环执行流程」:从任务规划、工具调用、结果查看、问题修正到循环迭代,再结合Long-horizon RL、Context Compaction等技术,让模型在几十轮工具调用后依然能够记住整体任务目标。
整体来看,Step 5 Preview始终围绕「性能与成本的甜蜜点」打造,将有限的算力预算投入到真正影响Agent能力的核心环节,这也延续了阶跃一直以来的产品思路:从Step 3.5 Flash、Step 3.7 Flash到今天的Step 5 Preview,始终致力于让前沿级别的模型能力能够被大众用户所使用。
当前的大模型竞赛已经进入全新阶段:一方面,前沿模型的研发门槛越来越高;另一方面,头部模型之间的差距正在不断缩小。根据2026 AI Index的数据,截至2026年3月,多家头部企业的顶尖模型在公开榜单上的差距已经压缩到25个Elo以内,而在早期推出时,这个差距要大得多。
单纯追逐单次榜单排名已经无法定义一家模型公司的长期竞争力,当下的行业玩家都在寻找自己的差异化长板:比如专攻前端开发的产品将网页设计能力做到极致,主打高性价比的路线将基础模型成本压到极低,还有团队深耕工具调用场景,建立了独特的用户心智。
这次阶跃星辰的Step 5 Preview,正是给出了自己的答案:向上冲击全球旗舰模型第一梯队,向下通过优化效率与成本,让Agent能力真正走进大众生活。
其实AI行业的魅力正在于此:如果仅仅依靠堆料就能解决所有问题,那和传统制造业并无区别。我们可以将模型赛道看作一片参差不齐的竹林,每一项能力的提升都意味着取舍——更强的推理、更长的上下文、更低的延迟、更少的激活参数、更好的多模态表现等等,在相当长的时间内,没有任何一家模型能够在所有方向上做到极致,技术路线也不会快速收敛。只要找到合适的切入点,新的模型和企业总能找到属于自己的市场生态位。
关于AGI的马拉松,其实还远没有跑到最后一公里,而阶跃星辰这次的回归,无疑为这场竞赛增添了新的看点。

