文章摘要
9月20日,阶跃星辰推出新一代开源旗舰基座模型Step 5 Preview,该模型在升级后的行业评测中得分44,位列全球开源模型前三,性价比突出,原生支持1M长度上下文,主打编码、金融等复杂长任务,多场景实测表现优异。它采用效率优先的稀疏MoE架构,目前阶跃已完成全栈体系布局,终端落地规模可观,跻身全球大模型核心竞争序列。

九月的AI赛道正处于密集迭代的白热化阶段,全球头部实验室接连推出新一代旗舰模型,国内厂商也在加速跟进迭代节奏。在这场每周都有重磅更新的混战中,有一家厂商没有选择跟随行业的小步快跑节奏,而是选择厚积薄发,在9月20日推出了新一代旗舰基座模型Step 5 Preview,正式宣告回归赛道核心竞争序列。

在行业通用的Artificial Analysis Intelligence Index评测中,Step 5 Preview拿下了44分的成绩,位列全球开源模型前三。横向对比来看,Claude Fable 5.1以53分领跑全球,GPT-6 Astra紧随其后拿到52.8分。这款模型的性价比表现尤为亮眼:每百万token输入仅需1美元,输出费用为2.7美元,完成一次评测任务的平均成本仅0.71美元。在官方的性能与成本对比体系中,Step 5 Preview开辟了全新的最优平衡点——在同等智能水平下,没有比它更实惠的选择;而在相同成本区间内,也没有比它表现更出色的模型。

值得注意的是,该评测体系在9月初刚刚升级到v4.2版本,新增了两项评测维度,淘汰了难度过低的旧评测项,同时将私有测试集的权重提升至40%。这意味着靠背题刷分的时代已经过去,模型需要在完全陌生的任务中展现真正的推理能力。而Step 5 Preview作为开源模型能够闯入榜单核心竞争区,证明国内开源模型的能力天花板正在快速向上突破。

这款模型的核心应用场景非常明确:面向Coding、软件工程、专业知识和金融场景,也就是那些需要长上下文、多轮工具调用和持续执行的复杂任务。它原生支持1M长度的上下文,可以完整加载整个代码仓库或大型数据室,不再需要拆分输入内容来适配模型限制。

我们拿到内测资格后,设计了多个贴近真实工作场景的测试项目,来验证Step 5 Preview的实际能力。

代码开发能力测试:一键生成可玩的3D飞行游戏

我们给模型的测试题目是:使用单文件HTML,仅借助three.js库,制作一个街机风格的低多边形3D飞行小游戏,要求能够正常游玩且视觉效果出色。Step 5 Preview仅用了20多分钟就生成了上千行代码,打开即可直接运行游戏。

游戏的视觉效果远超预期:天空和海水没有使用预设贴图,而是由模型自行编写的着色器实现,海面的起伏波浪、阳光在浪尖的反光以及远处融入雾气的远景都自然真实。操作手感流畅精准,按下左键即可转向,松手后自动回正,加速时视野自动拉宽,转弯时镜头跟随动作同步偏移,速度感完全贴合操作反馈;碰撞到海面时会有轻微的抖动和弹起效果,不会直接结束游戏,保持了持续的游戏节奏。

模型还主动在基础需求之外添加了细节:仅要求“金色光环”,模型为每个光环添加了直冲天际的光柱,让玩家在几百米外就能清晰看到目标方向,让追环玩法更有节奏感。同时自带穿环粒子爆炸特效、+100得分飘字、Boost冷却条显示以及90秒计时结算最高分功能,完全达到生产级可用标准,无需额外修改即可直接体验。

长程Agent测试:12份合同的精细化审核

第二项测试是典型的长程办公任务:拿到12份中英文合同,对照法务部的10条审核标准逐条检查,然后计算每份合同的续约日期、撰写修订函,并为采购部门整理总结报告。人类在处理这类任务时,最容易出错的环节是在第八份合同之后,注意力会出现明显下降,但Step 5 Preview交付的三个文件完全符合要求。

120项审核判断全部准确命中,26处违规全部被精准找出,额外标注的12处细节也完全合规。比如部分合同的责任上限看似符合“以年度金额为限”的条款,但模型注意到数据泄露、重大过失不设上限的补充要求,这一点人类审核很容易遗漏。哪怕是第十二份合同,审核的细致程度和第一份完全一致,甚至能发现藏在附件中的违规内容,而不仅仅是检查正文部分。

模型还能精准计算错过的退出窗口和最晚补救日期,对于一份已经错过正常退出窗口的合同,它会标红并给出还能补救的最后一天;对于一份年底才到期但通知期在10月2日截止的合同,会主动单列出来提醒。三个输出文件之间逻辑咬合紧密:修订函中给供应商的最后期限,和续约清单中算出的最晚通知日完全对应;给采购部的总结内容,也和前面列出的三件最紧急事项的时间节点一一匹配,完美展现了长程Agent的可靠执行能力。

深度研究测试:调和九份矛盾材料的真相

第三项测试是深度研究任务:提供九份关于同一家初创公司的公开材料,其中融资额、估值、营收、交付量、员工数等核心数据存在多处不一致。模型首先建立了七级优先级的审核规则:审计报告>公司更正声明>一手核实>官方新闻稿>BP>数据平台>匿名帖,同时辅以“口径优先于数值”“时点对齐”等六条辅助规则。

七个事实项全部准确研判,35处引用都精确到具体文件和行号。哪怕CEO在专访中提到公司估值32亿,且有两份官方材料印证,模型依然按照规则采用更正声明中的30亿估值,因为更正声明发布时间更晚且有内部邮件解释了32亿估值的计算逻辑。

此外,模型还发现了材料中未被注意到的矛盾:新闻稿提到同比增长210%,但反推去年上半年营收仅0.49亿,意味着69%的营收集中在下半年,没有任何材料能解释这一异常,被模型列为最脆弱的风险点,真正做到了基于规则的深度研究而非单纯依赖直觉。

金融尽调测试:扮演专业投资经理的全流程工作

最后一项测试是金融尽调场景:提供一家B轮融资公司的完整数据室,包括利润表、发票台账、银行流水、股权表、供应商名录和创始人演示材料,要求为投委会撰写尽调备忘录,并制作带公式的勾稽底稿。

模型生成的所有数字都精确到元,收入、回款、应收、净亏等核心数据全部和真实信息完全一致,底稿的多个表格和活公式都能从原表直接追溯。同时核出多处数据不符:实际增速、毛利率、客户数量、最大客户占比等关键指标均与公开表述存在差异。

在经营现金流方面,模型剔除了非经营性的股东借款和政府补贴,得出上半年实际现金流状况,还通过关联分析发现了未披露的关联交易,将不同材料中的信息串联起来,揭露了未公开的利益输送问题。此外,模型还注意到毛利率的异常波动,判断成本核算存在异常,证明模型并非单纯核对数据,而是真正在开展专业尽调工作。最终模型给出有条件继续尽调的结论,并附带多项先决条件和需要补充的材料,完整覆盖了专业投资经理的全工作流程。

反直觉的技术路线选择

Step 5 Preview采用稀疏MoE架构,总参数量600B,激活参数仅27B,原生支持文本与视觉输入,上下文长度达到1M。不同于当前行业追求万亿参数的风潮,研发团队明确表示,模型的“大”只是手段而非目的,核心目标是实现智能、成本、速度和规模之间的最优平衡。

具体的技术设计包含四个关键方向:

首先是窄而深的架构设计。复杂Agent任务中存在大量多跳依赖,频繁的工具调用又会带来很长的前置处理阶段,此时模型的网络深度不足会限制隐式多跳推理的完成。因此Step 5 Preview将Transformer深度直接提升至92层,为长上下文的信息传播提供更长路径。同时针对深层网络容易出现的数值爆炸、梯度尖峰问题,团队对隐藏状态、归一化和梯度计算做了专门优化,保证训练过程的稳定性。

其次是多层面稀疏设计,采用混合稀疏激活架构。除了MoE本身的专家稀疏激活外,引入稀疏分组注意力机制,在处理百万token超长上下文时,无需让每个token与所有token进行注意力计算,通过稀疏索引仅调用相关历史信息,大幅降低长上下文的计算开销,让模型学会“只看该看的地方”。

第三是算法稀疏到系统效率的打通。算法层面的稀疏设计并不天然等于实际使用中的更快速度,因为稀疏计算对GPU的索引和数据搬运模式有特殊要求,可能会抵消理论上的性能节省。为此Step 5 Preview通过块级令牌合并,将索引与选择的成本降低8倍;同时合并相邻令牌高度重叠的结果,改善碎片化计算导致的GPU利用率问题,确保算法层面的稀疏优势真正转化为实际使用中的高效体验。

第四是面向Agent的训练体系。在Step 5 Preview的数据生产流程中,智能体不仅负责生成样本,还参与知识探索、任务设计、难度与多样性控制和流程动态编排。同时加入安全性检查,避免模型通过评测漏洞“看起来成功”却未真正解决问题。整个流程由专家提供原则和关键判断,智能体负责动态编排,确定性操作交由代码和工具执行,最终构建出百万级、可验证的高难任务环境,覆盖科学推理、软件工程、机器学习研发和专业工作场景。

针对变长Agent任务,模型还在训练与推理一致性、训练效率和长轨迹学习三个方面进行优化,将上下文压缩和细粒度奖励分配纳入训练流程,让智能体能够在有限上下文中推进更长周期的任务。

从Flash到旗舰:贯穿始终的效率优先脉络

这种效率优先的技术路线并非Step 5 Preview首次出现,回溯阶跃的三代基座模型,效率优先都是贯穿始终的核心主线。

Step 3.5 Flash总参196B,激活参数11B,作为稀疏MoE模型定位为Agent大脑,发布后迅速被极氪8X搭载,成为吉利整车智能体的核心模型。Step 3.7 Flash总参198B,激活参数约11B,新增原生视觉能力,发布两天内冲上全球热门榜单第二,随后拿下多模态热榜第一。

Step 5 Preview延续了同样的稀疏架构基因和效率优先思路,激活比例甚至比前两代Flash系列更低,却将能力提升至旗舰水平,上下文长度从256K拓展到1M。这证明“高效率”和“高智能”并非对立关系,高效的设计可以延伸到旗舰级的能力上限。2026年的大模型竞争已经从单纯的规模比拼转向“能力×效率”的综合竞争,而阶跃正是这一方向的长期践行者。

体系级选手的重新入场

真正让阶跃值得重新审视的,是它完成的一次体系级升级,三张核心牌几乎同时亮出。

第一张是前沿基座能力:Step 5 Preview的评测成绩和全球排名,重新确认了阶跃的旗舰模型研发能力。

第二张是全模态矩阵布局:在Step 5 Preview发布前几天,阶跃推出了全新的语音模型系列,其中实时语音模型拿下多项全球第一,加上此前发布的端侧模型、界面操作模型、图像编辑模型,阶跃的全栈布局已经十分完整。

第三张是终端量产落地能力,这也是阶跃最独特且容易被低估的优势。其模型手机装机量超过4200万台,日均服务近2000万人次,覆盖超过一半的头部中国手机品牌。在汽车端,和头部车企的合作已经深入整车智能体层面,搭载自研系统的大模型原生手机也通过了最高级别测试,斩获行业重磅奖项。

庞大的装机量和高频次调用,让阶跃的模型在真实噪声、复杂环境、低算力、低延迟、高并发的场景中持续接受检验,形成了纯API模型公司难以拥有的数据飞轮,真实世界的反馈可以反向驱动模型迭代。而“AI+终端”的差异化路线,正是阶跃的核心竞争力所在。

拉长时间来看,全球大模型竞争仍在高速演进。一年前,很少有人相信中国开源模型能进入全球前五,但已经有厂商做到了;半年前,很多人认为中国模型在全球平台上的调用量超过美国是天方夜谭,但赛道格局已经被彻底改写。

Step 5 Preview的发布,正是这种高速演进的又一个注脚。它让市场重新认识到:大模型竞争已是一场涵盖基础模型能力、全模态体系、终端落地、商业闭环的系统性竞赛。Step 5 Preview不只是刷新了一项评测成绩,更把阶跃推入了生产级智能体模型的核心竞争区间,在效率优先的赛道上,阶跃已经走得足够远、足够深,让这条路线本身成为了独特的竞争优势。

以上内容不代表本平台立场,仅供读者参考