阶跃Step 5 Preview旗舰模型10月15日开源 全球开源前三

10月15日,一款全新的旗舰基座模型正式开源并全量开放,这款模型专为真实世界的智能体任务打造,旨在打破AI能力、成本与效率之间的固有平衡边界,推动AI模型的帕累托前沿进一步拓展。
帕累托前沿描述的是多目标间的最佳平衡状态:想要优化其中一个维度,往往需要牺牲其他维度。对AI模型而言,能力、效率与成本之间同样存在这类取舍,而这款新模型的核心目标,就是通过全新的架构设计,将这条平衡边界向外推进。
这款模型采用稀疏混合专家架构,总参数量达600B,激活参数仅为27B,支持100万Token的超长上下文窗口,原生兼容文本与视觉双输入,在AI编程、软件工程、专业知识工作、金融等多个核心场景都展现出出色的综合表现。
在全球权威的行业评测指数中,该模型拿下44分,跻身全球开源模型前三梯队。同时,其单任务成本仅为另一款主流高端模型的八分之一,意味着在相同的资源投入下,这款模型能够实现更强的智能表现,让AI能力以更低的成本落地到实际工作中。
在公开与内部的基准测试中,这款模型在复杂软件工程任务、长程规划工作、专业知识处理和金融领域都展现出均衡的综合实力。在Agents' Last Exam的CLI子集ALE-CLI、金融投资研究评测FrontierFinance,以及跨领域深度研究评测DRACO上,它的表现仅次于GPT-6 Astra或Claude Opus 5,领先其他所有参评的开源模型。本次评测数据采用截至2026年9月19日公布的最新GDPval-AA v2结果,DeepSWE v1.1评测使用SWE-agentharness工具,参数设置为temperature=1.0和top_p=0.95。
全场景覆盖的能力表现
这款模型的设计重点覆盖需要长上下文、多轮工具调用和持续执行的真实工作场景,相比单次问答,更注重模型在长任务链中持续理解上下文、调用工具并最终完成任务交付的能力。
编码与开发:覆盖全流程的开发能力
研发团队构建了StepCodeBench评测集,覆盖超过550个独立代码仓库、9类任务、20个应用领域和33种编程语言,评测设计参考了产业真实需求与专家工作轨迹。在该评测中,这款模型在整体任务成功率和跨场景稳定性上表现突出,能够覆盖从Bug修复、功能开发到代码重构、环境配置等全流程的真实开发任务。
在实际的硬件开发任务中,这款模型可以根据自然语言需求,自主阅读设备文档与API说明,将ESP32-S3开发板改造成支持蓝牙按键与语音输入的Vibe Coding键盘。开发过程中,模型不仅编写代码,还能访问串口、调用摄像头、获取设备截图、模拟鼠标操作,并根据设备返回的状态与报错持续修改、运行和调试代码,连续执行超过3小时。
长周期任务:持续迭代的优化能力
长周期任务要求模型能够持续追踪执行结果、利用运行反馈并自主判断下一步行动方向,研发团队选择了两个可量化的场景进行验证。
第一个场景是GPU Kernel优化:团队为模型提供24小时时间,让其在单张NVIDIA H100 GPU上从零开始优化一个MLA GPU内核,任务配置为头维度512、批量大小1、64个注意力头和8192个Token。从初始描述出发,模型自主实现修改、运行内核并测量吞吐量,当候选方案无法达到预期性能时自动放弃并回到最优版本继续优化。最终,模型在约22小时内将峰值性能提升至508 TFLOPS,超越了竞品的493 TFLOPS。
第二个场景是后训练数据流程优化:团队要求模型在24小时内通过自动化后训练提升基础模型在AIME24上的表现。模型可以调用接入生产数据的标注工具,自主决定如何使用标注资源、调整后训练数据,并根据下游效果持续迭代。最终,基础模型在AIME24官方测试集上的准确率从53.3%提升至60%,这一成绩与竞品持平,但消耗的标注Token更少。
前端与交互设计:从想法到落地的全链路支持
这款模型不仅能够编写前端代码,还能直接参与视觉内容的生成与迭代。它可以完成网页界面搭建与数据可视化,也能调用专业工具创建并反复调整3D资产,再将这些资产集成到Three.js的交互式Web应用与游戏中。
举例来说,模型可以从1922年的《广九铁路旅行指南》中提取信息,构建行程查询、费用计算与路线回放功能,让小火车沿百年前的线路运行,将历史史料转化为可交互的数字化产品。
金融场景:综合能力的真实检验场
金融场景是检验模型综合能力的典型赛道,它连接宏观经济、政策监管、行业周期与公司经营,任何一个环节的变化都可能影响市场预期与资产价格。对模型而言,这不仅要求掌握财报分析、估值、投资研究等专业知识,还需要具备跨行业理解、证据核验与复杂问题拆解的能力。
研发团队将金融作为这款模型的重点验证场景,主要考察三类核心能力:扎实的金融专业知识储备、跨行业因果关联的建立能力,以及在信息不完整、数据口径不一致的情况下借助工具完成严谨分析与建模的能力。围绕公司研究这一典型高难度金融工作流,团队构建了三项内部评测:实时信息检索、企业估值与深度研究。
此外,团队还使用外部基准测试FrontierFinance对模型进行评估,该测试通过220道专家设计的问题与11543项评估标准,覆盖六大投资应用场景,其详细的评分规则从另一个维度补充评估了模型处理复杂金融问题的能力。在全部四项基准测试中,这款模型都取得了优异的成绩,展现出在信息检索、企业估值和金融研究等任务上的强劲实力。
研发理念:从算力驱动到效率驱动的演进
过去,大模型的扩展逻辑核心是用更多的计算资源换取更强的智能表现。但随着模型规模与任务复杂度的持续增长,计算成本也同步放大,大模型研发的核心关注点逐渐转向:如何更高效地将计算资源转化为模型能力。
从早期的迭代版本到本次推出的全新模型,研发团队一直在探索这个核心问题。团队认为,下一阶段的大模型扩展,不仅需要更多的计算资源,更需要高效的计算资源利用方式。
这款模型的完整权重将于10月15日正式释放,相关官方技术文档与接入渠道将同步开放,欢迎相关从业者与爱好者持续关注。

