阶跃Step5 Preview旗舰模型上线AGI Bar 600B总参全球开源前三

近期推出的全新旗舰大模型已率先在AGI Bar平台上线,这款模型总参规模达600B,激活参数仅27B,兼顾了强大性能与合理的部署成本。
该模型名为Step 5 Preview,由国内团队正式发布,将于2026年10月15日正式开源。在核心配置上,这款模型支持1Mtoken的超长上下文,原生兼容文本与视觉双输入模式。定价方面也十分清晰:每百万输入token收费7元,输出token收费20元,缓存token则为0.35元每百万。
目前模型已经接入AGI Bar平台,未来一周内所有用户都可以免费体验;仅需连接店内无线网络,配置好对应的Base URL与API Key即可直接调用。
在第三方权威评测中,Step 5 Preview拿下了44分的成绩,跻身全球开源大模型前三梯队。
模型核心定位
这款模型的核心定位面向软件工程研发、专业深度研究以及复杂业务工作流场景,重点强化了超长上下文处理、多轮工具调用以及长程智能体执行能力。
研发团队还专门打造了StepCodeBench评测基准,覆盖553个独立代码仓库、9大类开发任务、20个应用领域以及33种编程语言,评测场景涵盖功能修改、Bug修复、代码重构、文档生成、性能调优、代码生成、CI/CD运维、代码转换与环境配置等全流程开发环节。Step 5 Preview在该基准测试中的avg@4得分达到49.0%,在功能修改、Bug修复与代码重构任务上表现尤为突出,低、中等难度任务的完成效果接近Claude Opus 5。
此外,Step 5 Preview还针对金融领域做了针对性优化,覆盖四大核心金融场景:
- LiveSearch:能够精准检索并核验实时可靠的金融信息
- CorporateValuation:可将金融数据与业务假设转化为可复现的财务预测与企业估值报告
- DeepResearch:支持完整的证据搜集、分析与研究报告撰写,确保所有来源、假设与计算过程均可追溯
- FrontierFinance:覆盖6类投资场景、220道专家定制问题与11543项评估标准,全面验证金融领域的专业能力
官方实战案例
官方公开的多个实战案例展示了Step 5 Preview的强大能力,它可以调用Blender创建和调整3D资产,并快速将成果接入Three.js应用或游戏场景:
- Room Planner:仅需输入一张卧室照片,即可生成可实时编辑的3D空间,支持家具移动、旋转与摆放反馈,完成后还可切换第一人称视角查看完整布局。
- 3D Flappy Bird:将经典的Flappy Bird游戏升级为浏览器端的3D版本,包含立体障碍、动态环境、实时操控与完整的游戏循环。
- Dream Racing:玩家可以驾驶线条构成的赛车在不断变化的场景中疾驰,速度、视觉效果与背景音乐会随进程同步变化。
- Toy Universe:将两个风格迥异的3D世界整合到同一个交互空间,支持动画交互探索与实时语音对话功能。
- 穿越时光的铁路:以1922年的旅行指南为基础,重建九广铁路的交互式历史图册,包含完整路线、车站信息、行程规划与票价计算功能。
- 清明上河图:使用
p5.js的线条与图形逐笔构建传世名画场景,通过绘制动画逐步还原画面全貌。 - 动态象棋:打造可游玩的3D中国象棋,支持传统象棋规则、立体棋盘、棋子动画与全流程视听反馈。
长程任务实战
在未针对宝可梦系列做专项优化的情况下,Step 5 Preview自主完成了《Pokémon Red》的游戏推进,回放面板完整记录了3093回合的游戏过程、累计6288358个任务Token消耗与3枚道馆徽章的获取进度。模型成功解锁「居合斩」技能,并在第3082步击败枯叶道馆馆主马志士,主线剧情进度约为三分之一。回放系统支持按回合查看游戏画面、模型输出与工具执行结果,还可以通过里程碑快速跳转并查看累计Token消耗情况。
在获得开发文档与用户授权后,Step 5 Preview可以调用相机、COM端口、截图工具与模拟鼠标输入,完成设备端的开发调试工作。在一次实战案例中,模型连续运行超过3小时,根据设备实时反馈编写、运行并修改代码,最终成功实现对可编程键盘的控制。
研发团队还开展了一项GPU Kernel优化实验:为模型提供24小时运行时间与一张NVIDIA H100显卡,从零开始优化MLA GPU Kernel,任务配置为Head Dimension 512、Batch Size 1、64 Heads、8192 Tokens。模型自主实现并运行Kernel,根据吞吐测试结果持续迭代优化,仅保留性能提升的版本,从当前最优结果继续后续搜索。每组实验独立运行4次并取最佳结果,最终Step 5 Preview在约22小时后实现前向与反向合计508 TFLOPS的吞吐性能,对比之下Claude Opus 5为493 TFLOPS,Kimi K3为307 TFLOPS,GLM-5.3为286 TFLOPS。
另一项后训练优化实验同样设定了24小时的运行窗口,目标是提升Qwen3-30B-A3B基础模型在AIME24竞赛上的表现。Step 5 Preview可以调用接入生产数据的API annotator,自主选择标注方式与数据调整方案,并根据训练后的测试效果持续迭代优化。最终,模型在AIME24官方测试集上的准确率从53.3%提升至60%,与Claude Opus 5的最终成绩持平,但消耗的annotator Token数量更少。
技术团队核心思考
研发团队针对这款模型的设计与训练过程,分享了四个核心技术方向:
如何让模型思考的更深
复杂智能体任务中普遍存在大量多跳依赖关系:后续的决策判断需要依赖前置信息与工具执行结果,而频繁调用工具会带来越来越长的Prefill过程。为此Step 5 Preview采用了“Narrow but Deep”的设计思路,使用92层Transformer结构,为长Prefill场景中的隐式多跳推理提供更长的信息传播路径。更深的网络结构会大幅提升训练难度,团队专门针对数值爆炸、梯度尖峰等稳定性问题做了专项优化。
如何让稀疏真正产生效率
面对1Mtoken的超长上下文,Step 5 Preview引入了Sparse GQA技术,通过稀疏索引选择相关历史信息参与注意力计算。但减少注意力计算量并不等同于提升运行速度,Indexer开销、数据读取效率与GPU利用率都会影响实际收益。因此模型进一步通过Block-wise Token Merging技术,将Indexer与Top-k Selection的成本降低至原来的1/8,同时合并相邻Token高度重叠的Top-k结果,改善碎片化计算导致的GPU利用率问题。
走向自进化:模型参与自身迭代
数据生产环节已经开始让Step 5 Preview参与自身的迭代优化。随着长程智能体能力的增强,研发中的模型已经能够承担部分数据构建工作,但直接将智能体放入数据生产流程,会遇到任务被简化、反复收敛到熟悉模式以及利用评测漏洞等问题。
为此团队采用了统一上下文沉淀领域先验与历史反馈,将领域知识组织为可遍历的结构,帮助智能体发现长尾任务盲区;同时通过显式信号调节任务难度与多样性,并将Anti-hacking审计机制嵌入整个流程。人类专家负责核心原则与关键判断,确定性操作交由可复用工具完成,智能体则负责流程编排与跨步骤决策。这套体系已经参与构建了百万级、可验证的高难任务数据集,覆盖科学推理、软件工程、机器学习研发与专业工作流等领域;构建过程中留下的轨迹与反馈,还会继续用于训练下一代模型的数据生产能力。
如何让长程Agent真正可训练
长程智能体的强化学习首先需要解决训练与推理的一致性问题。微小的数值差异可能在MoE路由中产生不同的计算分支,并随着网络深度的增加不断累积放大。团队在严格on-policy条件下,通过确定性算子、训练与推理算子逐一对齐以及优化后的树状归约技术,让计算结果不受张量并行度影响,实现了bit-wise级别的对齐,端到端额外开销低于10%。在异步训练场景中,训练侧复用推理时的计算状态,将逐步长程训练的logprob偏差控制在1e-2以内。

