MiniMax M3.1-Flash-Preview上线代码平台,开发者需要知道的一切

MiniMax M3.1-Flash-Preview 上线代码平台 MiniMax Code,主打日常开发场景的极速编码。模型支持 1M 超长上下文,提供 low 到 max 五档推理强度,实测输出速度达 116 token/s。目前仅通过Token Plan和MiniMax Code提供,API暂未开放。

一、上线速览:不声不响,模型已经进了选择器
2026 年 9 月 27 日,MiniMax 在自家编程智能体产品 MiniMax Code 中悄然上线了最新文本模型 M3.1-Flash-Preview。说“悄然”并不夸张——这个模型最初出现在产品界面的模型选择器里,和 MiniMax-M3、M2.7、M2.7-highspeed 并列,默认推理档直接挂在最高级别的 max 上。
没有模型卡,没有跑分报告,没有公开的 API 定价。官方在开放平台文档中给它的全部描述只有一句话:原生多模态、1M 上下文的 Frontier Coding 模型,思考深度可调。这种发布方式与此前几个月的大模型发布惯例形成了鲜明对比。
更有意思的是发布节奏。在 M3.1-Flash-Preview 正式上线前约四天,OpenRouter 上出现了一个名为 Space Bunny Alpha 的匿名免费模型,上下文同样达到 100 万 token,支持文本、图像、视频输入与结构化 JSON 输出。开发者社区迅速通过分词器比对和报错行为测试进行了指纹鉴定,对 MiniMax 已知模型家族达到了 24/24 全匹配。MiniMax 始终没有确认,但这种“匿名免费跑真实流量,几天后同系模型转正”的模式,等于把灰度测试做成了发布流程。
这种发布策略传递了一个清晰的信号:M3.1-Flash-Preview 不是一个需要靠跑分来说服市场的通用模型,而是一个在真实编码场景中被反复验证过的、面向特定工作流的效率工具。它不需要向所有人证明自己能做什么,只需要在开发者日常写代码的时候证明自己好用。
二、技术底子:旗舰底座上的轻量化改造
2.1 MSA 稀疏注意力架构
M3.1-Flash-Preview 的技术底座来自今年 6 月发布的 MiniMax M3。M3 采用的是 MiniMax 自研的 MSA 稀疏注意力架构,最高支持 1M token 上下文。
MSA 的核心设计思路是避免全注意力机制计算复杂度平方级增长的“先天缺陷”。稀疏注意力机制普遍通过增加一个初筛阶段来规避复杂度爆炸问题,而 MSA 相比 DSA 和 MoBA 等方案,能更精确地为 KV 分块,实现更高的有效上下文覆盖。在算子层面,MSA 采用以 KV 块为外层来聚合命中 query 的 KV outer gather Q,每块只读一次、访存连续。在 1M 上下文下,M3 每 token 计算量仅为上代模型的 1/20,prefilling 阶段加速超过 9 倍,decoding 阶段加速超过 15 倍。
M3.1-Flash 沿用这套自研稀疏注意力架构,定位偏向试探性产品,核心目标是压缩推理成本。
2.2 泄露文档揭示的架构变化
一份在合作伙伴仓库中流传的架构文档(MiniMax 未公开确认其准确性)描述了 M3.1 相对 M3 的几处关键变化。M3 在前三层使用的全注意力锚点层被替换为 MiniMax 稀疏注意力层,每个 token 只关注上下文的选定子集,减少长序列上的计算量。Q8KV4 精度方面,Query 使用 FP8,Key 和 Value 使用 4-bit E2M1 的 16 块分组,KV 缓存所需内存约为 M3 8-bit 路径的一半。路由专家权重和激活采用 4-bit 精度的 W4A4 NVFP4 方案,FC1 和 FC2 使用独立的缩放方案,共享专家保留更高精度。推测解码方面,DSpark 投机解码头取代了 M3 的 EAGLE 风格多头预测头。
这些架构调整的核心逻辑可以用一句话概括:在保持 Agent 核心能力的前提下,大幅压缩推理成本、提升响应速度。
2.3 参数规模的继承
M3.1-Flash-Preview 的完整参数规模官方尚未公布。参考其底座 M3 的规格——4280 亿总参数的 MoE 架构,每 token 激活约 230 亿参数,原生支持图像和视频输入。Flash 版本很可能在同一量级上做了效率侧的精简。
三、核心特性:五档推理到底怎么用
3.1 推理强度从“开关”变成“旋钮”
M3.1-Flash-Preview 最具辨识度的产品化创新,是将推理强度做成了五档可调的旋钮。在 MiniMax Code 平台中,开发者可以在 low、medium、high、xhigh、max 五个档位之间自由切换,界面默认推荐 M3.1-Flash-Preview 搭配 max 档位。
上一代 M3 只有一个二元的“思考开关”,要么开要么关。五档设计的价值在于,它让开发者能够根据任务的实际复杂度来调配延迟与计算资源。低档位适合快速修改和常规工具调用,高档位则有助于规划、调试和仓库级别的变更。
需要特别注意的是,在 M3.1-Flash-Preview 上,thinking 是强制启用的,reasoning_split 无法关闭。如果尝试发出不启用思考的请求,会返回 HTTP 400 错误,提示需要自适应思考。这意味着 M3.1-Flash-Preview 从设计上就不接受“不思考”的运行模式,五档推理是在“思考”这个前提下的精细调控。
3.2 五档推理强度横向对比
| 推理档位 | 适用场景 | 延迟水平 | 计算消耗 | 推荐任务类型 |
|---|---|---|---|---|
| low | 快速编辑与轻量工具调用 | 最低 | 最低 | 代码格式化、简单修改、注释生成 |
| medium | 常规开发任务 | 较低 | 较低 | 日常 Bug 修复、函数级代码生成 |
| high | 需要一定推理深度的任务 | 中等 | 中等 | 功能开发、代码审查、测试编写 |
| xhigh | 复杂逻辑与多步骤任务 | 较高 | 较高 | 重构、边界情况处理、依赖分析 |
| max(默认) | 仓库级变更与深度调试 | 最高 | 最高 | 全功能开发、跨文件重构、回归测试 |
各档位的具体计算预算、延迟画像和质量差异,MiniMax 尚未发布官方文档,开发团队需要根据自身任务类型进行实测。
3.3 开发闭环的完整覆盖
根据官方描述,M3.1-Flash-Preview 在代码开发中覆盖了从问题定位、代码实现、测试验证到成果交付的完整链条。具体而言,它能深入理解需求,细致处理边界情况,自动补齐回归测试,并验证代码改动对现有功能的影响。
从实际反馈来看,有开发者在公测期间拿它跑了几个小脚本和 Bug 修复,评价是“速度确实是 Flash 那一挂的,响应很跟手”,但对于更复杂任务的稳定性,还需要更多验证。
四、实测数据:速度与能力的真实表现
4.1 输出速度
第三方实测显示,M3.1-Flash-Preview 的输出速度达到 116 token/s。作为参照,上一代 M3 的官方公布速度约为 100+ token/s。虽然 M3.1-Flash-Preview 的官方速度数据尚未公布,但从实际体验来看,Flash 系列的“快”是实打实的。
4.2 代码生成实测
在经典的“鹈鹕骑自行车”SVG 动效测试中,M3.1-Flash-Preview 一次性直接生成了可运行的纯 HTML/SVG 动画代码,坐标系和动画逻辑全程没有崩溃。虽然视觉细节还存在一定偏差,但作为 Flash 级模型,能一次性输出自洽且可运行的完整代码,已经展现了相当的生产力水平。
4.3 与底座 M3 的能力锚定
M3.1-Flash-Preview 没有独立的公开跑分数据,MiniMax 也没有公布任何评测表。要评估它的能力下限,可以参考底座 M3 的成绩:SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0%、MCP Atlas 74.2%。M3 在 SWE-bench Verified 上拿到 80.5%,API 定价为每百万 token 输入 0.30 美元、输出 1.20 美元,约为 Claude Sonnet 5 输入价格的六分之一、输出价格的八分之一。
M3.1-Flash-Preview 作为 Flash 版本,在参数效率上做了进一步压缩,能力上可能与 M3 存在一定差距。但考虑到它面向的是日常开发场景而非极限推理任务,这种取舍是合理的。
五、与同代模型横向对比
5.1 模型规格对比
| 对比维度 | MiniMax M3.1-Flash-Preview | MiniMax M3 | DeepSeek V4 Flash | Claude Sonnet 5 |
|---|---|---|---|---|
| 上下文窗口 | 1M token | 1M token | 约 1.05M token | 未公开 1M |
| 推理控制 | 五档可调(low-max) | 二值开关 | 未明确 | 未明确 |
| 访问方式 | Token Plan + MiniMax Code | 按量付费 + Token Plan | 按量付费 | 按量付费 |
| 输入价格(每百万 token) | 未公布 | $0.30 | 未公布 | $2.00 |
| 输出价格(每百万 token) | 未公布 | $1.20 | 未公布 | $10.00 |
| 开放权重 | 未公布 | 是 | 未明确 | 否 |
| 多模态输入 | 文本/图像/视频 | 文本/图像/视频 | 文本 | 文本/图像 |
数据来源:
5.2 定价策略的差异化
M3.1-Flash-Preview 目前没有按 token 计价的费率,成本就是 Token Plan 的席位费用。Token Plan 分三档:Plus 每月 49 元,Max 每月 119 元,Ultra 每月 469 元。额度按 5 小时固定窗口加周窗口两层控制,三档分别对应 3-4 个、4-5 个、6-7 个 Agent 的用量。
这种“不挂价”的策略本身就是一个信号。当 Anthropic 在 9 月 22 日把 Opus 5.5 降价 20%、OpenAI 在 90 分钟后跟进发布 GPT-6 Sol 并把价格砍半的时候,MiniMax 选择了让比稿对象找不到该跟多少。前作 M2.7 一代就已经比 Sonnet 便宜约十倍——与其在价格战中被对标,不如把定价权收回到订阅体系里。
六、开发者实际体验与反馈
6.1 上手门槛与访问限制
目前想用 M3.1-Flash-Preview,只有两条路:购买 Token Plan 订阅,或者安装 MiniMax Code 客户端。手上已有的按量计费 API Key 暂时调不动这个模型,订阅 Key 和按量计费 Key 不能互换。
有开发者反馈,API 端点请求是通的、返回 200,但拿不到正常结果,估计还没有真正放开。还有用户尝试通过第三方渠道调用时遇到了 invalid params, unknown model 'minimax-m3.1' 的错误。这说明模型的 API 层尚未完成面向第三方平台的适配。
6.2 早期用户评价
从已有的开发者反馈来看,评价呈现两极分化。正面反馈集中在速度上——“响应很跟手”“Flash 那一挂的”;也有用户表示“没感觉和 m3 有啥变化,然后也不知道价格”。在长时间的基准测试中,有第三方报告称表现稳定,交互体验可以直接对标 Grok Bot。
这些评价反映出 M3.1-Flash-Preview 目前的定位困境:它在速度上的提升是明确可感的,但在能力层面的差异化,由于缺乏公开的跑分数据和足够的使用样本,开发者还难以形成清晰的判断。
6.3 Agent 工作流的新体验
M3.1-Flash-Preview 在 MiniMax Code 中支持多子代理并行——能把复杂大任务自动拆解,多个单元同时执行,界面清晰可见。Agent 在后台跑长流程时,开发者可以随时发消息进行干预,不会打断正在执行的任务。计算全部在云端完成,不占本地内存。
这种工作流设计的意义在于,它把 AI 编码从一个“问答式”的交互模式,推向了“项目管理式”的协作模式。开发者不再需要一步步指令模型做每一件事,而是可以像管理一个开发团队一样,给多个子代理分配任务,自己扮演架构师和审查者的角色。
七、Flash 与 Pro 双线战略的行业含义
M3.1-Flash-Preview 的上线不仅是单一产品的迭代,更标志着 MiniMax 正式开启了 Flash / Pro 双线产品路线。Flash 系列主打极速响应与高频日常交付,Pro 系列未来将主打深度重型推理与极复杂任务。
这个分流思路契合了当下开发场景的真实分布。日常 80% 的业务需求和 Bug 修复,根本不需要昂贵又缓慢的重型推理。一个快、准、稳的 Flash 模型,反而比一个全能但迟缓的旗舰模型更适合嵌入到开发者的日常工作流中。
更深一层看,这种产品线拆分反映的是整个 AI 编码工具行业的一个趋势转变:从“谁的模型更聪明”转向“谁的模型更匹配场景”。当 SWE-bench Verified 上的顶尖分数已经高度集中在 70%-76% 区间、榜单本身因为饱和而开始被归档时,单纯的能力提升已经很难构成差异化的竞争优势。真正的竞争力正在从模型能力本身,转移到模型与工作流的匹配度、推理成本的控制力,以及开发者体验的打磨程度上。
八、FAQ:开发者最关心的问题
M3.1-Flash-Preview 和 M3 的核心区别是什么?
最直观的区别有三个:推理控制从二值开关变成了五档可调,thinking 变为强制启用,以及访问方式从按量付费加 Token Plan 收窄到仅 Token Plan 加 MiniMax Code。M3 支持开放权重下载,M3.1-Flash-Preview 目前没有任何权重发布。
现在怎么才能用上这个模型?
两条路径:一是通过 MiniMax Code 客户端或网页端,购买 Token Plan 订阅后直接使用;二是等待 MiniMax 后续开放 API 端点。当前 API Key 无法调用该模型。
五档推理强度在实际使用中怎么选?
日常的代码格式化、注释生成和小型修改用 low 或 medium;Bug 修复和函数级开发用 medium 或 high;涉及跨文件重构、仓库级变更和深度调试时用 xhigh 或 max。官方建议默认使用 max 档位,但这会带来最高的延迟和计算消耗。
这个模型支持哪些编程语言?
官方描述为“Frontier Coding 模型”,没有限定编程语言范围。底座 M3 在前后端、性能优化等场景中均有覆盖。具体语言支持情况建议根据实际使用场景验证。
Token Plan 的额度是怎么计算的?
按 5 小时固定窗口和周窗口两层控制。Plus 档(49 元/月)对应 3-4 个 Agent 用量,Max 档(119 元/月)对应 4-5 个,Ultra 档(469 元/月)对应 6-7 个。未花完的订阅额度不结转到下一个计费周期。
M3.1-Flash-Preview 有没有公开的跑分数据?
没有。MiniMax 在发布时没有公布任何评测表,第三方也没有将其纳入 Artificial Analysis 等指数。唯一可参考的基准来自底座 M3 的成绩。
未来会开放 API 和开放权重吗?
官方文档的措辞是“暂时仅通过 Token Plan 和 MiniMax Code 提供”,没有给出开放时间表。M3.1 正式版据称正在内测中。

