Kimi K3登陆AWS Bedrock:2.8万亿开源巨兽进驻亚马逊云

2026年9月18日,亚马逊云科技宣布Kimi K3正式登陆Amazon Bedrock,全球企业开发者可直接调用这款2.8万亿参数的开源旗舰模型。Kimi K3登陆AWS Bedrock标志着中国大模型首次以收入分成模式进入全球头部云平台,百万Token上下文与原生视觉能力将在AWS安全边界内为企业提供全新的长程编程与知识工作选择。

一、Kimi K3登陆AWS Bedrock,到底意味着什么?
Kimi K3登陆AWS Bedrock这件事的分量,得放在当下大模型竞争格局里看才清楚。
过去一年,开放权重模型在能力上快速追赶闭源模型,但企业要真正把一款开源模型用起来,面临的工程门槛并不低。以Kimi K3为例,2.8万亿参数的体量意味着至少需要64卡集群才能实现高效推理。对于绝大多数企业来说,自建基础设施部署这个级别的模型并不现实。大型云服务商仍然是AI模型进入企业市场的主渠道。
Amazon Bedrock恰好扮演了这个角色。它是AWS面向企业的生成式AI模型服务平台,Anthropic和OpenAI的重要云渠道都通过它向企业客户分发模型能力。Kimi K3登陆AWS Bedrock之后,企业开发者不用自己搭建推理集群,直接在AWS控制台或通过API就能调用这款模型。
但这不只是一次简单的“上架”。Kimi K3登陆AWS Bedrock背后,是月之暗面与AWS之间一套单独商业条款的落地。双方协议的具体分成比例尚未公开,但据此前报道,月之暗面在与微软、亚马逊、谷歌的谈判中,提出了最高30%的收入分成要求。AWS是三大云厂商中最先谈成并上线K3的一家。
从行业视角看,Kimi K3登陆AWS Bedrock还有一个容易被忽略的信号:开源模型的商业逻辑正在被重新定义。过去,模型厂商的路径是“卖API、按Token计费”;现在,月之暗面选择把模型授权给云平台,由云平台负责托管和计费,自己按调用量分成。快思慢想研究院院长田丰对此的评价是,这本质上把大模型的商业逻辑从“卖算力”改成了更接近应用商店的分成逻辑。
需要注意的是,Kimi K3登陆AWS Bedrock目前仅在US Geo和Global跨区域推理端点可用,暂未覆盖AWS所有区域。企业在规划部署方案时,需要先确认自身业务所在区域是否在支持范围内。
二、2.8万亿参数的开源模型,技术底子有多硬?
Kimi K3登陆AWS Bedrock之前,这款模型已经在开源社区和评测榜单上刷了一轮存在感。2026年7月16日发布时,它以2.8万亿参数成为全球参数规模最大的开源模型。但参数规模只是表面数字,真正决定K3能力上限的,是它在底层架构上做的几项关键创新。
2.1 KDA混合线性注意力:让百万Token上下文真正可用
传统Transformer的注意力机制在序列长度增长时,计算复杂度呈平方级上升。这也是为什么很多模型标称支持长上下文,但实际使用中一旦输入超过几十万Token,推理速度和成本就急剧恶化。
Kimi K3采用了一项名为KDA(Kimi Delta Attention)的混合线性注意力机制,配合注意力残差技术,在保持注意力精度的同时大幅降低了长序列的计算开销。月之暗面企业业务负责人黄震昕用了一个通俗的比喻来解释这项创新:传统大模型一味堆砌算力早已遇到瓶颈,团队自研的线性注意力等底层技术,能让同等训练数据发挥翻倍效果,同时实现百万Token超长上下文记忆,解决了大模型长文本易遗忘的痛点。
反映在实际指标上,K3相比上一代K2的整体扩展效率提升了约2.5倍。这意味着同样的算力投入,K3能产出更多的有效能力。
2.2 MoE稀疏架构:896选16的激活策略
K3基于Mixture-of-Experts架构,在896个专家中每次只激活16个。这种高度稀疏的设计让模型在保持巨大参数总量的同时,单次推理的实际计算量远小于参数规模所暗示的水平。
配合Stable LatentMoE框架,K3在专家路由的稳定性上做了额外优化。对于企业级应用来说,这意味着模型输出的可预测性更高,不会因为路由抖动导致同一类问题在不同调用中给出质量差异过大的回答。
2.3 1M Token上下文+原生视觉:不只是“能读长文”
1M Token的上下文窗口是K3的一个硬指标。但更值得关注的是K3对长上下文的使用方式。在软件工程场景中,K3能够读取大型代码库、结合源代码、渲染结果、运行日志和测试反馈判断下一步修改方向。在金融研究场景中,它可以对多个公司文件和行业数据进行组织分析,生成可读、可查、可验证的深度报告。
原生视觉能力的加入进一步扩展了使用场景。K3可以理解截图、图表和界面设计稿,这在游戏开发、前端工程和CAD工作流中尤其有价值。
三、在Bedrock上跑Kimi K3,工程上怎么落地?
Kimi K3登陆AWS Bedrock之后,企业开发者最关心的问题很实际:怎么调、要花多少钱、安全能不能保证。
3.1 调用方式:兼容OpenAI生态
K3在Bedrock上支持bedrock-runtime端点,同时兼容Converse API和OpenAI兼容的Chat Completions与Responses API。AWS官方推荐使用Chat Completions API来调用K3,这对已经使用OpenAI SDK的团队来说迁移成本很低。
模型ID为moonshotai.kimi-k3,支持US Geo和Global两种跨区域推理ID格式。程序化调用的基本流程是:配置AWS凭证 → 安装bedrock-token-generator → 通过OpenAI SDK设置base_url指向bedrock-runtime端点。
3.2 定价结构:三档服务层级
Kimi K3登陆AWS Bedrock后的定价如下:
| 推理选项 | 输入价格 | 输出价格 | 缓存读取 | 缓存写入 |
|---|---|---|---|---|
| Global标准 | $3.00/M | $15.00/M | $0.30/M | $3.75/M |
| US标准 | $3.30/M | $16.50/M | $0.33/M | $4.125/M |
(以上均为每百万Token的标准层价格)
K3在Bedrock上支持三档服务层级:标准层、Priority层(1.75倍标准价)和Flex层(0.5倍标准价)。对于延迟敏感的生产环境,Priority层提供优先调度;对于批量离线任务,Flex层可以显著降低成本。
值得特别关注的是,Kimi K3是Amazon Bedrock上首个支持显式提示缓存的开放权重模型。缓存命中时输入成本降至$0.30/M,相当于标准输入价的十分之一。对于需要反复引用同一份代码库或文档的场景,这项能力带来的成本优化非常可观。
3.3 安全边界:与闭源模型同一标准
企业使用开放权重模型时最关心的数据安全问题,AWS给出了明确承诺:K3与闭源专有模型处于相同的安全边界内,用户可以统一使用访问控制、加密和审计机制。数据在AWS数据边界内处理,不与模型提供方共享,不用于训练底层模型。推理请求默认启用零数据保留,零操作员访问机制确保即使是AWS运维人员也无法查看用户的提示和补全内容。
四、Kimi K3 vs 主流模型:横向对比
为了帮助企业更直观地判断K3在Bedrock生态中的位置,下面从能力维度、定价和适用场景三个角度做横向对比。
能力与定价综合对比:
| 对比维度 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| 参数规模 | 2.8万亿(开源) | 未公开(闭源) | 未公开(闭源) |
| 上下文窗口 | 1M Token | 取决于版本 | 取决于版本 |
| 输入价格 | $3.00/M | $10.00/M | 约$4.40/M |
| 输出价格 | $15.00/M | 视版本而定 | 约$22.00/M |
| 开源权重 | 是 | 否 | 否 |
| 原生视觉 | 是 | 是 | 是 |
(定价数据基于AWS Bedrock标准层,实际价格可能因区域和服务层级有所差异)
关键评测数据对比:
| 评测项目 | Kimi K3 | Claude Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|
| SQBench综合 | 60.5(第1) | 57.6 | 54.6 |
| 长文本推理 | 64(第1) | 48 | 20 |
| 动态代码逻辑 | 88 | 96 | 96 |
| 鲁棒性与边界 | 36 | — | 64 |
| 幻觉率 | 6.2% | — | — |
(SQBench数据来自沙丘社区2026年7月评测)
这组数据呈现出一个清晰的画像:K3在长文本推理上大幅领先,动态代码逻辑接近头部水平但仍有差距,而鲁棒性与边界的短板需要企业在部署时通过工程手段弥补。正如沙丘社区评测报告所总结的,K3擅长把一条很长、很复杂的路走完,但在路口判断“该不该继续走”时,还需要更清晰的护栏。
企业选型建议矩阵:
| 应用场景 | 推荐程度 | 理由 |
|---|---|---|
| 大型代码库分析 | 强烈推荐 | 1M上下文+终端操作+视觉反馈闭环 |
| 长文档研究报告 | 强烈推荐 | 长文本推理排名第一,支持多步工作流 |
| 前端/游戏开发 | 推荐 | 前端代码竞技榜登顶,视觉能力强 |
| 金融数据分析 | 推荐(需护栏) | 端到端能力强,但幻觉率需要口径校验 |
| 关键业务决策 | 谨慎使用 | 鲁棒性得分较低,不适合直接拍板 |
五、收入分成模式:开源模型商业逻辑的一次实验
Kimi K3登陆AWS Bedrock,表面上是模型上架,底层其实是一次商业模式的实验。理解了这套分成逻辑,才能判断它对企业的长期影响。
5.1 K3许可证里的关键条款
月之暗面在K3的许可证中设置了一条关键条款:如果一家企业经营模型即服务业务,且企业及其关联方在任意连续12个月内的合计收入超过2000万美元,在将K3用于商业目的前,必须与月之暗面另行签署协议。企业内部使用则豁免。
这个2000万美元的门槛设计得很巧妙。它既不影响中小开发者和创业团队自由使用K3,又把大型云平台纳入了需要单独谈判的商业框架。AWS的Bedrock业务显然远超这个门槛,且Bedrock做的正是典型的MaaS——托管模型、按Token计费、企业通过API调用。
5.2 对使用K3的企业意味着什么
对于使用Kimi K3登陆AWS Bedrock服务的企业来说,分成模式本身不会直接影响你的使用成本。AWS给出的标价与月之暗面官方API价格完全一致——全球标准档输入$3/M,输出$15/M。
但有一个趋势值得关注:当越来越多的中国开源模型(K3、GLM系列、DeepSeek等)通过分成模式进入海外云平台,云平台上的模型竞争会更加充分。这对企业选型来说是有利的——更多的选择意味着更合理的定价和更积极的性能优化。
另一个值得留意的信号是,月之暗面正在将K3的推理能力扩展到更多海外平台。目前K3已经进入Together AI、Fireworks、DigitalOcean、Modal等一批海外推理服务商,公开可见的Provider已超过10家。加上AWS Bedrock和阿里云百炼,K3的分发网络正在快速铺开。
六、哪些企业应该现在就评估Kimi K3登陆AWS Bedrock?
Kimi K3登陆AWS Bedrock之后,最直接的受益群体是已经在使用AWS基础设施的企业开发团队。如果你的团队满足以下条件中的任意两项,K3值得纳入选型评估:
条件一:工作负载涉及大型代码库的持续维护和重构。 K3的长程编程能力是目前开放权重模型中最强的,能够读取大型仓库、操作终端、持续修复、视觉检查、再次迭代。Terminal-Bench 2.1得分88.3%,接近GPT-5.6 Sol的88.8%。
条件二:业务需要处理大量长文档的分析和综合。 金融研究、法律文书分析、产业研究报告等场景中,K3的1M Token上下文窗口和长文本推理能力(SQBench长文本推理64分,比Claude Opus 4.8高16分,比GPT-5.6 Sol高44分)具有明显优势。
条件三:对数据主权和合规有严格要求。 K3在Bedrock上的安全边界与闭源模型一致,数据不出AWS边界、不用于模型训练、默认零数据保留。对于受监管行业的企业,这一点比模型性能本身更关键。
条件四:希望避免单一模型厂商锁定。 使用开源权重模型的一个隐性优势是,如果某个云平台的服务质量或定价发生变化,企业理论上可以迁移到其他托管K3的平台。虽然迁移并非零成本,但相比闭源模型“只能在这一家买”的处境,选择空间更大。
6.1 短期建议
如果你的团队已经在用Amazon Bedrock调用其他模型,K3的接入成本很低——模型ID和API格式已经标准化,可以通过Bedrock控制台的Playground先做小规模验证。建议从两个场景切入:一个是长文档摘要和知识提取,另一个是代码审查和重构建议。这两个场景对K3的核心优势(长上下文+代码理解)利用最充分,也最容易量化效果。
6.2 中期观察
关注两个信号。第一,微软Azure和Google Cloud是否也会接入K3。如果三大云平台都上架,K3的生态位会进一步稳固,企业在多平台之间的迁移灵活性也会增加。第二,AWS和月之暗面的分成协议是否会随着调用量增长而调整。如果K3在Bedrock上的实际使用量持续攀升,双方可能会在定价或服务层级上做出更多优化。
七、FAQ
Q1:Kimi K3登陆AWS Bedrock后,哪些区域的用户可以调用?
目前K3在Bedrock上支持US Geo和Global两种跨区域推理模式。Global推理端点面向更广泛的区域开放,US Geo端点则覆盖美国区域的合规需求。企业可以在AWS控制台确认自己所在区域的具体支持情况。
Q2:Kimi K3登陆AWS Bedrock的定价和月之暗面官方API价格一样吗?
全球标准档完全一致:输入$3/M Token,输出$15/M Token。美国区域略高,输入$3.3/M,输出$16.5/M。此外,Bedrock上的K3支持Priority和Flex服务层级,Flex层价格为标准的0.5倍,适合批量离线任务。
Q3:在Bedrock上使用Kimi K3,数据安全怎么保障?
AWS明确承诺K3与闭源模型处于相同安全边界。数据在AWS数据边界内处理,不与月之暗面共享,不用于训练。推理请求默认零数据保留,AWS运维人员也无法访问用户提示和补全内容。
Q4:Kimi K3和Claude Fable 5在Bedrock上怎么选?
两者定位不同。Claude Fable 5在动态代码逻辑和鲁棒性上更强(SQBench动态代码逻辑96分,K3为88分),适合对输出稳定性要求极高的生产环境。K3在长文本推理上大幅领先(64分 vs Claude Opus 4.8的48分),且定价更低(输入$3/M vs Fable 5的$10/M),适合长文档分析和大型代码库维护场景。
Q5:Kimi K3登陆AWS Bedrock之前,有没有其他方式在海外调用K3?
有的。K3此前已经可以通过Microsoft Foundry调用,但底层推理由Fireworks AI提供,Foundry主要负责模型接入和企业治理。K3也已进入Together AI、Fireworks、DigitalOcean、Modal等海外推理服务商。AWS Bedrock的不同之处在于,AWS自己就是K3的托管和推理服务提供方,企业获得的是一体化的云平台体验。
Q6:Kimi K3的幻觉率表现如何?企业使用时需要注意什么?
在沙丘社区SQBench评测中,K3的幻觉率为6.2%,可靠性88.1%,处于第一梯队。但K3的鲁棒性与边界得分仅为36分,明显落后GPT-5.6 Sol的64分。在财务、经营和风控分析等高精度场景中,建议保留指标口径确认、关键数字回算、来源可追溯三项治理手段。
Q7:Kimi K3登陆AWS Bedrock之后,月之暗面还会和微软、谷歌谈分成合作吗?
据此前报道,月之暗面同时与微软、亚马逊、谷歌三家推进收入分成合作,AWS是第一个谈成并上线K3的云厂商。微软和谷歌是否跟进,目前尚无公开信息。值得关注的是,K3的许可证条款对所有经营MaaS业务且年收入超过2000万美元的平台都有约束力,这为后续谈判设定了统一的框架。

