魔搭ModelScope发布Kimi K3:2.8T参数+1M上下文,多部署方案

近期,一家AI研发团队正式发布并开源了其迄今最强大的大模型——Kimi K3,这也是全球首个公开的3T级超大参数开源模型。该模型总参数量达到2.8万亿,基于Kimi Delta Attention(KDA)与Attention Residuals(AttnRes)架构构建,具备原生视觉能力与100万token的超长上下文窗口,专为长程编码、知识工作与推理等前沿智能场景设计。相比前代模型Kimi K2,新模型通过架构与训练配方的优化,实现了约2.5倍的规模化效率提升。官方测试显示,其整体表现仍略逊于当前最强的闭源模型,但在官方评测套件中已展现出前沿级性能,并持续超越多数同级别开源模型。
目前,该模型的相关资源已开放获取:
- 模型官方地址:开源模型平台专属链接
- 代码仓库:
- 技术博客:官方技术平台链接
三大核心智能能力
除了超大参数规模之外,Kimi K3的前沿智能主要体现在三大方向:
- 代码能力:支持在极少人工监督下完成长程编码任务,可以持续进行长时间工程会话、在庞大代码库中导航并调用终端工具。从GPU内核优化、从零构建类Triton编译器MiniTriton,到游戏开发、芯片设计与科研级数值复现,K3都能独立完成端到端的全流程交付。
- 通用Agent能力:面向端到端的知识工作场景,可以自主编排多轮搜索、数据抓取、信息拉取与并发子智能体任务,产出可交互的研究网站、咨询级产业报告与出版级可视化内容,并通过配套工具将结果沉淀为持久、可更新的视图。
- 视觉Agent能力:依托原生视觉与统一多模态架构,可以在同一模型内理解文本、图像与视频内容。它能在代码与实时截图之间迭代实现“视觉在环”,也能胜任动态设计、动画讲解与逐帧节拍同步的视频剪辑等高信息密度的视觉创作任务。
多场景落地实践
Kimi K3的前沿智能覆盖三大核心场景:端到端知识工作、原生多模态创作,以及长程编码与工程开发。
一、 知识工作:从研究到可复用的交互界面
在交互式可视化研究领域,Kimi K3可以在配套工具中完成多领域的专业产出:
- 可交互产业研究报告:比如一份回顾AI ASIC产业42年历程的交互式研究网站,经由120多轮递归式自我改进生成。模型通过2800多次网络搜索与数据抓取、1100多次终端数据拉取,覆盖1.1万多页内容,整合87份季度报告与99份原始PDF,将专业信息转化为可层层深入的定制图表、动画示意图与交互式视觉叙事。
- 聚变产业咨询报告:可以生成具备出版级质量的咨询风格产业报告,搭配时间线、漏斗图、区间条形图、甘特图等交互式可视化元素与专业幻灯片。
- 科学数据分析:比如针对GWTC-5引力波事件的分析,通过20多个并发子智能体处理391个引力波事件,产出7张科学可视化图、2张表格,并综合10多篇专业论文完成系统性文献综述。
此外,Kimi K3在制作信息图风格的演示内容上表现尤为出色,可以快速生成完全可编辑的热力图与年度报告等可视化作品。
二、 多模态创作:视频与游戏开发
得益于原生多模态架构,Kimi K3可以在同一模型内理解文本、图像与视频内容,在动态设计、动画与视频剪辑领域表现突出:
- 专业视频剪辑:可以快速制作风格化的动图讲解视频,比如将复杂技术理念转化为3Blue1Brown风格的动画示意图与转场效果;也可以从数十段源素材中剪辑出专业预告片,完成片段挑选、动作匹配剪辑、逐帧节拍同步、音频处理与多轮修改。这类高信息密度的短视频,通常仅需资深剪辑师1-2个工作日即可完成,新手也可以借助模型大幅缩短创作周期。
- 游戏开发与数字创作:结合强大的3D推理、编码与视觉能力,Kimi K3可以通过代码与实时截图的无缝迭代实现“视觉在环”开发。比如基于Three.js WebGPU与GPU计算,构建完全程序化生成的浏览器端3D开放世界探索游戏,包含森林、木屋村庄、雪山与动态天气系统。此外还可以完成赛博朋克网页摆荡、打字机交互、Gargantua等多款数字创作作品。
三、 长程编码与工程开发
Kimi K3具备极强的长程编码能力,可以在极少人工监督下完成长时间工程会话、在庞大代码库中导航并调用终端工具,同时擅长将软件工程与视觉推理结合,优化游戏开发、前端设计与CAD建模等工作:
- 内核优化:在统一沙箱环境中,模型可以独立运行最长24小时,完成四项任务的性能剖析、重写与基准测试,涵盖AttnRes、KDA以及512头维度的MLA内核,覆盖NVIDIA Hopper GPU与其他厂商的GPGPU设备。Kimi K3的表现与顶级闭源模型相当,显著优于其他同级别开源模型,在开发后期阶段,早期版本的K3已经承担了团队大部分的内核优化工作。
- GPU编译器开发:Kimi K3可以从零构建MiniTriton——一个紧凑的类Triton编译器,包含基于MLIR的tile级IR层、优化pass与PTX代码生成流水线。在roofline基准测试中,MiniTriton的性能与Triton、torch.compile相当甚至更优,部分工作负载表现超过Triton,还可以支撑端到端的nanoGPT训练稳定收敛,其从零构建的Tensor Core路径可以与经过大量优化的Triton技术栈媲美。
- 芯片设计:作为早期概念验证,Kimi K3在单次48小时的自主运行中,使用基于Nangate 45nm工艺库的开源EDA工具完成了芯片的构建、优化与验证。该芯片在4mm²的面积内于100MHz下实现时序收敛,仿真中持续保持超过8700 tokens/s的解码吞吐,集成146万个标准单元、0.277MB SRAM与带融合反量化的INT4 MAC阵列,是一款由模型设计、专为模型服务的专用芯片。
- 科研级编码:Kimi K3可以在科学文献与可执行代码之间搭建桥梁。比如为复现计算天体物理中的I–Love–Q普适关系,模型仅用约两小时就完成了资深研究者通常需要1-2周的工作量:查阅并交叉验证20多篇专业论文,实现完整的数值流水线,评估300多个状态方程,识别已发表公式中的不一致之处,生成3000多行Python代码,并产出可交互的HTML仪表盘。
核心技术架构
- 架构骨干:KDA + AttnRes:Kimi K3的基础架构由Kimi Delta Attention(KDA)与Attention Residuals(AttnRes)组成。KDA为注意力机制的规模化提供高效基础,AttnRes则在深度方向上有选择地检索特征表示而非均匀累加,两者共同支撑模型扩展到远超万亿参数的规模。
- Stable LatentMoE稀疏专家机制:Kimi K3从896个专家中有效激活16个,在高稀疏度下解决了路由与优化的挑战:通过分位数平衡直接从路由分数的分位数推导专家分配,消除了启发式更新与敏感的平衡超参数;Per-Head Muon通过对注意力头独立优化,实现规模化时的适应性学习;Sigmoid Tanh Unit(SiTU)与Gated MLA分别优化激活控制与注意力选择性,共同实现2.8T参数规模下稳定高效的训练。
- 量化感知训练与均衡并行:Kimi K3从SFT阶段就应用量化感知训练,采用MXFP4权重与MXFP8激活以获得广泛的硬件兼容性。为避免大规模专家并行训练时因专家不均衡拖累吞吐,团队引入了完全均衡的专家并行训练方法,具备静态形状且关键路径上无主机同步。官方建议在配备64个及以上加速器的超节点上部署Kimi K3以获得最优性能。
- KDA前缀缓存与推理:由于KDA对传统前缀缓存提出了新挑战,团队已经向相关社区贡献了对应的实现方案,并将随模型一并发布。带预填充缓存的KDA让Kimi K3可以在超大参数与长上下文的情况下,以具竞争力的token成本提供服务,更多技术细节将随官方技术报告公布。
本地部署与调用指南
Kimi K3是2.8T参数的MoE模型,采用MXFP4权重+MXFP8激活格式,完整权重约1.5TB,分为96个safetensors分片,支持最长1048576(1M)token的上下文长度。官方推荐在配备64个及以上加速器的超节点上部署以获得更优吞吐。推荐推理参数为:reasoning_effort="max"(可选low/high/max,默认max)、temperature=1.0;单步任务建议top_p=0.95,智能体任务建议top_p=1.0。
1. 模型下载
modelscope download --model moonshotai/Kimi-K3 --local_dir ./Kimi-K3
2. vLLM部署
首先安装依赖:
pip install -U vllm
启动服务(张量/流水线并行规模请参考官方配置指南):
vllm serve ./Kimi-K3 \ --served-model-name kimi-k3 \ --tensor-parallel-size 8 \ --max-model-len 1048576 \ --trust-remote-code
3. SGLang部署
首先安装依赖:
pip install "sglang[all]"
启动服务(详细配置请参考官方Cookbook):
python -m sglang.launch_server \ --model-path ./Kimi-K3 \ --tp 8 \ --context-length 1048576 \ --trust-remote-code
4. OpenAI兼容API调用
服务启动后可以使用标准OpenAI SDK进行访问,Kimi K3会返回思考内容reasoning_content,在多轮对话或工具调用时,需要将包含reasoning_content、tool_calls的完整assistant消息回传:
from openai import OpenAIclient = OpenAI(base_url=“http://localhost:8000/v1”, api_key=“EMPTY”)
resp = client.chat.completions.create(
model=“kimi-k3”,
messages=[{“role”: “user”, “content”: “用三句话介绍你自己”}],
temperature=1.0,
top_p=1.0, # 单步任务建议设置为0.95
max_tokens=4096,
extra_body={“reasoning_effort”: “max”} # 可选low/high/max,默认max
)
print(resp.choices[0].message.content)


