Mac与RTX集群:Kimi K3 2.8万亿参数模型运行实测

当2.8万亿参数的Kimi K3开放官方完整权重后,全球的AI开发者都开始尝试将这个超大规模模型部署到本地环境中。不少人认为,只要拿到这套MXFP4格式的官方权重,就能自主搭建这个巨型模型的本地运行环境。
但实际的部署门槛,真的像想象中那样容易达成吗?有博主曾粗略估算运行Kimi K3的硬件要求,称仅需要1.5TB的GPU显存、约8张H100专业显卡,再配套一座小型变电站就能完成部署。按照这套估算,整套硬件和供电设施的总成本可能超过百万美元,这显然让普通个人玩家望而却步。
这样算下来,本地部署Kimi K3似乎和普通个人用户没什么关联。不过仍有不少开发者不死心,尝试通过模型量化的方式,将2.8万亿参数的巨型模型压缩到个人消费级设备中,但相关评论区的反馈大多并不乐观。
但令人意外的是,真的有开发者成功在一台Mac设备上跑通了完整的Kimi K3模型。
128GB内存的Mac,成功跑通1.6TB权重的Kimi K3
这位开发者使用的是一台搭载128GB统一内存的M5 Max芯片Mac设备,直接加载了从开源模型托管平台获取的Kimi K3官方MXFP4格式权重。这套官方权重的总大小达到1.56TB,体积是设备内存的十倍以上,显然无法一次性全部加载到内存中。
为此他采用了流式加载的方案:将约97GiB的静态权重常驻在设备内存中,其余权重不会一次性全部载入,而是在模型推理的过程中,从固态硬盘持续读取并按需加载到内存中参与计算。通过这种方式,128GB的内存不需要同时容纳整个模型的所有权重,只需要保存常驻的静态权重以及当前推理层需要用到的部分参数即可。
最终,Kimi K3成功完成了推理对话。开发者首先向模型提问了「How are you」,模型给出了正常的回复「I am fine, thank you」;随后他又让模型解释Transformer架构中的注意力机制,Kimi K3也顺利生成了对应的回答内容。
不过,这套方案的推理速度非常缓慢。测试数据显示,模型处理输入内容的速度约为0.98 token/s,而回答内容的生成速度仅为0.32 token/s,换算下来每生成一个token需要等待近3秒,一个常规长度的回答往往需要等待数分钟才能完成。
这一测试至少证明了一个核心结论:仅配备128GB内存的Mac设备,确实可以通过流式加载的方式,运行总重量达1.6TB的Kimi K3官方权重。但这种方式仅仅解决了模型容量适配的问题,由于权重需要不断从硬盘读取并加载到内存中,模型每生成一个token都需要等待大量数据完成读取和计算,推理速度自然很难得到提升。
该开发者也提到,当前这套方案主要用于验证推理链路是否能够跑通,下一步他计划将模型进一步量化到Q2格式,并使用两台各配备512GB统一内存的Mac Studio设备,尝试将推理速度提升到可以正常进行日常对话的水平。显然,如果不想让Kimi K3的生成速度慢到像《疯狂动物城》里的树懒那样,仅靠一台128GB内存的Mac设备显然是不够的。
80张RTX5090:真正可用的本地集群方案
既然单设备压缩的方式进展有限,另一个团队则选择通过增加显卡数量的方式,实现完整Kimi K3的稳定运行。某技术团队使用80张RTX5090消费级显卡,成功完整运行了2.8万亿参数的Kimi K3模型。
这套集群系统由10个计算节点组成,每个节点搭载8张RTX5090显卡,总显存容量达到2.56TB,团队直接使用Kimi官方发布的MXFP4格式权重,未进行额外的量化压缩。在首日的测试中,这套集群的单流推理速度达到了20 token/s。
相比Mac设备上的0.32 token/s,这套方案的输出速度提升了六十多倍,已经基本达到可以正常进行日常对话的水平。值得注意的是,这套方案使用的仍然是消费级显卡:RTX5090搭载GDDR7显存,并不具备专业数据中心显卡才有的HBM高速显存和NVLink高速互联功能,10个计算节点之间仅通过25GbE以太网进行连接。
80张RTX5090显卡总共提供了2.56TB的总显存和约143TB/s的聚合带宽,这一数据高于32张H100专业显卡方案的107TB/s,以及16张B200专业显卡方案的128TB/s。不过需要明确的是,聚合带宽并不能直接代表整套系统的实际推理性能,多节点之间的通信延迟、算子优化效率以及调度开销等因素,都会对最终的推理速度产生影响。
即便存在上述影响因素,20 token/s的实测结果已经证明,使用消费级显卡搭建的GPU集群,也能够以达到实用标准的速度运行完整的Kimi K3模型。该团队提到,这一数据还是首日未经充分优化的测试结果。在此前的项目中,他们曾将搭载RTX4090显卡的集群运行GLM-5.2模型的速度从30 token/s提升至110 token/s,因此Kimi K3的推理速度仍有很大的优化提升空间。
相比传统的数据中心专业GPU方案,这套消费级显卡集群方案降低了对HBM高速显存和专用高速互联设备的依赖,但80张RTX5090显卡、10个计算节点,再加上配套的网络、供电和散热设施,整体投入依然相当可观。这样看来,单靠一台普通的轻薄本显然无法运行Kimi K3,但80张消费级游戏显卡搭建的集群,确实可以实现完整模型的可用速度运行。

