腾讯混元Hy4模型压缩至214GB 性能不减支持异构推理

此前推出的Hy4-preview模型在代码编写、办公协作、科学计算等真实生产力场景中展现出优异性能,一经发布便受到广泛关注。这款模型初始权重接近1.5TB,开源后,不少开发者呼吁推出轻量化版本,以便在配置有限的设备上流畅运行。
针对这一需求,开发团队通过两项核心技术优化,成功将Hy4-preview的权重压缩至约214GB,大幅降低了模型运行的硬件门槛。这两项关键技术分别是Sherry稀疏三值量化算法,以及MIX-STQ1_0混合精度策略。
1.25-bit极限量化技术细节
要实现极致轻量化,首先需要足够低的比特压缩格式。模型中占比超过六成的参数集中在路由专家模块,团队将最激进的压缩方案应用在这一部分,采用自研的Sherry稀疏量化算法。
Sherry是一种轻量化且规整的三值量化方法:以四个权重为一组进行统一量化,将其映射为{-1、0、+1}三个值,同时强制每组恰好保留一个零值。这样每组仅存在32种组合,仅需5bit即可完成编码,摊分到每个权重平均仅1.25bit;若算上分块共享的缩放系数等额外开销,最终文件存储的实际开销约为1.31 bpw。基于Sherry算法,团队还在llama.cpp中实现了STQ1_0推理内核,完整打通了量化、推理到模型评测的全链路。
通过对比测试可以发现,STQ1_0与多款常见低比特格式在同一算子上的表现相比,不仅比特数最低,运行速度还和IQ1_M基本持平,明显快过同样主打低比特压缩的IQ1_S格式。
分层适配:让比特分配更合理
如果将所有模型层统一压缩到同一比特档位,操作虽然简单,但不同网络层对压缩的耐受程度存在显著差异。社区常用的UD-IQ1_M方案,会将大部分路由专家层统一设置为1.75 bpw的IQ1_M格式。
开发团队在校准数据集上测试后发现,相较于统一压缩方案,按照每层的敏感度进行分层适配效果更好:对压缩更敏感的层级保留IQ2_XXS(2.06 bpw)格式,而对压缩耐受度更高的层级则使用更激进的STQ1_0(1.31 bpw)格式,这套分层混合精度方案就是MIX-STQ1_0。
这种分层策略在不增加平均比特预算的前提下,有效降低了整体量化误差。最终落地的模型中,采用MIX-STQ1_0方案的路由专家权重,不仅评测表现优于UD-IQ1_M方案,还比后者少占用了5GiB以上的存储空间。
压缩后模型性能依旧可靠
判断轻量化压缩效果的核心标准,是看模型性能与原始版本的差距是否在可接受范围内。测试结果显示,压缩后的Hy4-preview模型在主流任务上的表现依然稳定。
长文理解能力几乎和原始模型持平,多轮长上下文检索的表现也与原版基本处于同一水平;数学推理能力仅有小幅回落,整体性能都维持在可用区间。日常的编码辅助、工具调用、长文档处理以及常规问答等场景,该轻量化模型都可以覆盖。
从实测数据来看,MIX-STQ1_0量化版本在多个主流评测集上,与BF16原版模型的性能差距都在一两分以内,其中检索类任务甚至几乎没有性能损失,整体表现还领先于UD-IQ1_M量化版本。
异构设备联合推理新玩法
将模型压缩到200GB级别后,还解锁了一种全新的使用场景。大多数用户并没有整套同构的高端显卡,但往往拥有多台配置各异的设备。此前面对超大型模型,用户往往需要单独采购更高配置的硬件,而轻量化后的模型让异构设备联合推理成为可能。
开发团队联合prima.cpp进行了实测:使用一台搭载4090的笔记本,搭配一台四卡A4000服务器,两者总显存合计80GB,系统内存合计64GB,且分处两个不同局域网。通过prima.cpp的异构调度能力,将MoE层拆分分配到不同设备上,同时让计算过程和权重读取操作相互重叠,最终这套214GB的模型实现了1.02 token/s的推理速度,比笔记本单机offload模式快了约6倍。如果加入更多更高配置的设备,还可以进一步大幅提升推理速度和性能。
这次测试验证了一个新思路:面对旗舰级大模型,不必采购整套同构硬件,仅用手边现有的异构设备组合,就可以让模型顺利运行。
相关资源链接
- 量化GGUF库:https://huggingface.co/AngelSlim/Hy4-preview-GGUF
- Hy4-Preview 官方仓库:https://huggingface.co/tencent/Hy4-preview
- AngelSlim 代码仓库:https://github.com/Tencent/AngelSlim

