文章摘要
腾讯推出Hy-MT2-1.8B极低比特端侧翻译模型,原生支持33个语种互译,翻译质量优于多款商业翻译API。研发团队推出两档极致量化方案将模型压缩至几百MB,适配多类设备,可本地部署保障用户隐私,目前已落地B站直播弹幕实时翻译,开放体验通道并公开相关技术资源。

当前已经有一款真正落地的极低比特大模型翻译产品,并非停留在实验室的Demo,用户可以直接体验。这款产品基于Hy-MT2-1.8B翻译模型,通过两套极致量化方案将体积压缩至几百MB,同时保持了几乎无损的翻译质量,还完成了跨平台的适配与真实业务落地。

Hy-MT2-1.8B是主打端侧的翻译模型,原生支持33个语种互译。这款仅1.8B参数的模型,在FLORES-200通用翻译评测中表现优异,整体翻译质量超越了多款商业翻译API。不过作为端侧模型,它的原生FP16版本需要占用3.3GB内存,即使做到4-bit量化也仍需1GB以上,对于多任务并发的端侧设备来说依然偏大,因此需要进一步压缩体积以实现真正落地。

针对不同设备场景,研发团队推出了两档极致量化方案: 第一档是面向中高端设备的2-bit模型,采用业内领先的拉伸弹性量化技术,将参数量化至四个固定值,结合量化感知蒸馏技术,最终将模型压缩至574MB,翻译质量几乎无损,效果甚至优于不少体积更大的模型。 第二档是面向全系列设备的1.25-bit模型,基于自研的Sherry稀疏高效三值量化技术,该方案已被NLP顶级会议ACL 2026收录为Oral论文。Sherry采用细粒度稀疏策略,每4个参数中保留3个重要参数用±1存储,剩余1个置0,平均每个参数仅需1.25-bit。配合专为CPU设计的STQ内核,原始3.3GB的模型被压缩至440MB,可以常驻后台,让内存紧张的普通设备也能流畅运行高质量翻译服务。

借助极致量化技术,原本依赖云端算力的翻译大模型,如今可以以更低成本实现本地部署,替代消费级翻译API,显著降低了使用门槛与部署开销。由于翻译全程在设备本地完成,数据无需上传云端,用户隐私得到充分保障,同时压缩后的模型依然保持稳定可靠的表现,实现了低成本、重隐私、高质量三者兼得。

最初这款极低bit模型是为移动端ARM CPU设计的,为了在x86生态中同样高效运行,相关团队对量化矩阵运算的向量化、权重重排和VNNI指令融合环节进行了针对性优化。优化后,Hy-MT2的低比特量化格式在主流处理器机型上的token处理速率分别提升了2.7倍和5倍,让这套极低bit方案从移动端覆盖到了PC与边缘设备。

在真实业务场景中,该模型已经接入直播弹幕实时翻译服务。整套资源下载仅约600MB,内存占用在500~700MB之间,平均单条弹幕翻译耗时500~800ms,在常规弹幕频率下即可实现实时翻译,还能准确识别带有网络特色的表达,验证了极低bit量化在高并发场景下的可用性。

目前可以通过多种方式体验这款产品: 适配x86设备的体验链接; Hy-MT APP可以在应用商店搜索“腾讯Hy翻译”下载; IOS端用户可以通过TestFlight体验链接获取测试版本。

此外,相关技术资源也已公开共享: 开源模型权重:https://huggingface.co/collections/AngelSlim/hy-low-bit-model; Sherry量化技术论文:https://arxiv.org/abs/2601.07892; Hy-MT2模型技术报告:https://arxiv.org/pdf/2605.22064; AngelSlim量化框架技术报告:https://arxiv.org/abs/2602.21233; 完整开源代码:https://github.com/tencent/AngelSlim

以上内容不代表本平台立场,仅供读者参考