文章摘要
由加州理工研究团队创立的Prism ML开源新一代三元多模态模型Ternary Bonsai 2 27B,该模型基于Qwen3.8-27B架构,通过三值权重压缩等技术,将原53.8GB的全精度模型压缩至仅5.93GB,保留全精度版本98.2%的性能,支持262K长上下文与图像输入,可用于编码协作、办公自动化,适配多平台本地部署。

由Caltech研究团队创立的Prism ML,长期致力于在压缩神经网络的同时不牺牲推理性能,其推出的Ternary Bonsai 2 27B是继7月首代模型后的新一代开源三元多模态模型。该模型基于Qwen3.8-27B架构构建,将权重压缩为{-1, 0, +1}三种状态,最终体积仅为5.93GB,对比全精度版本的53.80GB压缩比接近1/9。在20项标准基准测试中,该模型平均得分达到83.9分,保留了全精度基线98.2%的性能,同时支持262K token的长上下文与图像输入。推理性能方面,单张RTX 5090显卡下解码速度最高可达143 tok/s,在M5 Max笔记本上约为47 tok/s。

实际应用场景

场景一:编码智能体协作。用户可在VS Code中通过Cline接入本地部署的该模型,对示例Web项目进行安全审查与代码修复。

场景二:办公流程自动化。基于语音指令即可完成完整办公链路:读取邮件内容、查阅PDF文档、安排工作日程,最后自动回写邮件完成流程闭环。

核心技术原理

混合注意力基座架构

该模型沿用Qwen3.8-27B的混合注意力设计,其中约75%为线性注意力,25%为全注意力,搭配SwiGLU MLP、RoPE位置编码与RMSNorm归一化结构。262K的长上下文能力由以线性注意力为核心的骨架支撑,总参数规模为27.36B,其中包含24.35B语言主干(64层)、2.54B词嵌入与输出头,以及0.47B视觉塔模块。整个压缩过程未改变模型架构,仅调整了权重的存储与表示方式。

三值权重编码方案

模型的矩阵权重仅保留{-1, 0, +1}三种离散值,每128个权重共享一个FP16格式的缩放系数,该三值表示覆盖了嵌入层、注意力投影、MLP投影与输出头等全链路模块。单个三值仅占用约1.585bit的存储空间,加上缩放系数的额外开销后,纯三值张量的理论位宽约为1.71bit/权重;计入0.0976%的高精度张量后,整套语言模型的理论位宽为1.72bit/权重,最终发布的PTQ1_0打包版本实际位宽为1.76bit/权重。对比全精度版本的53.80GB体积,理想三值表示仅需5.80GB,实际发布版本约5.93GB,压缩比接近9.3倍。

权重旋转基优化

该模型采用了独特的权重旋转基设计:将权重按1024大小的块进行Hadamard旋转,搭配固定的±1符号集,将旋转操作整合到权重存储环节中。在推理阶段,仅需对激活值进行一次匹配的Walsh-Hadamard变换,其复杂度为O(n log n),远低于后续的矩阵乘法运算,无需将权重还原为全精度格式即可完成计算,这也是区别于常规逐通道量化方案的核心特点。

自定义推理内核与运行要求

常规的低比特推理框架仅支持标准全注意力Transformer架构,无法适配混合注意力与线性注意力交替的结构,因此官方针对Apple Silicon与CUDA平台专门编写了自定义推理内核,可直接在打包的三值权重上完成计算,无需先转换为FP16格式,真正将低比特压缩带来的显存带宽优势转化为实际性能提升。使用GGUF打包格式的模型,需要使用PrismML分支的llama.cpp(版本prism-b10658或更高)才能正常运行。

长上下文与工程任务表现

官方在Terminal-Bench 2.1与SWE-bench Verified两大基准上进行了评测,Ternary Bonsai 2 27B分别获得52.8与60.8分,约为全精度基线性能的四分之三;在τ²-Bench上得分80.2(上一代模型为73.6),BFCL v3基准得分为74.9,长上下文推理AA-LCR得分为77.0,与全精度版本的差距在1分以内。官方指出,同体积档位的低比特模型往往无法完成长程任务,常规量化方案还会导致智能体性能大幅下滑,但本模型仍能稳定完成端到端的软件工程流程。

官方还引入了“智能密度”指标来衡量单位体积的可用智能:将平均得分转换为错误率后取对数,再除以模型体积(GB)。Ternary Bonsai 2 27B的智能密度为0.444/GB,远高于IQ2_XXS的0.276/GB与全精度基线的0.051/GB。相比上一代三元Bonsai 27B与全精度版本95%的性能保留率,本版本提升至98.2%,官方称之为“实用意义上的接近无损”。

部署与使用指南

模型下载

可以通过官方工具下载完整模型仓库,其中包含PTQ1_0与PQ2_0两种打包格式、FP16参考版本,以及两个视觉投影器(mmproj-Q8_0约0.63GB,mmproj-BF16约0.93GB)。如需仅下载部分所需文件,可以使用--include参数指定具体内容。

download --model prism-ml/Ternary-Bonsai-2-27B-gguf --local_dir ./Ternary-Bonsai-2-27B-gguf

推理脚本使用

Windows(PowerShell环境)

git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
./setup.sh # 拉取权重与对应平台的llama.cpp二进制文件
./scripts/start_llama_server.sh # 启动服务后访问http://localhost:8080

Windows系统也可以使用setup.ps1与start_llama_server.ps1脚本,如需跳过聊天界面或代码解释器功能,可以设置BONSAI_OPENWEBUI=0或BONSAI_CODE_INTERPRETER=0参数。运行所需的二进制文件来自PrismML分支的预编译版本,需使用prism-b10658或更高版本的llama.cpp分支。如需手动运行,可以使用仓库自带的llama-cli工具,示例命令如下:

./bin/llama-cli -m Ternary-Bonsai-2-27B-PQ2_0.gguf -ngl 99 -fa on -c 32768 --temp 1.0 --top-p 0.95 --top-k 20 -p "Explain quantum computing in simple terms." -n 256

macOS / Linux

git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
./setup.sh
./scripts/start_llama_server.sh
以上内容不代表本平台立场,仅供读者参考