文章摘要
近期开发者推出仅3500万参数的基础语言模型BarunLM - 35M,仅用单张H200 GPU完成预训练。它在9项零样本基准测试中平均准确率超参数量约为其6.55倍的模型及其他大体量同类。该模型架构独特,采用局部与全局注意力交替、可学习残差选择器等设计。不过它未微调、窗口小,适用于研究等,为AI普惠应用打开空间。

近期有开发者推出了一款仅3500万参数的基础语言模型BarunLM-35M,凭借亮眼的零样本表现刷新了小参数模型的性能上限,更难得的是,它仅用单张H200 GPU就完成了全部预训练。

其实早在这之前,就有开发者展示了小参数模型的落地潜力:一位名为slvDev的开发者将2890万参数的语言模型部署到售价仅8美元的ESP32-S3微控制器上,这块板子仅配备512KB SRAM、8MB PSRAM和16MB闪存,无需联网就能以约9.5 token/s的速度续写文本。不过这款模型仅在TinyStories数据集上训练过,无法完成代码编写、工具调用或常识问答,核心能力仅局限于续写简短的儿童故事,但依然让开发者们收获了满满的创作乐趣。

而BarunLM-35M则进一步突破了小模型的性能边界。该模型开发者Harshal Singh公开项目时宣称,这是全球参数量小于100M的最优预训练语言模型。

根据官方公布的评测结果,BarunLM-35M在9项零样本基准测试中平均准确率达到41.01%,不仅超过了参数量约为其6.55倍的Liquid AI LFM2.5-230M-Base,还超越了GPT-2、Pythia-160M等体量更大的同类模型。经过1万次配对bootstrap重采样验证,该性能提升的置信区间在0.92至2.71个百分点之间,结果具备统计学意义。

更令人惊喜的是,整个预训练过程仅使用单张H200 GPU完成,项目所有资源包括模型权重、训练与推理代码以及完整评测结果均已开源,采用Apache 2.0许可证开放使用。

核心架构创新:兼顾效率与性能的设计

BarunLM-35M整体参数规模为35,072,768,预训练阶段使用了约57亿token数据,上下文窗口长度为2048。训练过程采用LM Evaluation Harness 0.4.12完成评测,覆盖的9项零样本任务包括ARC-Challenge、ARC-Easy、BoolQ、HellaSwag、LAMBADA、OpenBookQA、PIQA、SciQ和WinoGrande。

这款模型的核心优势来自独特的架构设计,开发者参考了DeepSeek、Kimi等前沿开源模型的技术思路。模型共有12层网络,隐藏层宽度为448,采用7个查询头和1个共享键值头。最具标志性的设计是按照3:1的比例交替使用局部注意力与全局注意力:连续三层网络仅关注前后256个token的局部上下文,第四层则执行一次全局信息交换。

标准全局注意力的计算量会随序列长度呈平方级增长,但语言序列中的语义依赖大多集中在相邻token范围内,这种局部为主、定期全局交互的设计,既降低了计算开销,又不会完全切断长距离信息流。

第二项关键创新是「可学习残差选择器」

模型每间隔四层就会设置一次选择机制,在多个中间表征中筛选需要保留的有效信息,解决了小模型容量有限的痛点——早期训练形成的优质特征如果在后续计算中被覆盖,小模型没有足够的冗余参数重新学习这些特征。

除此之外,BarunLM还集成了分组查询注意力、50% Partial RoPE、QK Normalization、门控注意力输出和bounded SwiGLU等技术,同时绑定了输入与输出嵌入权重,并将词表大小控制在16384,进一步压缩了嵌入层的参数占用。

训练数据覆盖了教育文本、合成数据、数学内容、通用网页与代码,来源包括FineWeb-Edu、Cosmopedia v2、FineMath-4+、DCLM、CodeSearchNet Python和CodeParrot Clean,总计约57亿token,平均每个参数对应162.5个训练token。最后40亿token的训练阶段在单张H200 GPU上完成,使用Muon优化器,总计训练40690步。

需要注意的是,BarunLM-35M属于基础预训练模型,未经过指令微调,上下文窗口仅为2048。开发者明确表示,该模型主要面向紧凑语言模型研究、教学演示、文本生成实验和本地原型开发,并不适用于医疗、法律、金融等高风险场景。

小参数语言模型的价值从来不是成为缩小版的通用大模型,当单张专业GPU就能完成高性能小模型的训练时,无疑为AI技术的普惠性应用打开了更广阔的想象空间。

以上内容不代表本平台立场,仅供读者参考