文章摘要
职场社交平台LinkedIn针对AI职位搜索系统中大模型调用开销过高的痛点,基于开源SGLang打造在线加离线结合的多教师蒸馏框架,搭配多层训练优化,将大模型知识压缩至6亿参数轻量模型,实现整体训练提速8倍,同时优化了搜索效果,该系统已投产,LinkedIn公开实践方案供行业参考。

在AI驱动的职位搜索系统中,如何兼顾大模型的精准性与训练推理的高效性?职场社交平台LinkedIn公开了其背后的技术实践:通过多教师蒸馏流水线,将大型教师模型中的知识压缩至仅6亿参数的轻量排序模型,同时将整体训练速度提升了8倍。这项工作的核心价值不仅在于蒸馏技术本身,更在于构建了一套能够支持快速迭代的系统工程方案。

训练小语言模型以优化职位搜索的点击、申请等相关性与互动目标时,需要针对每个训练样本调用一个或多个大型教师模型。对于LinkedIn这种每秒需要处理数十万次查询的排序系统来说,实时调用大模型的开销会成为明显的瓶颈,这也是许多搜索和推荐团队共同面临的挑战:如何从基于关键词的传统系统,顺利过渡到由大语言模型监督的统一排序器。

为此,LinkedIn基于开源引擎SGLang打造了一套多教师蒸馏框架。这套系统可以灵活加载并服务不同规模的教师模型,同时自动管理张量并行和数据并行的配置。在训练过程中,异步客户端会向教师模型发送请求、处理输出结果,并将结果整合到蒸馏损失计算中,团队将这种方式称为在线多教师蒸馏。通过在多个节点部署本地教师模型副本,该系统将蒸馏流程提速3倍,同时保持了较低的延迟,能够支持快速的模型迭代。

为了进一步降低服务开销、避免重复计算,团队还引入了离线多教师蒸馏模式:预先计算教师模型的输出结果并存储在分布式存储系统中,后续的训练过程可以直接调用缓存结果,无需实时查询教师模型。

在线与离线结合的方案,还搭配了多层训练优化技术栈:通过LiGer工具降低内存占用,将批次大小扩大至原来的2倍;借助多节点训练实现最高3.5倍的速度提升;使用FSDP2框架再获得20%的性能增益;搭配H200多节点集群,又额外提升了最高30%的效率。团队曾测试过FP8混合精度方案,但发现对于参数量低于80亿的模型来说,类型转换的开销超过了计算节省的收益,因此没有采用。这些优化措施叠加在一起,最终实现了8倍训练速度提升。

在模型效果方面,这款6亿参数的学生模型大幅优化了职位搜索结果。它的知识来源于两个教师模型:一个80亿参数的相关性预测模型,以及一个17亿参数的互动效果教师模型。实际测试显示,该模型将职位搜索的NDCG@10指标提升了24.48%,从0.7583提升至0.9432。同时,团队在推理侧采用了结构化剪枝和上下文压缩技术,将单块GPU的排序吞吐量从每秒约290个条目提升到了2000多个。

目前这套系统已经投入生产环境,为LinkedIn美国用户的自然语言职位搜索提供服务。它完全基于开源的SGLang引擎构建,没有使用专有服务技术栈。LinkedIn将这项实践作为一份参考指南,帮助其他团队在满足实时延迟要求的前提下,实现接近交叉编码器的排序质量,同时无需为每个请求调用前沿大语言模型,从而避免高昂的推理成本。

对于想要构建类似大语言模型监督型排序系统的团队来说,可以采用在线与离线结合的教师模型服务方案:在教师模型选型仍频繁变动的早期阶段,使用在线查询模式;当教师模型趋于稳定、查询量上升后,再切换到离线缓存模式。这些性能收益来自多项技术的叠加,而非单一技巧。LiGer、多节点数据并行、FSDP2和新一代GPU都各自带来了适度的提升,而对于参数量低于80亿的模型,完全不需要使用FP8精度,这一点对于考虑使用低精度训练的团队来说尤为重要。

2026年6月,Pinterest也曾发布相关文章,介绍如何通过多节点训练构建更大的教师模型,再将知识蒸馏到高效的学生模型中,用于Homefeed和Related Pins的排序,将实验周期从数周大幅缩短。和Pinterest侧重扩展训练框架不同,LinkedIn的核心贡献在于打造了定制化的SGLang框架,让教师模型能够在训练过程中接受实时查询。此外,行业内近期的一项调查显示,前沿模型如NVIDIA Nemotron 3 Ultra、MiMo-V2-Flash和DeepSeek-V4等,都使用了十个或更多专业教师模型进行密集的词元级监督,这类复杂的教师模型池远超LinkedIn和Pinterest这类工业排序系统的需求,后者更倾向于使用少量面向特定任务的教师模型。

以上内容不代表本平台立场,仅供读者参考