文章摘要
Qwen3.8-27B大模型正式开源,总参数量270亿。其轻量化设计,消费级显卡就能本地部署。它核心配置全面,原生支持大上下文长度,内置多模态能力。基准测试数据亮眼,多模态能力提升明显。开源后社区积极测试,表现出色。此外,它还带来新功能,架构设计支撑长上下文,部署门槛低。

不少开发者苦等已久的Qwen3.8-27B大模型终于正式开源,这款总参数量达270亿的产品,在多项官方基准测试中的亮眼表现,让不少同类顶级模型感受到了不小的竞争压力。在正式开源前,社区内的催更呼声就从未间断,不少开发者将这款模型列为Qwen3.8系列中最值得期待的开源版本,甚至有社区用户感慨,终于可以在本地部署对标顶级Claude Opus的大模型了。

这款模型之所以受到开发者的持续关注,一个核心原因是它的轻量化设计。经过量化适配后,搭载24GB显存的RTX 3090、4090这类消费级显卡,就可以完整将模型部署在本地,让普通开发者也能体验到高性能模型的能力。

除了轻量化的体量优势,这款模型的核心配置同样十分全面。它原生支持262K Token的上下文长度,还可以扩展到最高100万Token,同时内置原生多模态能力,不仅可以处理文本、代码这类纯文字内容,还能直接解析图片、PDF文档、图表,甚至完成视频内容的处理。它重点强化了编程开发、专业工作以及长程Agent任务的表现,完全贴合当前开发者的主流使用场景。

从官方公开的基准测试数据来看,这款模型的实力已经得到了充分验证。在Agent编程评测SWE-bench Pro中,Qwen3.8-27B以8.3分的优势领先Claude Opus 4.6 Max;而在更考验真实软件工程能力的QwenSWEBench评测中,领先幅度进一步扩大到15.2分。在面向计算机、金融、法律、医疗等多领域专业长任务的CoWorkBench评测中,这款模型拿到70.7分,同样超过了Claude Opus 4.6 Max的68.2分。

多模态能力方面,这款模型的提升表现更为集中。在电脑操作评测OSWorld-Verified中,它拿到84.3分,远超竞品的72.7分;手机操作评测AndroidWorld中取得81.9分,对比Claude Opus 4.6 Max的62.0分优势明显;浏览器操作评测WebArena-Verified的成绩也从上一代的48.8分提升至64.8分。

在视觉数学问题解决能力测试中,开启CI模式后这款模型拿到94.6分,位列同批次测试模型的首位——这类任务不仅需要识别图片中的文字,还要同时理解图形、公式和空间关系。在通用视觉推理测试中,开启CI模式后得分达到85.6分,对比未开启时的65.7分提升幅度显著,证明模型在理解视觉场景关系、做出合理判断方面的能力大幅增强。

开源消息放出后,社区用户已经开始积极测试这款模型的实际能力。有开发者用它制作了像素风宝塔、俄罗斯方块、贪吃蛇等小游戏,不仅实现了核心功能,还自主添加了空格键掉落屏幕抖动、消行奖励倍增这类细节效果。

还有用户在NVIDIA GH200上实测FP8量化版本的模型,同时运行10个真实请求,每个请求最高输出16K Token、上下文拉满262K,首批流式Token响应时间基本控制在10ms以内,10个请求全部顺利完成,高并发和长上下文下的稳定性表现出色。另有用户在单张GPU上测试了它的视频处理能力,将一部11分钟的1935年旧电影交给模型识别96个带时间戳的事件并逐字引用画面文字,最终仅用157秒就完成任务,时间点对应画面的误差仅约2秒。

这次开源的Qwen3.8-27B还带来了不少实用的新功能。首先是内置了推理档位,默认开启Thinking模式,支持通过reasoning_effort调节推理深度,分为xhigh、medium、low三档:复杂的代码编写、长程Agent任务可以拉高推理档位以获得更精准的结果,简单问答、摘要等轻量任务则可以降低档位以换取更快的响应速度和更低的资源消耗,甚至可以直接关闭Thinking模式,让模型跳过推理直接输出结果,实现高度个性化的定制。

另外,模型默认开启preserve_thinking功能,可以保留Agent前几轮的推理过程,让后续任务可以复用之前的决策逻辑。比如在Coding Agent连续修改十几个文件时,后续步骤可以延续之前的思路,减少重复梳理的工作量,同时更好地利用KV Cache提升运行效率。

这款模型的64层架构设计也为长上下文能力提供了坚实支撑,其中48层采用Gated DeltaNet线性注意力,16层保留完整Attention,按照“三层线性注意力+一层完整Attention”的节奏循环排布。线性注意力可以降低长序列下的计算和缓存压力,而完整Attention则每隔几层进行一次充分的信息交互,兼顾了长上下文处理的效率和效果,这也是它能实现262K原生上下文、扩展到100万Token的核心原因。

最后,这款模型的部署门槛也很低,官方已经适配了主流工具链。如果是生产环境或者需要高吞吐的场景,推荐使用专门的服务引擎;本地用户则可以直接使用量化版本,通过熟悉的工具链完成部署,只要拥有高端消费级显卡或者大内存Mac设备,就可以轻松上手体验这款高性能模型。

以上内容不代表本平台立场,仅供读者参考