文章摘要
近期多家大模型厂商推行高峰期Token计费翻倍政策,推高使用成本,有企业因此调整考勤制度压缩开支。国内新发布轻量化大模型Qwen3.8-Flash,采用无峰谷的一口价模式,定价远低于同类竞品,靠架构革新实现降本,官方测试与真实场景实测均表现优异,支持多渠道接入,为企业降低大模型使用成本提供了新选择。

近日在社群中看到一则有趣的讨论,某社区用户发帖称公司因大模型厂商调整计费规则,开始推行倒班考勤制度。

发帖人提到,由于多家大模型厂商推出高峰期Token计费翻倍的政策,公司为压缩Token成本,从本周起调整考勤方式:非周末时段可休息一天,周末再休息一天,排班需提前规划;同时将工作日午休时间延后至14点之后。

这一做法让人不禁感慨,企业既贴合AI原生的运营逻辑,又显得有些务实。不过当前大模型的使用成本确实尚未达到亲民的水平,此前头部厂商的多次价格调整,也让不少用户明显感受到账单的变化。好在国内大模型赛道竞争激烈,行业玩家们持续推出更优质的模型与更低的定价,让用户有了更多选择。

全新轻量化大模型Qwen3.8-Flash正式发布

昨日晚间,相关厂商推出了Qwen3.8-Flash模型,我们对比了主流厂商的定价表后发现了明显差异。

Qwen3.8-Flash在对应平台的API定价为每百万Token输入0.8元、输出2.7元,缓存命中仅需0.1元,全程采用一口价模式,没有峰时段、闲时段的阶梯定价规则。而另一厂商的同类型产品,输出Token在工作日9-12点、14-18点的高峰时段价格为空闲时段的两倍,其余时段才会恢复半价。

按亿级Token量级计算,使用Qwen3.8-Flash的输入成本仅80元,而同类海外旗舰产品的费用高达500美元;即便是缓存命中模式,成本也只需10元,在同品类模型中属于极低价位。行业内常将这种定价策略称为“价格斩杀线”,Qwen3.8-Flash进一步拉低了这个门槛。

性价比之外,模型的实际表现是否达标?

8月26日晚间发布的Qwen3.8-Flash,同步开源了权重版本Qwen3.8-Flash-Next,官方公布了两组对比测试数据,对照组涵盖自家前代旗舰、同赛道竞品以及海外旗舰模型。

从核心测试指标来看,智能体编程测试中,该模型得分领先海外旗舰9分;专业工作任务测试得分比对手高出19分;模拟手机操作的测试领先22.5分;视觉数学解题测试领先25.1分,具身智能任务更是领先31.5分。在长程任务和真实工具调用两项对比中,模型同样击败了另一厂商的同类型产品,仅工具调用测试的领先幅度较小。

更值得关注的是参数量数据:Qwen3.8-Flash-Next总参数125B,激活参数仅6B;而另一厂商的同类型产品总参数284B,激活参数13B,自家前代旗舰总参数更是达到397B,激活参数17B。这款模型总参数不足对手的一半,每次运行仅激活60亿参数,仅为总参数的二十分之一。结合性能、定价与参数量来看,本次发布的核心亮点远不止表面的低价。

实战测试:真实场景下的表现如何?

跑分数据往往存在优化空间,我们在API开放当晚第一时间将模型接入工具,完成了三项真实任务测试。第一项任务是数据分析:要求模型调用指定工具,分析特定平台的榜单数据,评估上榜内容的特征、互动数据规律以及热门方向,同时数据中埋入了期数缺失、互动分布偏斜、官方口径变更等陷阱。

模型耗时一个半小时,完成近200次工具调用,最终交付多种格式的分析结果。值得注意的是,模型在启动后第一时间发现了任务说明与实际数据的差异,并未忽略这一问题,而是将两组数据并列说明,以实际文件为准,并通过官方接口确认了口径变更的细节。从数据清洗、处理到最终分析呈现,完全符合预设的工具调用规则,表现与常用的高端旗舰模型几乎无差异。

第二项任务是绘制模型架构图:要求用一张图向熟悉AI但无暇研读论文的受众,讲解四项核心技术。模型耗时十余分钟,完成数十次工具调用,交付了一个轻量化的单文件网页,其中参数构成模块可交互,四项技术点各配有可折叠的详情卡片。在调用过程中,模型主动进行截图自检,发现代码问题后调整并再次确认无误后才完成交付。我们抽查了图中的关键参数,全部与官方技术报告一致,未出现编造内容。

第三项任务则与开源生态相关,我们将放在后续内容中详述。

低价背后的架构革新

这款模型的低价并非单纯的营销手段,而是从架构层面重构了成本结构,主要通过四项技术改进实现。第一,混合注意力架构:将多层网络中的每四层设置为特定模块组合,负责压缩历史信息与全局精确检索。官方数据显示,在超长上下文场景下,注意力计算核心在两个阶段分别实现了数倍提速;在贴近真实场景的缓存命中设定下,吞吐效率较前代旗舰有大幅提升。

第二,动态门控残差:将传统Transformer的单通道残差拆分为多条通道,通过动态门控机制控制每条通道的读写内容,相当于模型内部的信息传输车道扩容,且可自主选择路径,提升训练稳定性。第三,外挂N-gram Embedding:在特定层挂载了大规模的语法组合模块,采用查表逻辑而非实时计算,可卸载至主机内存,不占用GPU显存。第四,优化器替换:这是纯训练侧的改进,虽不影响用户使用体感,但直接决定训练成本的下降幅度。

官方技术报告中有一组极具说服力的数据:全量训练过程中未出现一次Loss尖峰,也没有梯度范数的异常波动,且未依赖显式裁剪手段。训练大模型时,Loss突然飙升后回滚 checkpoint是常态,每一次都意味着算力成本的浪费,全程未出现异常本身就是成本控制的关键。

四项改进叠加后,相比前代旗舰模型,本次发布的模型仅使用了三分之一的激活参数、三分之一的训练Token,训练算力仅为前代的九分之一,也就是行业常说的训练成本降九成。还有一个细节值得关注:官方使用竞品工具作为测试框架,用竞品模型作为部分评测裁判,展现了十足的自信。

从价格到心智:Agent时代的新课题

至此我们已经了解到这款模型低价、高效且性能强劲,但在Agent时代,单次任务往往包含数十上百次工具调用,比如之前的数据分析任务就调用了近200次工具,真正需要关注的是完成整套流程的总成本与总耗时。还有一个容易被忽略的点:一口价模式无需用户规划工作时段,不必为了省钱调整作息至凌晨。当然,一口价并非永久承诺,此前有厂商仅在十几天前就从一口价改为峰谷定价。当前的定价能否长期维持,取决于训练成本的优化能否持续;即便后续调价,由于模型权重开源,切换模型仅需修改一行配置。

值得一提的是,昨日晚间还有另一厂商推出了同类型的Flash模型,智能指数与海外旗舰持平,定价同样极具竞争力。从参数量来看,两款模型定价接近,但新发布的这款模型背后的算力成本仅为对手的几分之一,更像是实打实的成本优化后的结果。而另一厂商依靠有限的算力资源完成训练,低价能否持续放量使用仍待观察。相关厂商作为云计算领域的头部玩家,算力资源是其核心优势,因此这款模型的低价策略能够支撑大规模使用。

回到开源话题,我们的第三项测试正是围绕开源生态展开:我们让该模型生成一份关于其所属品牌在开源世界影响力的深度研究报告,使用自定义的报告生成工具。

模型耗时数小时,主动启动了十余个子代理分头调研,最终交付了一份多页的研报,包含大量连续编号的图表,核心数据均标注了口径、样本量、出处与时间节点,背后附有大量一手采集记录。完成初稿后,模型还启动了两个独立的审校代理,分别核查事实准确性与文风统一性。研报的密度与排版达到了专业报告的标准。

综合三项测试来看,这款模型在办公、数据分析、研究报告等场景中,只要搭配合适的工具框架与技能配置,表现已经达到顶级水准。还有一组数据值得注意:该品牌的闭源旗舰与开源版本在智能指数上完全一致,而海外最强闭源与开源模型的差距明显。此外,该模型在开源平台上的架构标识符标注为下一代架构的提前预演,代码层面已明确相关规划。

多渠道接入:从普通用户到企业部署

目前有四种方式可以使用这款模型,按使用门槛从低到高排序:第一,官方办公工具:这是普通用户最容易接触到的渠道,无需申请密钥、无需配置环境,使用体验与常规办公工具无异,生成各类文档任务均可快速完成,且响应速度更快。所有关于架构、跑分与定价的讨论,最终落到普通用户身上,就是便捷且低成本的使用体验。第二,官方AI平台API:生产版模型部署于此,支持长上下文,内置官方工具调用功能。第三,企业级平台:模型广场已上架该模型的专属卡片,该平台同时兼容主流的两套接口协议,意味着常用的Agent工具可直接接入,无需额外改造。我们本次的所有实测,都是通过将常用工具接入该模型完成的,整套工作流与日常使用高端模型完全一致,仅需修改少量配置即可。对于将Agent工具作为日常主力的用户来说,这种低切换成本的设计极大降低了尝试新模型的门槛。第四,本地部署:该模型的开放权重已上传至多个开源平台,支持下载、微调、量化与二次开发。虽然总参数较高的模型无法在个人电脑上运行,但企业私有化部署或相关技术研究均可通过该渠道实现。

回到最初的讨论

回到最开始的考勤制度讨论,我们并不认为低价模型会完全取代高端旗舰,在难度极高的核心任务中,高端模型依然是必要选择。但一个现实的问题已经摆在面前:当大量日常Agent任务都可以通过低价高质量完成,企业是否还会将所有请求都交由高端模型处理?是否还会为了节省Token成本,调整整个团队的作息时间?

以上内容不代表本平台立场,仅供读者参考