驾驭AI:QCon 2026上海站探讨AI Native架构与Agent技术

当影视圈的“新牛”话题热度未褪,AI大模型领域又迎来了一头身份成谜的“牛”。近日,一家第三方模型聚合平台没有举办发布会,也未公开技术报告,仅用一个忍者表情符号悄悄推出了代号为Ox Alpha的全新模型——“Ox”在英文中意为“牛”,这也让AI行业刮起了一场关于这头神秘“金牛”的讨论热潮。
该平台对这款模型的介绍极为简洁,仅用一句话概括了核心定位:这是一款面向高效编程、长周期智能体任务与真实生产场景的前沿模型,配备了超100万Token的上下文窗口,同时支持文本、图片与视频输入。但关于模型参数、训练数据集、技术架构、公开基准测试成绩以及开发团队的信息,全部处于保密状态。
可以确定的是,Ox Alpha并非该聚合平台自研的模型,平台仅负责将用户请求转发给背后的第三方供应商,而供应商选择在预览阶段保持匿名。这也让Ox Alpha上线短短几小时后,就演变成了一场社区广泛参与的“猜模型”游戏,海外技术社区中相继出现了多种猜测方向。
更值得注意的是,在社区忙于猜测模型身份时,该平台就已经宣布这款模型当前完全免费。根据平台公开信息,Ox Alpha的完整模型标识为stealth/ox-alpha,其核心研发方向为推理与编程,重点覆盖三类场景:长周期软件工程、复杂逻辑推理,以及融合文本与视觉信息的智能体工作流。
官方介绍显示,Ox Alpha配备了超100万Token的上下文窗口,最大输出长度可达13万Token。这意味着它理论上能够一次性读取大型代码仓库、长周期积累的智能体执行日志,或是由文本、图片、视频共同组成的复杂任务数据。该模型支持文本、图片与视频输入,但目前输出形式仅支持文本内容。
在该模型的常见问题页面中,有一个关于工具调用与结构化输出的提问,官方回复显示,Ox Alpha支持工具调用、工具选择以及JSON格式的结构化输出,但暂不支持严格的JSON Schema约束。这些特性表明,Ox Alpha并非仅面向普通聊天或单次代码补全,更有可能是为代码智能体打造的专用执行模型。
长周期智能体任务对模型的要求,与普通编程问答存在显著差异。这类任务不仅要求模型生成正确代码,还需要它持续读取文件、调用工具、追踪修改状态、运行测试,并在执行失败后重新规划任务路径。如果模型在上下文变长后出现目标遗忘,或是连续调用工具后偏离任务方向,即便它在代码基准测试中得分较高,也很难真正落地到生产环境。正因如此,该聚合平台并未将Ox Alpha简单定义为“代码模型”,而是反复强调其支持“持续智能体工作”的核心优势。
截至当前,第三方平台的数据显示,Ox Alpha的首Token中位延迟约为1.95秒,输出速度约为每秒49Token,近三天的可用率接近100%。不过由于模型刚上线不久,这些数据的采样周期和调用规模都相对有限,后续大概率会出现调整。同时需要注意的是,平台并未公开该模型在SWE-bench、Terminal-Bench等编程与智能体相关的基准测试成绩。尽管平台将其定位为“前沿模型”,但目前尚无公开数据能证明Ox Alpha的性能已经跻身旗舰模型的第一梯队。截至目前,我们仍无法判断它究竟是全新的旗舰级模型,还是一款针对速度、成本与智能体任务优化的中型模型。
尽管我们仍不清楚Ox Alpha的开发方,但它目前的免费政策无疑是最大的亮点。在该平台上,Ox Alpha的输入与输出调用价格均为零。对于一款拥有百万级上下文、支持视频输入与工具调用的模型来说,完全免费的API接口并不多见。作为对比,同样具备百万级上下文的其他旗舰模型,在该平台上的定价为每百万Token输入0.375美元、输出1.875美元;另一款旗舰模型则为每百万Token输入2.5美元、输出15美元。不过,Ox Alpha的免费政策并非永久。相关合作平台随后宣布,Ox Alpha将在其平台免费开放一周,提供较为宽松的速率限制与接近无限的使用额度。该平台的联合创始人在海外社交平台上向开发者喊话:“快来猜猜这是什么模型吧!”不得不说,单日100万亿Token的测试容量,无疑是一次极具诚意的公开测试邀请。
这款模型上线后,迅速在海外技术社区引发了集中测试。有用户在测试后表示,模型的使用体验相当不错。还有用户选择了难度极高的AI测试题——鹈鹕骑自行车SVG生成任务,对Ox Alpha的三个推理档位进行了15组对照测试:在相同提示词与温度参数下,分别以low、high、max三档推理强度各生成5次结果。
测试结果显示,模型基本能够理解任务要求,稳定生成包含鹈鹕、自行车、车轮与骑行动作的可视化代码,说明其代码生成与空间关系表达具备一定稳定性。但仔细观察仍能发现部分样本存在瑕疵:比如鹈鹕的腿未踩在踏板上、车架结构不完整,或是翅膀、身体与车把之间出现不合理连接。更值得关注的是,提升推理强度后,模型的质量提升并未与计算开销保持同步。low档位的生成通常仅需13至21秒,推理字段几乎为空或仅十几个字符;high档位耗时维持在19至23秒,画面细节与结构一致性有所改善;而max档位的推理字段骤增至1.7万至6.2万个字符,单次生成耗时拉长至124至355秒,Token消耗最高超过2.6万。最终生成的图像虽然增加了云朵、太阳、头盔、速度线与更复杂的车轮结构,但核心构图并未出现同等幅度的提升,个别样本甚至仍存在脚与踏板错位、车架比例失衡等问题。
这组测试反映出两个关键问题:一是Ox Alpha能够稳定完成可视化代码生成任务;二是其最高推理档位存在明显的“过度思考”倾向——模型花费数十倍的推理字符与十几倍的时间,仅换来了装饰细节的优化,而非结构准确性的根本提升。
另一部分用户则更关注模型是否适配智能体任务。有用户反馈,Ox Alpha在经过两次需求澄清后,能够完成预期的功能开发;也有开发者尚未开始正式测试,就因为免费额度与百万级上下文的优势,将模型接入了合作平台。还有用户将注意力放在“100万亿Token”的测试容量上,认为这更像是一场公开压力测试,而非常规的产品发布。
社区目前的整体态度相对谨慎:大家认可其免费政策与长上下文优势,愿意进行尝试,但在模型身份、稳定性与真实能力得到验证之前,并不建议用它替代成熟的生产级模型。这种谨慎并非多余,该聚合平台此前已经上线过多款匿名Alpha模型,社区往往在发布初期将它们猜测为下一代旗舰模型,但最终揭晓的实际定位往往与最初的想象存在差距。
免费开放还为模型带来了另一项现实价值:大规模的真人压力测试。与厂商自行设计的基准测试不同,开发者会将模型接入各类智能体测试框架与代码平台,放入真实项目中,要求其修复依赖冲突、解读混乱代码、操作终端、浏览网页,甚至连续工作数小时。这些真实场景下的失败案例,对准备正式发布的厂商来说,可能比排行榜分数更有参考价值。免费测试并非没有成本,只是测试费用由模型厂商承担,开发者则通过真实任务为模型提供反馈。
有海外用户还对Ox Alpha与其他多款模型进行了更详细的对比测试,让Ox Alpha在10项具体任务中完成测试。最终结果显示,Ox Alpha通过了其中8项任务,失败2项,整体通过率为80%。而其他参与对比的模型,每项任务均测试了4次:有的模型在所有4次测试中全部成功,有的仅成功2次,还有的全部失败。
10项任务的平均通过率分别为:Fable 5:65%,GLM-5.3:62%,GPT-5.6 Sol:52%,Grok-4.6:62%,Ox Alpha:80%。从表面数据来看,Ox Alpha在这10项任务中排名第一,比第二名Fable 5高出15个百分点。但综合来看,Ox Alpha虽然展现出了接近甚至超越前沿模型的潜力,但由于测试样本量较少、测试口径不完全统一,我们仍无法直接判断它已经击败了其他旗舰模型。在相关测评帖子的评论区,有用户看到结果后评价“感觉这模型已经把Fable 5都超越了”,也因此有人猜测,这款模型可能是国内智谱的最新研发成果。
关于模型身份的各类猜测
匿名模型推出后,社区最关注的问题并非如何使用,而是“它究竟来自哪家厂商”。目前社区主要提出了四类猜测方向。
第一类猜测指向国内某厂商的MiMo系列模型。在海外技术论坛与社交平台上,MiMo系列是出现频率较高的猜测方向,相关依据主要有三点:一是时间节点吻合,今年8月中旬,某国内大厂CFO在财报电话会上透露,新一代MiMo模型正在训练中,有望很快发布,但厂商并未公布具体型号,“MiMo 3.0”仅是网友的非正式称呼;二是该厂商有匿名测试模型的先例,今年3月,代号为Hunter Alpha的神秘模型曾在该聚合平台免费上线,当时曾被猜测为其他模型,后续厂商确认这其实是MiMo-V2-Pro的早期内部测试版本,而Hunter Alpha同样具备百万级Token上下文,且面向智能体任务,上线后很快突破了1万亿Token的调用量;三是产品定位高度重合,Ox Alpha被定位为面向高效编程、长周期智能体任务与生产场景,而MiMo系列也将代码开发、工具调用与长周期智能体执行作为核心方向,同时Ox Alpha的百万级上下文参数也与MiMo-V2.5等系列产品的参数接近。有海外论坛用户直接猜测这款模型就是MiMo V3,还有用户补充称“该厂商经常以100万亿Token为单位规划测试预算”,更有用户直接建议“趁它还开放时赶紧用”。不过这类猜测目前仅基于发布时间、免费策略与产品定位,暂无确凿的技术证据支撑。
第二类猜测指向国内大厂的混元模型。有海外论坛帖子直接将Ox Alpha指向相关型号,理由是能够支撑单日100万亿Token的免费测试规模,需要厂商具备极强的算力与推理基础设施能力,同时该厂商也可能需要在正式发布前收集真实智能体任务的测试数据。有用户在评论区附和称相关猜测的合理性,但截至目前,聚合平台、该大厂或第三方评测机构均未给出能够将Ox Alpha与混元模型直接关联的证据。
第三类猜测指向海外头部大模型系列。Ox Alpha具备百万级上下文与原生图文视频输入的特性,很容易让人联想到海外头部大模型。有海外社交平台用户发帖猜测,这是披着神秘外衣的该系列模型,还有用户称在向模型询问身份时,得到了看似指向该系列的回复。但让模型自报家门并非可靠的鉴别方式,模型可能会从训练数据、系统提示或上下文信息中生成看似合理的身份回答,且不同的提问方式可能得到完全不同的结果。对于匿名发布的模型而言,提供方通常会主动隐藏相关信息,因此模型的自报身份并不能作为归属证据。仅从百万上下文与多模态输入的特性来看,海外头部大模型确实是候选之一,但这类能力已经在越来越多的新模型上出现,只能作为缩小范围的线索,而非最终答案。
第四类猜测指向国内智谱的最新模型。有用户通过测试数据分析猜测,Ox Alpha是GLM-5.3的变体,其在25组不同提示词测试中,原生Token数量与GLM-5.3完全匹配,同时支持图像输入;还有用户表示,在50/50对抗字符串测试中,Ox Alpha与GLM-5.3的分词器匹配度最高,而其他模型的匹配度仅为18%-22%,此外Ox Alpha还具备该系列罕见的API指纹特征。在国内知识社区中,也有用户猜测“这款模型的风格很像智谱,他们之前推出过Pony Alpha,现在又推出了Ox系列,刚好对应上了”。
匿名发布成为新的行业趋势
除了上述各类猜测外,还有网友表示,目前的局面显得有些荒诞:几乎所有准备推出新模型的厂商,都有可能被纳入Ox Alpha的身份猜测范围。过去,大模型的发布通常由厂商主导:先公开名称与技术报告,再展示基准测试成绩,最后向开发者开放API接口。用户在测试时清楚自己使用的是哪款模型,但也很容易受到品牌宣传信息的影响。
而匿名发布的模式则恰好相反:模型先以匿名形式接入平台,开发者在不知道品牌、参数与排行榜的情况下直接使用。提供方可以获得更贴近真实环境的用户评价,也能避免不成熟的预览版本影响正式品牌形象。如果模型表现出色,最终揭晓身份时还能再制造一轮传播热度;如果效果未达预期,则可以低调结束测试。
对该聚合平台而言,这种匿名发布机制也强化了其在模型产业链中的定位。它不再仅仅是汇总不同模型API的“路由中间层”,更可以成为模型厂商的公开试验场:通过统一的接口、真实的开发者群体、大量的智能体任务流量与完整的使用数据,为尚未正式发布的模型提供灰度测试环境。
Ox Alpha的匿名身份暂时遮住了厂商的名字,却暴露了行业正在变化的模型发布逻辑:下一代大模型可能不再先开发布会,而是先悄悄进入开发者的终端,运行一周、消耗数万亿Token,再带着真实的测试反馈正式亮相。至于这头神秘“金牛”背后究竟是国内厂商、海外大厂,还是尚未进入公众视野的新玩家,目前没有任何一种猜测得到证实。只有等匿名面具揭开的那一天,我们才能确认它究竟是一款真正的前沿旗舰模型,还是一次包装精心的匿名灰度测试。

