文章摘要
2026年8月20日,匿名AI模型OxAlpha悄然上线,免费开放一周,有100万token上下文窗口,支持多模态输入。它在编程测试中表现出色,上线首日登顶OpenRouter榜首。其开发者身份成谜,技术指纹指向智谱GLM系列,也有观点认为可能是谷歌Gemini新版或微软MAI模型。匿名测试是常见方法,该模型或带来新发布范式。

2026年8月20日,一款代号为神秘模型Ox Alpha引发猜谜的匿名AI模型悄然上线OpenRouter和OpenCode平台,免费开放一周,拥有100万token上下文窗口,支持文本、图片和视频多模态输入。它在DeepSWE编程测试中取得80%的通过率,碾压Claude Fable 5的65%和GPT-5.6 Sol的52%。上线首日即登顶OpenRouter榜首并刷新单日用量纪录。然而,模型的开发者身份至今成谜——技术指纹指向智谱GLM系列,谷歌DeepMind研究员发帖暗示其为Gemini新版,Reddit上还有观点认为它可能是微软未发布的MAI模型。三方均未正式认领,这场神秘模型Ox Alpha引发猜谜的风暴仍在持续发酵。

神秘模型Ox Alpha引发猜谜

一、横空出世:一头来历不明的“牛”

1.1 8月20日的突袭

2026年8月20日,全球最大的AI模型聚合平台OpenRouter没有举行任何发布会,没有发布任何技术报告,只用了一个忍者表情(stealth),就悄然上线了一款代号为“Ox Alpha”的匿名模型。Ox在英文中意为“公牛”,恰逢近期一部名为《牛来》的抽象电影梗火遍全网,国内网友很快给它起了一个更接地气的名字——“牛来”大模型。

同一天,开源AI编程助手平台OpenCode也同步上线了这款模型,宣布连续数天几乎不限量免费使用。

1.2 平台披露的有限信息

OpenRouter对神秘模型Ox Alpha引发猜谜的介绍极为简短:这是一款“面向高效编程、长时间Agent任务和真实生产环境的前沿模型”。除此之外,模型参数、训练数据、架构、基准成绩以及开发团队全部处于保密状态。

能够确认的信息包括:

  • 上下文窗口:1,048,576个token(约104.8万),最大输出长度131,072个token
  • 多模态输入:支持文本、图片和视频输入,但输出仅限文本
  • 工具调用:支持tool_choice和JSON格式的结构化输出
  • 免费策略:预览期间完全免费,输入输出均不收费
  • 服务容量:OpenCode声称每日可处理100万亿个token
  • 数据政策:零数据保留

OpenRouter明确表示,Ox Alpha并非平台自研,而是由一家“暂时保持匿名的第三方提供商”通过路由提供。这个“匿名”的身份设定,正是神秘模型Ox Alpha引发猜谜的根源所在。

1.3 迅速引爆全球开发者圈

上线数小时内,神秘模型Ox Alpha引发猜谜的火爆程度超出了所有人的预期。据证券时报报道,该模型上线首日即登上OpenRouter榜首,并刷新了平台单日模型用量历史纪录。仅Hermes、Claude Code等前五大入口的累计用量就已超过4万亿Token。

Stripe的CEO Patrick Collison上手测试后只留下四个字——“相当惊艳”(very impressive)。Hermes Agent的创始人更直言,Ox Alpha“超过了他们所有的内部评估标准”。OpenRouter、T3 Chat、Box的CEO也陆续跟进转发。一个没人知道是谁家的模型,硬生生把硅谷的半个科技圈大佬都卷进来亲自测试了一遍。

圈内人甚至给它起了个尊称——“牛模王”。

二、性能实测:一头能写代码的“牛”

2.1 DeepSWE基准测试:80%的惊艳首秀

神秘模型Ox Alpha引发猜谜的真正导火索,是它在代码能力上的惊人表现。

独立开发者Ben Davis(推特账号@davis7)从DeepSWE软件工程基准中抽取了10项任务进行测试。DeepSWE的测试方式与普通编程题截然不同——模型需要自行阅读完整的代码仓库、定位问题所在、动手修改代码、运行测试,再根据报错信息继续修复。它考察的是模型在真实软件工程场景中的Agent能力,而非简单的代码生成。

测试结果震惊了整个开发者社区:

模型 DeepSWE 10项任务通过率
Ox Alpha (匿名) 80%
Claude Fable 5 (max) 65%
GLM-5.3 (max) 62%
Grok 4.6 (xhigh) 62%
GPT-5.6 Sol (max) 52%

一个来历不明的匿名模型,在真实软件工程任务中碾压了Anthropic的Claude Fable 5、xAI的Grok 4.6和OpenAI的GPT-5.6 Sol——这本身就是一个足以撼动行业认知的结果。Ben Davis本人也表示,鉴于模型来源不明,这一结果令他“困惑不解”。

2.2 更多测试与跑分验证

除了DeepSWE,神秘模型Ox Alpha引发猜谜的热度还在其他基准测试中得到了印证。在第三方评测平台Kingbench上,Ox Alpha拿下了87.5分的成绩,仅次于GLM-5.3的91.25分。

不过,值得注意的是,DeepSWE的10项任务样本量毕竟有限。随后有其他开发者在另一组DeepSWE子集上测试,给出的结果约为63%。两次测试的任务范围和运行配置不完全相同,因此暂时无法据此确定Ox Alpha的准确排名。Ben Davis后来运行了完整的DeepSWE测试集,结果显示Ox Alpha的表现大致与GPT-5.6 Sol的中档版本持平,而非大幅领先。

尽管如此,初步测试已经充分证明,神秘模型Ox Alpha引发猜谜绝非浪得虚名——它确实具备接近头部模型的长程编码潜力。

2.3 实际应用中的表现

开发者们并没有满足于基准测试,而是直接把神秘模型Ox Alpha引发猜谜接入了真实的编码Agent工作流。

开发者Ziwen将Ox Alpha接入了Codex团队的工作流程。以前团队成员需要一个个挑选哪些文件重要再喂给模型,现在可以一股脑把整个代码仓库丢给它处理。这种大规模输入在付费模型上会产生高昂的成本,但Ox Alpha的免费策略让这种“奢侈”的工作方式变得可行。

Ivan Fioravanti用Hermes Agent配合Ox Alpha运行了一遍《青蛙过河》的游戏任务。结果模型自己“加起了戏”——路上多出几台横冲直撞的iPhone专门撞青蛙,还安排了几只苍蝇,吃到就加分。这种“超纲发挥”展示了模型在复杂任务中的创造力和自主性。

网友Hamza让Ox Alpha做一个介绍自己的网页。结果它一口气交了五版——机密档案风、美术馆策展风、奢侈品牌风轮着来,每一版都在拿自己的匿名身份玩梗。而另一位网友bishesha的要求只有一句“给我个黑洞”,成品出来后他直呼“杰作”。

2.4 性能总结

综合来看,神秘模型Ox Alpha引发猜谜在以下几个维度表现出色:

  • 代码能力:DeepSWE测试中达到80%通过率,超越多个主流模型
  • 长上下文处理:104.8万token的上下文窗口,足以容纳大型代码仓库
  • 多模态理解:支持文本、图片、视频三种输入形式
  • Agent能力:专为“持续性的Agent工作”设计,能够处理长周期软件工程任务
  • 工具调用:支持工具调用和结构化输出
  • 响应速度:中位首Token延迟约1.95秒,输出速度约每秒49个Token
  • 稳定性:最近三天可用率接近100%

OpenRouter将Ox Alpha定位为“frontier model”(前沿模型),尽管尚未公布公开的基准成绩来全面佐证这一说法。

三、身份谜团:全网展开“指纹追踪”

神秘模型Ox Alpha引发猜谜的核心谜题只有一个:它到底是谁家的?

自8月20日上线以来,AI社区展开了一场持续超过72小时的“指纹追踪”行动。开发者们从分词器(Tokenizer)、视频编码器、API报错信息、回答风格等多个维度对模型进行“数字DNA鉴定”。

3.1 智谱GLM说:五条证据链

目前流传最广、证据最充分的说法是:神秘模型Ox Alpha引发猜谜的背后,是国产AI公司智谱(Z.ai)尚未发布的GLM系列模型。独立研究员Ben Davis甚至给出了“99%确定”的判断。

支撑这一判断的证据包括:

证据一:文本分词器高度吻合

Tokenizer(分词器)负责将输入文本切分成模型能够处理的Token。不同模型家族往往采用不同的词表和切分逻辑,因此面对相同文本时,Token数量会留下稳定的“指纹”。

有测试者用25组不同的提示词对Ox Alpha和GLM-5.3进行比较,发现两者的Token数量始终保持一个固定的75个Token差值。这个差值恰好可以由模型外部附加的一段隐藏System Prompt来解释。在另一组测试中,同样一段混合了中英文、代码和Emoji的文本,GLM-5.3与GLM-5.2都计算出68个Token,Ox Alpha则显示143个。

开发者unclecode开发了一个名为modelprint的浏览器工具,通过向匿名API端点发送9项基础设施探测请求,将响应与已知模型进行匹配。结果显示,Ox Alpha在9项指标中有6项与GLM-5.3匹配,其中包括全部4项归一化的Tokenizer计数。没有其他实验室的最佳候选模型能在这4项中超过2项。

证据二:视频编码器特征一致

文本模型可以通过蒸馏、后训练或System Prompt模仿另一款模型的回答习惯,但视频编码和Token预算涉及多模态输入进入模型前的底层工程设计,很难刻意模仿。

有研究者专门制作了4段受控测试视频,分别交给Ox Alpha和多款多模态模型,观察系统为视频分配多少输入Token。结果显示,Ox Alpha和GLM-5V-Turbo在多项特征上出现了高度相似的Token预算。具体包括:视频帧率变化后采样策略基本不受影响、视频时长增加时Token消耗以约每秒147个Token的速度增长、每帧分辨率变化对应的Token缩放方式一致。在4段控制视频上,两者测出的额外Token预算甚至能够逐项对上。相比之下,MiMo、Qwen和GLM-4.6V等模型都呈现出明显不同的结果。

证据三:API报错信息雷同

社区有人故意给Ox Alpha传入异常参数,捕捉到了类似“[1210] The temperature parameter is illegal”的错误信息。这种错误码、参数限制以及中英文混排的返回方式,被认为与智谱相关服务存在高度相似度。

证据四:行为特征接近

Ox Alpha拒绝处理音频输入,这与GLM-5V的路由方式相同。此外,模型的回答风格、Agent执行步数和推理接口也被认为与GLM系列非常接近。

证据五:历史操作先例

智谱此前就曾用“Pony Alpha”的匿名代号在OpenRouter上测试过GLM-5模型。这种“挂马甲”测试的做法已经成为智谱的惯用操作。

综合以上五条证据链,社区普遍认为神秘模型Ox Alpha引发猜谜极大概率是智谱尚未发布的GLM-5.3视觉版(或GLM-5.5)。

3.2 谷歌Gemini说:DeepMind研究员下场“认领”

就在社区热火朝天地进行指纹追踪时,谷歌方面上演了一出令人啼笑皆非的“认领”大戏。

DeepMind研究员Evan Otero先发了一个词——“Gemini”。过了一会儿又补了一句:“万一Ox Alpha就是我们一路遇到的朋友呢?”。紧接着,同在DeepMind的Vamsi Batchu也跟了一句:“谷歌回来了,相信流程。”。

这番阴阳怪气的暗示,效果却适得其反——谷歌被全网笑惨了。一条高赞评论堪称封神:“GLM等于Google Language Model”。就这一句,够谷歌喝一壶了。

不过,也有观察者指出,谷歌的Gemini 3.5 Pro迟迟没有正式露面,DeepMind研究员的发言或许并非完全是玩笑。但截至目前,没有任何实质性证据将神秘模型Ox Alpha引发猜谜与谷歌联系起来。

3.3 小米MiMo说:猜测逐渐走弱

另一个曾被广泛讨论的猜测是:神秘模型Ox Alpha引发猜谜可能来自小米的MiMo团队。

支持这一猜测的理由是:小米此前在发布MiMo V2 Pro之前,就曾在OpenRouter上以“Hunter Alpha”的名义进行匿名测试。小米CFO林世辉近期也透露即将推出全新的MiMo模型。

然而,随着社区对Tokenizer指纹的深入分析,小米说的证据正在走弱。有分析指出,Ox Alpha的分词器特征与MiMo系列对不上。在视频编码器的对比测试中,MiMo也呈现出与Ox Alpha明显不同的结果。

3.4 微软MAI说:Reddit上的另一条线索

在Reddit上,出现了另一派观点:神秘模型Ox Alpha引发猜谜可能是微软未发布的MAI模型的一个版本。

这一说法的来源是,Wccftech在最初报道时认为迹象指向GLM,但在更新文章后表示,Ox Alpha可能是微软MAI模型的一个未发布版本。Reddit上的讨论也呈现两极分化——有帖子断言Ox Alpha“不可能是中国团队的作品”,而另一篇帖子则表达了“高度自信”,认定其确实源自中国。

不过,MAI说目前缺乏像智谱说那样具体的技术证据链支撑,更多停留在猜测层面。

3.5 指纹追踪的方法论思考

在讨论神秘模型Ox Alpha引发猜谜的身份时,有一个值得注意的方法论问题。正如modelprint工具的开发者unclecode在其项目文档中所指出的:“匹配指纹证明的是共享的基础设施,而非身份”。同一个实验室可以在相同的技术栈上运行两个不同的模型。

换句话说,即使Ox Alpha的所有技术指纹都与GLM-5.3高度吻合,也只能说明它们可能运行在相似的技术架构上,而不能100%确定就是同一家公司的产品——尽管在实践中,这种吻合度已经让绝大多数社区成员相信了智谱说的真实性。

截至2026年8月24日,神秘模型Ox Alpha引发猜谜的真相仍未揭晓。OpenRouter没有公布提供者信息,智谱没有确认,谷歌没有承认,小米没有回应。谜底或许要等到8月28日——智谱计划在这一天正式开源GLM-5.3的权重——才能最终揭晓。

四、行业视角:匿名测试的底层逻辑

4.1 为什么AI公司喜欢“挂马甲”?

神秘模型Ox Alpha引发猜谜并非孤例。在此之前,智谱用“Pony Alpha”测试过GLM-5,DeepSeek用“Hunter Alpha”测试过V4。匿名上架已经成为AI公司测试新模型的常见方法。

这种做法有几个核心目的:

消除品牌偏见:开发者在不知道品牌的情况下进行测试,可以更客观地比较模型能力,减少先入为主的判断。

收集真实反馈:匿名模型可以获得最真实的用户流量、错误率和反应数据,而不是在品牌光环下获得的“宽容”评价。

压力测试基础设施:像OpenCode声称的“每日100万亿Token”服务容量,只有在真实的大规模用户负载下才能得到验证。这种规模的免费测试,本质上是一次全量级的“公测”。

制造悬念和热度:不可否认,神秘模型Ox Alpha引发猜谜本身就是一场极其成功的营销。一个匿名模型,零预算,仅靠社区的自发讨论和猜测,就在全球范围内获得了数以亿计的曝光。

4.2 匿名模型的信任成本

然而,匿名也带来了不可忽视的风险。

开发者不知道服务的提供者是谁、数据保存政策如何、模型是否会更新、免费期结束后会发生什么。正如澳门力报所提醒的:开发者不宜把商业机密、未公开代码或个人数据直接输入匿名模型。免费并不代表没有成本。

OpenRouter的角色是把不同供应商的模型接入同一接口,方便用户比较。但平台出现匿名模型,也使得身份推测和跑分宣传混在了一起。若模型最终正式发布,供应商仍需公布名称、版本、价格和技术文件,外界才能核实限免版本是否与正式版本一致。

4.3 对全球AI竞争格局的启示

神秘模型Ox Alpha引发猜谜事件折射出一个更深层的行业趋势:AI模型的能力差距正在快速缩小。

一个匿名模型,在没有任何品牌背书的情况下,仅凭真实能力就在DeepSWE上超越了Claude Fable 5和GPT-5.6 Sol。这意味着什么?意味着头部模型的“护城河”可能没有想象中那么宽。

Ox Alpha如果是智谱的GLM-5.3视觉版,那它代表的是中国AI公司在多模态和代码Agent方向上的最新进展。考虑到GLM-5.3在8月14日才刚刚发布纯文本版本,视觉版这么快就进入匿名测试阶段,其迭代速度令人侧目。

如果是小米的MiMo或微软的MAI,同样说明AI模型的军备竞赛正在以前所未有的速度推进。

4.4 独到见解:能力趋同时代的品牌价值重构

神秘模型Ox Alpha引发猜谜揭示了一个正在发生但尚未被充分讨论的变化:当AI模型的能力逐渐趋同时,品牌的含金量正在被重新定义。

在过去,模型的能力本身就是最大的品牌资产——GPT-4就是OpenAI,Claude就是Anthropic。但当Ox Alpha这样的匿名模型可以在盲测中击败知名产品时,一个根本性的问题被摆上了台面:如果用户分辨不出是谁家的模型更好用,那品牌还有什么意义?

这正是神秘模型Ox Alpha引发猜谜事件最值得深思的地方。Ox Alpha的匿名策略让整个行业暂时进入了一个“能力本位”的真空状态——没有品牌光环,没有营销话术,只有一个赤裸裸的问题:这模型到底行不行?

而答案,似乎是肯定的。

从这个角度看,神秘模型Ox Alpha引发猜谜可能预示着一个新趋势的到来:在AI能力日益同质化的未来,差异化将不再来自“谁家模型参数更多”,而是来自“谁能以更低的成本、更快的速度、更优的体验将能力交付给用户”。匿名测试之所以有效,恰恰因为它剥除了所有品牌噪音,让能力本身成为唯一的评判标准。

五、各方反应与时间线

5.1 关键时间节点

日期 事件
2026年8月14日 智谱正式发布GLM-5.3纯文本版本
2026年8月20日 Ox Alpha在OpenRouter和OpenCode匿名上线
2026年8月20-21日 Ben Davis发布DeepSWE测试结果(80%通过率),引爆社区关注
2026年8月21日 Ox Alpha登顶OpenRouter榜首,刷新单日用量纪录
2026年8月22日 社区发布Tokenizer和视频编码器指纹分析报告
2026年8月23日 谷歌DeepMind研究员发帖暗示Gemini
2026年8月24日 全网讨论达到峰值,三方均未正式认领
2026年8月27日前后 OpenCode承诺的一周免费期结束
2026年8月28日 智谱计划开源GLM-5.3权重

5.2 行业大佬的实测反馈

神秘模型Ox Alpha引发猜谜的实测反馈来自多个重量级人物:

  • Stripe CEO Patrick Collison:“相当惊艳”
  • Hermes Agent创始人:“超过了他们所有的内部评估标准”
  • OpenRouter、T3 Chat、Box的CEO:陆续跟进转发
  • DeepSWE一作Wenqi Huang:第一时间将模型拉去跑自家测试
  • Ben Davis:认为Ox Alpha的语音能力比Claude和GPT都好得多,代码质量不错,很能听懂开发者到底想要什么

5.3 中文社区的独特文化反应

神秘模型Ox Alpha引发猜谜在中文社区引发了独特的文化共鸣。“牛来”这个昵称本身就带有双重意味——既是Ox的字面翻译,又借了近期热门电影《牛来》的梗。圈内人给它起的“牛模王”绰号,更是将这种幽默感推向了高潮。

与此同时,中文社区在身份追踪方面的“侦探式”参与也格外活跃。从Tokenizer分析到视频编码比对,再到API报错信息捕捉,中文开发者贡献了大部分技术取证工作。这种“全民破案”的参与感,本身就是神秘模型Ox Alpha引发猜谜能够持续发酵的重要原因。

六、展望:谜底揭晓之后

6.1 如果真的是智谱

如果神秘模型Ox Alpha引发猜谜最终被证实是智谱的GLM-5.3视觉版或GLM-5.5,这将意味着:

第一,智谱在多模态和代码Agent方向上的进展超出市场预期。GLM-5.3纯文本版本8月14日才发布,视觉版这么快就能在匿名测试中达到超越Claude和GPT的水平。

第二,中国AI公司在编程和Agent领域的竞争力正在快速逼近甚至在某些维度超越美国头部产品。这对于全球AI竞争格局而言,是一个重要的信号。

第三,8月28日的GLM-5.3权重开源将成为检验Ox Alpha真实身份的关键节点。如果开源版本的能力与Ox Alpha高度一致,那谜底就将彻底揭晓。

6.2 如果是其他厂商

如果是小米的MiMo,那意味着消费电子巨头在AI大模型领域的投入已经进入了收获期。

如果是微软的MAI,那意味着科技巨头正在以更隐秘的方式测试下一代模型。

无论最终答案是什么,神秘模型Ox Alpha引发猜谜事件本身已经成为一个行业标志性事件——它证明了在AI领域,“谁家的”正在变得不那么重要,而“能不能打”才是唯一的标准。

6.3 匿名测试模式会流行吗?

神秘模型Ox Alpha引发猜谜的成功,可能会鼓励更多AI公司采用匿名测试策略。但这种模式能否被大规模复制,取决于几个条件:

算力门槛:每日100万亿Token的服务容量,不是所有AI公司都能负担的。

信任成本:匿名模型的使用风险决定了它很难在核心业务场景中被采用。

营销窗口:匿名带来的悬念效应是一次性的,频繁使用会失去新鲜感。

但无论如何,神秘模型Ox Alpha引发猜谜已经为行业提供了一个全新的产品发布范式——有时候,不说是谁,反而比大声宣布更有力量。

常见问题(FAQ)

问:Ox Alpha到底是什么?

Ox Alpha是2026年8月20日在OpenRouter和OpenCode平台上匿名上线的一款AI模型。它拥有100万Token的上下文窗口,支持文本、图片和视频输入,专为编程、长周期Agent任务和复杂推理设计。目前免费开放,但开发者身份不明。

问:Ox Alpha的性能到底有多强?

在DeepSWE软件工程基准的10项任务测试中,Ox Alpha取得了80%的通过率,高于Claude Fable 5的65%、GLM-5.3的62%、Grok 4.6的62%和GPT-5.6 Sol的52%。在Kingbench上获得了87.5分。不过测试样本有限,完整排名尚待更多验证。

问:Ox Alpha到底是谁家的模型?

目前有三种主要猜测:技术指纹最强烈地指向智谱(Z.ai)的GLM-5.3视觉版或GLM-5.5;谷歌DeepMind研究员发帖暗示可能是Gemini;也有说法认为可能是微软未发布的MAI模型。截至8月24日,三方均未正式认领。

问:为什么说Ox Alpha是智谱的?

社区找到了五条证据:文本Tokenizer与GLM-5.3高度吻合(固定75个Token差值)、视频编码器与GLM-5V-Turbo完全一致、API报错信息相似、拒绝音频输入的行为一致、以及智谱曾用“Pony Alpha”匿名测试GLM-5的先例。Ben Davis称“99%确定”。

问:Ox Alpha免费到什么时候?

OpenRouter的免费通道到8月24日(周一)。OpenCode的公告承诺从8月20日起免费一周,大约到8月27日。

问:每日100万亿Token是什么概念?

这大约是Visa公司一个月使用的AI Token总量的100倍。这个数字主要反映了提供商的服务器容量,而非实际使用量——但足以说明背后算力规模之大。

问:普通开发者能用Ox Alpha做什么?

目前主要是编程和Agent相关任务——代码补全、代码仓库理解、Bug修复、自动化软件开发流程等。也可以用于需要长上下文或多模态输入(图文视频)的复杂推理任务。

问:使用匿名模型有风险吗?

有。开发者不知道服务提供者是谁、数据保存政策如何、模型是否会更新。不建议将商业机密、未公开代码或个人信息输入匿名模型。

以上内容不代表本平台立场,仅供读者参考