神秘模型Ox Alpha引发猜谜,免费AI牛来到底是谁家的?

2026年8月20日,一款代号为神秘模型Ox Alpha引发猜谜的匿名AI模型悄然上线OpenRouter和OpenCode平台,免费开放一周,拥有100万token上下文窗口,支持文本、图片和视频多模态输入。它在DeepSWE编程测试中取得80%的通过率,碾压Claude Fable 5的65%和GPT-5.6 Sol的52%。上线首日即登顶OpenRouter榜首并刷新单日用量纪录。然而,模型的开发者身份至今成谜——技术指纹指向智谱GLM系列,谷歌DeepMind研究员发帖暗示其为Gemini新版,Reddit上还有观点认为它可能是微软未发布的MAI模型。三方均未正式认领,这场神秘模型Ox Alpha引发猜谜的风暴仍在持续发酵。

一、横空出世:一头来历不明的“牛”
1.1 8月20日的突袭
2026年8月20日,全球最大的AI模型聚合平台OpenRouter没有举行任何发布会,没有发布任何技术报告,只用了一个忍者表情(stealth),就悄然上线了一款代号为“Ox Alpha”的匿名模型。Ox在英文中意为“公牛”,恰逢近期一部名为《牛来》的抽象电影梗火遍全网,国内网友很快给它起了一个更接地气的名字——“牛来”大模型。
同一天,开源AI编程助手平台OpenCode也同步上线了这款模型,宣布连续数天几乎不限量免费使用。
1.2 平台披露的有限信息
OpenRouter对神秘模型Ox Alpha引发猜谜的介绍极为简短:这是一款“面向高效编程、长时间Agent任务和真实生产环境的前沿模型”。除此之外,模型参数、训练数据、架构、基准成绩以及开发团队全部处于保密状态。
能够确认的信息包括:
- 上下文窗口:1,048,576个token(约104.8万),最大输出长度131,072个token
- 多模态输入:支持文本、图片和视频输入,但输出仅限文本
- 工具调用:支持tool_choice和JSON格式的结构化输出
- 免费策略:预览期间完全免费,输入输出均不收费
- 服务容量:OpenCode声称每日可处理100万亿个token
- 数据政策:零数据保留
OpenRouter明确表示,Ox Alpha并非平台自研,而是由一家“暂时保持匿名的第三方提供商”通过路由提供。这个“匿名”的身份设定,正是神秘模型Ox Alpha引发猜谜的根源所在。
1.3 迅速引爆全球开发者圈
上线数小时内,神秘模型Ox Alpha引发猜谜的火爆程度超出了所有人的预期。据证券时报报道,该模型上线首日即登上OpenRouter榜首,并刷新了平台单日模型用量历史纪录。仅Hermes、Claude Code等前五大入口的累计用量就已超过4万亿Token。
Stripe的CEO Patrick Collison上手测试后只留下四个字——“相当惊艳”(very impressive)。Hermes Agent的创始人更直言,Ox Alpha“超过了他们所有的内部评估标准”。OpenRouter、T3 Chat、Box的CEO也陆续跟进转发。一个没人知道是谁家的模型,硬生生把硅谷的半个科技圈大佬都卷进来亲自测试了一遍。
圈内人甚至给它起了个尊称——“牛模王”。
二、性能实测:一头能写代码的“牛”
2.1 DeepSWE基准测试:80%的惊艳首秀
神秘模型Ox Alpha引发猜谜的真正导火索,是它在代码能力上的惊人表现。
独立开发者Ben Davis(推特账号@davis7)从DeepSWE软件工程基准中抽取了10项任务进行测试。DeepSWE的测试方式与普通编程题截然不同——模型需要自行阅读完整的代码仓库、定位问题所在、动手修改代码、运行测试,再根据报错信息继续修复。它考察的是模型在真实软件工程场景中的Agent能力,而非简单的代码生成。
测试结果震惊了整个开发者社区:
| 模型 | DeepSWE 10项任务通过率 |
|---|---|
| Ox Alpha (匿名) | 80% |
| Claude Fable 5 (max) | 65% |
| GLM-5.3 (max) | 62% |
| Grok 4.6 (xhigh) | 62% |
| GPT-5.6 Sol (max) | 52% |
一个来历不明的匿名模型,在真实软件工程任务中碾压了Anthropic的Claude Fable 5、xAI的Grok 4.6和OpenAI的GPT-5.6 Sol——这本身就是一个足以撼动行业认知的结果。Ben Davis本人也表示,鉴于模型来源不明,这一结果令他“困惑不解”。
2.2 更多测试与跑分验证
除了DeepSWE,神秘模型Ox Alpha引发猜谜的热度还在其他基准测试中得到了印证。在第三方评测平台Kingbench上,Ox Alpha拿下了87.5分的成绩,仅次于GLM-5.3的91.25分。
不过,值得注意的是,DeepSWE的10项任务样本量毕竟有限。随后有其他开发者在另一组DeepSWE子集上测试,给出的结果约为63%。两次测试的任务范围和运行配置不完全相同,因此暂时无法据此确定Ox Alpha的准确排名。Ben Davis后来运行了完整的DeepSWE测试集,结果显示Ox Alpha的表现大致与GPT-5.6 Sol的中档版本持平,而非大幅领先。
尽管如此,初步测试已经充分证明,神秘模型Ox Alpha引发猜谜绝非浪得虚名——它确实具备接近头部模型的长程编码潜力。
2.3 实际应用中的表现
开发者们并没有满足于基准测试,而是直接把神秘模型Ox Alpha引发猜谜接入了真实的编码Agent工作流。
开发者Ziwen将Ox Alpha接入了Codex团队的工作流程。以前团队成员需要一个个挑选哪些文件重要再喂给模型,现在可以一股脑把整个代码仓库丢给它处理。这种大规模输入在付费模型上会产生高昂的成本,但Ox Alpha的免费策略让这种“奢侈”的工作方式变得可行。
Ivan Fioravanti用Hermes Agent配合Ox Alpha运行了一遍《青蛙过河》的游戏任务。结果模型自己“加起了戏”——路上多出几台横冲直撞的iPhone专门撞青蛙,还安排了几只苍蝇,吃到就加分。这种“超纲发挥”展示了模型在复杂任务中的创造力和自主性。
网友Hamza让Ox Alpha做一个介绍自己的网页。结果它一口气交了五版——机密档案风、美术馆策展风、奢侈品牌风轮着来,每一版都在拿自己的匿名身份玩梗。而另一位网友bishesha的要求只有一句“给我个黑洞”,成品出来后他直呼“杰作”。
2.4 性能总结
综合来看,神秘模型Ox Alpha引发猜谜在以下几个维度表现出色:
- 代码能力:DeepSWE测试中达到80%通过率,超越多个主流模型
- 长上下文处理:104.8万token的上下文窗口,足以容纳大型代码仓库
- 多模态理解:支持文本、图片、视频三种输入形式
- Agent能力:专为“持续性的Agent工作”设计,能够处理长周期软件工程任务
- 工具调用:支持工具调用和结构化输出
- 响应速度:中位首Token延迟约1.95秒,输出速度约每秒49个Token
- 稳定性:最近三天可用率接近100%
OpenRouter将Ox Alpha定位为“frontier model”(前沿模型),尽管尚未公布公开的基准成绩来全面佐证这一说法。
三、身份谜团:全网展开“指纹追踪”
神秘模型Ox Alpha引发猜谜的核心谜题只有一个:它到底是谁家的?
自8月20日上线以来,AI社区展开了一场持续超过72小时的“指纹追踪”行动。开发者们从分词器(Tokenizer)、视频编码器、API报错信息、回答风格等多个维度对模型进行“数字DNA鉴定”。
3.1 智谱GLM说:五条证据链
目前流传最广、证据最充分的说法是:神秘模型Ox Alpha引发猜谜的背后,是国产AI公司智谱(Z.ai)尚未发布的GLM系列模型。独立研究员Ben Davis甚至给出了“99%确定”的判断。
支撑这一判断的证据包括:
证据一:文本分词器高度吻合
Tokenizer(分词器)负责将输入文本切分成模型能够处理的Token。不同模型家族往往采用不同的词表和切分逻辑,因此面对相同文本时,Token数量会留下稳定的“指纹”。
有测试者用25组不同的提示词对Ox Alpha和GLM-5.3进行比较,发现两者的Token数量始终保持一个固定的75个Token差值。这个差值恰好可以由模型外部附加的一段隐藏System Prompt来解释。在另一组测试中,同样一段混合了中英文、代码和Emoji的文本,GLM-5.3与GLM-5.2都计算出68个Token,Ox Alpha则显示143个。
开发者unclecode开发了一个名为modelprint的浏览器工具,通过向匿名API端点发送9项基础设施探测请求,将响应与已知模型进行匹配。结果显示,Ox Alpha在9项指标中有6项与GLM-5.3匹配,其中包括全部4项归一化的Tokenizer计数。没有其他实验室的最佳候选模型能在这4项中超过2项。
证据二:视频编码器特征一致
文本模型可以通过蒸馏、后训练或System Prompt模仿另一款模型的回答习惯,但视频编码和Token预算涉及多模态输入进入模型前的底层工程设计,很难刻意模仿。
有研究者专门制作了4段受控测试视频,分别交给Ox Alpha和多款多模态模型,观察系统为视频分配多少输入Token。结果显示,Ox Alpha和GLM-5V-Turbo在多项特征上出现了高度相似的Token预算。具体包括:视频帧率变化后采样策略基本不受影响、视频时长增加时Token消耗以约每秒147个Token的速度增长、每帧分辨率变化对应的Token缩放方式一致。在4段控制视频上,两者测出的额外Token预算甚至能够逐项对上。相比之下,MiMo、Qwen和GLM-4.6V等模型都呈现出明显不同的结果。
证据三:API报错信息雷同
社区有人故意给Ox Alpha传入异常参数,捕捉到了类似“[1210] The temperature parameter is illegal”的错误信息。这种错误码、参数限制以及中英文混排的返回方式,被认为与智谱相关服务存在高度相似度。
证据四:行为特征接近
Ox Alpha拒绝处理音频输入,这与GLM-5V的路由方式相同。此外,模型的回答风格、Agent执行步数和推理接口也被认为与GLM系列非常接近。
证据五:历史操作先例
智谱此前就曾用“Pony Alpha”的匿名代号在OpenRouter上测试过GLM-5模型。这种“挂马甲”测试的做法已经成为智谱的惯用操作。
综合以上五条证据链,社区普遍认为神秘模型Ox Alpha引发猜谜极大概率是智谱尚未发布的GLM-5.3视觉版(或GLM-5.5)。
3.2 谷歌Gemini说:DeepMind研究员下场“认领”
就在社区热火朝天地进行指纹追踪时,谷歌方面上演了一出令人啼笑皆非的“认领”大戏。
DeepMind研究员Evan Otero先发了一个词——“Gemini”。过了一会儿又补了一句:“万一Ox Alpha就是我们一路遇到的朋友呢?”。紧接着,同在DeepMind的Vamsi Batchu也跟了一句:“谷歌回来了,相信流程。”。
这番阴阳怪气的暗示,效果却适得其反——谷歌被全网笑惨了。一条高赞评论堪称封神:“GLM等于Google Language Model”。就这一句,够谷歌喝一壶了。
不过,也有观察者指出,谷歌的Gemini 3.5 Pro迟迟没有正式露面,DeepMind研究员的发言或许并非完全是玩笑。但截至目前,没有任何实质性证据将神秘模型Ox Alpha引发猜谜与谷歌联系起来。
3.3 小米MiMo说:猜测逐渐走弱
另一个曾被广泛讨论的猜测是:神秘模型Ox Alpha引发猜谜可能来自小米的MiMo团队。
支持这一猜测的理由是:小米此前在发布MiMo V2 Pro之前,就曾在OpenRouter上以“Hunter Alpha”的名义进行匿名测试。小米CFO林世辉近期也透露即将推出全新的MiMo模型。
然而,随着社区对Tokenizer指纹的深入分析,小米说的证据正在走弱。有分析指出,Ox Alpha的分词器特征与MiMo系列对不上。在视频编码器的对比测试中,MiMo也呈现出与Ox Alpha明显不同的结果。
3.4 微软MAI说:Reddit上的另一条线索
在Reddit上,出现了另一派观点:神秘模型Ox Alpha引发猜谜可能是微软未发布的MAI模型的一个版本。
这一说法的来源是,Wccftech在最初报道时认为迹象指向GLM,但在更新文章后表示,Ox Alpha可能是微软MAI模型的一个未发布版本。Reddit上的讨论也呈现两极分化——有帖子断言Ox Alpha“不可能是中国团队的作品”,而另一篇帖子则表达了“高度自信”,认定其确实源自中国。
不过,MAI说目前缺乏像智谱说那样具体的技术证据链支撑,更多停留在猜测层面。
3.5 指纹追踪的方法论思考
在讨论神秘模型Ox Alpha引发猜谜的身份时,有一个值得注意的方法论问题。正如modelprint工具的开发者unclecode在其项目文档中所指出的:“匹配指纹证明的是共享的基础设施,而非身份”。同一个实验室可以在相同的技术栈上运行两个不同的模型。
换句话说,即使Ox Alpha的所有技术指纹都与GLM-5.3高度吻合,也只能说明它们可能运行在相似的技术架构上,而不能100%确定就是同一家公司的产品——尽管在实践中,这种吻合度已经让绝大多数社区成员相信了智谱说的真实性。
截至2026年8月24日,神秘模型Ox Alpha引发猜谜的真相仍未揭晓。OpenRouter没有公布提供者信息,智谱没有确认,谷歌没有承认,小米没有回应。谜底或许要等到8月28日——智谱计划在这一天正式开源GLM-5.3的权重——才能最终揭晓。
四、行业视角:匿名测试的底层逻辑
4.1 为什么AI公司喜欢“挂马甲”?
神秘模型Ox Alpha引发猜谜并非孤例。在此之前,智谱用“Pony Alpha”测试过GLM-5,DeepSeek用“Hunter Alpha”测试过V4。匿名上架已经成为AI公司测试新模型的常见方法。
这种做法有几个核心目的:
消除品牌偏见:开发者在不知道品牌的情况下进行测试,可以更客观地比较模型能力,减少先入为主的判断。
收集真实反馈:匿名模型可以获得最真实的用户流量、错误率和反应数据,而不是在品牌光环下获得的“宽容”评价。
压力测试基础设施:像OpenCode声称的“每日100万亿Token”服务容量,只有在真实的大规模用户负载下才能得到验证。这种规模的免费测试,本质上是一次全量级的“公测”。
制造悬念和热度:不可否认,神秘模型Ox Alpha引发猜谜本身就是一场极其成功的营销。一个匿名模型,零预算,仅靠社区的自发讨论和猜测,就在全球范围内获得了数以亿计的曝光。
4.2 匿名模型的信任成本
然而,匿名也带来了不可忽视的风险。
开发者不知道服务的提供者是谁、数据保存政策如何、模型是否会更新、免费期结束后会发生什么。正如澳门力报所提醒的:开发者不宜把商业机密、未公开代码或个人数据直接输入匿名模型。免费并不代表没有成本。
OpenRouter的角色是把不同供应商的模型接入同一接口,方便用户比较。但平台出现匿名模型,也使得身份推测和跑分宣传混在了一起。若模型最终正式发布,供应商仍需公布名称、版本、价格和技术文件,外界才能核实限免版本是否与正式版本一致。
4.3 对全球AI竞争格局的启示
神秘模型Ox Alpha引发猜谜事件折射出一个更深层的行业趋势:AI模型的能力差距正在快速缩小。
一个匿名模型,在没有任何品牌背书的情况下,仅凭真实能力就在DeepSWE上超越了Claude Fable 5和GPT-5.6 Sol。这意味着什么?意味着头部模型的“护城河”可能没有想象中那么宽。
Ox Alpha如果是智谱的GLM-5.3视觉版,那它代表的是中国AI公司在多模态和代码Agent方向上的最新进展。考虑到GLM-5.3在8月14日才刚刚发布纯文本版本,视觉版这么快就进入匿名测试阶段,其迭代速度令人侧目。
如果是小米的MiMo或微软的MAI,同样说明AI模型的军备竞赛正在以前所未有的速度推进。
4.4 独到见解:能力趋同时代的品牌价值重构
神秘模型Ox Alpha引发猜谜揭示了一个正在发生但尚未被充分讨论的变化:当AI模型的能力逐渐趋同时,品牌的含金量正在被重新定义。
在过去,模型的能力本身就是最大的品牌资产——GPT-4就是OpenAI,Claude就是Anthropic。但当Ox Alpha这样的匿名模型可以在盲测中击败知名产品时,一个根本性的问题被摆上了台面:如果用户分辨不出是谁家的模型更好用,那品牌还有什么意义?
这正是神秘模型Ox Alpha引发猜谜事件最值得深思的地方。Ox Alpha的匿名策略让整个行业暂时进入了一个“能力本位”的真空状态——没有品牌光环,没有营销话术,只有一个赤裸裸的问题:这模型到底行不行?
而答案,似乎是肯定的。
从这个角度看,神秘模型Ox Alpha引发猜谜可能预示着一个新趋势的到来:在AI能力日益同质化的未来,差异化将不再来自“谁家模型参数更多”,而是来自“谁能以更低的成本、更快的速度、更优的体验将能力交付给用户”。匿名测试之所以有效,恰恰因为它剥除了所有品牌噪音,让能力本身成为唯一的评判标准。
五、各方反应与时间线
5.1 关键时间节点
| 日期 | 事件 |
|---|---|
| 2026年8月14日 | 智谱正式发布GLM-5.3纯文本版本 |
| 2026年8月20日 | Ox Alpha在OpenRouter和OpenCode匿名上线 |
| 2026年8月20-21日 | Ben Davis发布DeepSWE测试结果(80%通过率),引爆社区关注 |
| 2026年8月21日 | Ox Alpha登顶OpenRouter榜首,刷新单日用量纪录 |
| 2026年8月22日 | 社区发布Tokenizer和视频编码器指纹分析报告 |
| 2026年8月23日 | 谷歌DeepMind研究员发帖暗示Gemini |
| 2026年8月24日 | 全网讨论达到峰值,三方均未正式认领 |
| 2026年8月27日前后 | OpenCode承诺的一周免费期结束 |
| 2026年8月28日 | 智谱计划开源GLM-5.3权重 |
5.2 行业大佬的实测反馈
神秘模型Ox Alpha引发猜谜的实测反馈来自多个重量级人物:
- Stripe CEO Patrick Collison:“相当惊艳”
- Hermes Agent创始人:“超过了他们所有的内部评估标准”
- OpenRouter、T3 Chat、Box的CEO:陆续跟进转发
- DeepSWE一作Wenqi Huang:第一时间将模型拉去跑自家测试
- Ben Davis:认为Ox Alpha的语音能力比Claude和GPT都好得多,代码质量不错,很能听懂开发者到底想要什么
5.3 中文社区的独特文化反应
神秘模型Ox Alpha引发猜谜在中文社区引发了独特的文化共鸣。“牛来”这个昵称本身就带有双重意味——既是Ox的字面翻译,又借了近期热门电影《牛来》的梗。圈内人给它起的“牛模王”绰号,更是将这种幽默感推向了高潮。
与此同时,中文社区在身份追踪方面的“侦探式”参与也格外活跃。从Tokenizer分析到视频编码比对,再到API报错信息捕捉,中文开发者贡献了大部分技术取证工作。这种“全民破案”的参与感,本身就是神秘模型Ox Alpha引发猜谜能够持续发酵的重要原因。
六、展望:谜底揭晓之后
6.1 如果真的是智谱
如果神秘模型Ox Alpha引发猜谜最终被证实是智谱的GLM-5.3视觉版或GLM-5.5,这将意味着:
第一,智谱在多模态和代码Agent方向上的进展超出市场预期。GLM-5.3纯文本版本8月14日才发布,视觉版这么快就能在匿名测试中达到超越Claude和GPT的水平。
第二,中国AI公司在编程和Agent领域的竞争力正在快速逼近甚至在某些维度超越美国头部产品。这对于全球AI竞争格局而言,是一个重要的信号。
第三,8月28日的GLM-5.3权重开源将成为检验Ox Alpha真实身份的关键节点。如果开源版本的能力与Ox Alpha高度一致,那谜底就将彻底揭晓。
6.2 如果是其他厂商
如果是小米的MiMo,那意味着消费电子巨头在AI大模型领域的投入已经进入了收获期。
如果是微软的MAI,那意味着科技巨头正在以更隐秘的方式测试下一代模型。
无论最终答案是什么,神秘模型Ox Alpha引发猜谜事件本身已经成为一个行业标志性事件——它证明了在AI领域,“谁家的”正在变得不那么重要,而“能不能打”才是唯一的标准。
6.3 匿名测试模式会流行吗?
神秘模型Ox Alpha引发猜谜的成功,可能会鼓励更多AI公司采用匿名测试策略。但这种模式能否被大规模复制,取决于几个条件:
算力门槛:每日100万亿Token的服务容量,不是所有AI公司都能负担的。
信任成本:匿名模型的使用风险决定了它很难在核心业务场景中被采用。
营销窗口:匿名带来的悬念效应是一次性的,频繁使用会失去新鲜感。
但无论如何,神秘模型Ox Alpha引发猜谜已经为行业提供了一个全新的产品发布范式——有时候,不说是谁,反而比大声宣布更有力量。
常见问题(FAQ)
问:Ox Alpha到底是什么?
Ox Alpha是2026年8月20日在OpenRouter和OpenCode平台上匿名上线的一款AI模型。它拥有100万Token的上下文窗口,支持文本、图片和视频输入,专为编程、长周期Agent任务和复杂推理设计。目前免费开放,但开发者身份不明。
问:Ox Alpha的性能到底有多强?
在DeepSWE软件工程基准的10项任务测试中,Ox Alpha取得了80%的通过率,高于Claude Fable 5的65%、GLM-5.3的62%、Grok 4.6的62%和GPT-5.6 Sol的52%。在Kingbench上获得了87.5分。不过测试样本有限,完整排名尚待更多验证。
问:Ox Alpha到底是谁家的模型?
目前有三种主要猜测:技术指纹最强烈地指向智谱(Z.ai)的GLM-5.3视觉版或GLM-5.5;谷歌DeepMind研究员发帖暗示可能是Gemini;也有说法认为可能是微软未发布的MAI模型。截至8月24日,三方均未正式认领。
问:为什么说Ox Alpha是智谱的?
社区找到了五条证据:文本Tokenizer与GLM-5.3高度吻合(固定75个Token差值)、视频编码器与GLM-5V-Turbo完全一致、API报错信息相似、拒绝音频输入的行为一致、以及智谱曾用“Pony Alpha”匿名测试GLM-5的先例。Ben Davis称“99%确定”。
问:Ox Alpha免费到什么时候?
OpenRouter的免费通道到8月24日(周一)。OpenCode的公告承诺从8月20日起免费一周,大约到8月27日。
问:每日100万亿Token是什么概念?
这大约是Visa公司一个月使用的AI Token总量的100倍。这个数字主要反映了提供商的服务器容量,而非实际使用量——但足以说明背后算力规模之大。
问:普通开发者能用Ox Alpha做什么?
目前主要是编程和Agent相关任务——代码补全、代码仓库理解、Bug修复、自动化软件开发流程等。也可以用于需要长上下文或多模态输入(图文视频)的复杂推理任务。
问:使用匿名模型有风险吗?
有。开发者不知道服务提供者是谁、数据保存政策如何、模型是否会更新。不建议将商业机密、未公开代码或个人信息输入匿名模型。

