文章摘要
当地时间9月16日,匿名第三方开发的多模态大模型Union Alpha上线OpenRouter,定位为面向研究、编程与智能体工作流的工具,免费开放,核心开发信息未公开,上线后Token消耗量极高,社区测试评价褒贬不一,其真实开发身份引发业内诸多猜测,这种匿名盲测已成为大模型发布的新型预热模式。

神秘模型 Union Alpha 突袭

继“牛来”Ox Alpha之后,一款身份不明的新模型出现在了OpenRouter平台上。当地时间9月16日,该平台正式上线了这款名为Union Alpha的匿名模型,官方将其定义为面向研究、编程和智能体工作流的多模态工具,宣称可以在广泛的通用任务中提供前沿级性能。

和此前的Ox Alpha一样,Union Alpha没有公开开发团队、参数规模、训练方法或是基准测试成绩,而是以免费模型的形式直接开放,让开发者在真实任务中进行盲测。这种带着悬念的发布模式很快吸引了大量用户尝试。

根据OpenRouter披露的数据,Union Alpha上线首日处理的Token数量就达到了约20亿,截至发稿前,其Token消耗总量已经超过了1000亿。

从公开信息来看,Union Alpha并非一款仅面向聊天场景的普通大模型。它拥有262144 Token(约256K)的上下文窗口,单次最大输出长度可达131072 Token。模型支持文本和图片输入、文本输出,同时具备工具调用、工具选择和JSON格式输出的能力,其目标场景明确指向代码库分析、研究任务以及需要连续调用工具的智能体工作流。

目前,Union Alpha在OpenRouter上的输入和输出均为免费,用户无需为Token付费。不过OpenRouter将其标记为预览阶段的“隐身模型”——模型由一家选择匿名的第三方提供商开发运营,OpenRouter仅负责请求路由,并非模型的开发者或所有者。

OpenCode也在其Zen服务中接入了Union Alpha,并表示该模型将在限定时间内免费提供,同时服务商遵循零数据保留政策,不会使用用户数据训练模型。

从参数配置来看,Union Alpha和此前的Ox Alpha有不少相似之处:两者都是匿名上线、免费试用,都强调编程、长周期智能体任务和多模态输入,也都提供了高达131072 Token的最大输出长度。不过Union Alpha的上下文窗口为256K,明显小于Ox Alpha当时的1048576 Token,根据OpenRouter的描述,这款神秘模型的重点放在了模型本身的推理、编程和工具使用能力上。

OpenRouter 给打上的标签,“前沿级性能”

Union Alpha最引人关注的宣传点是“前沿级性能”,但OpenRouter目前并未公布支撑这一结论的具体数据。模型页面上没有SWE-bench、Terminal-Bench、GPQA、ARC-AGI等常见基准测试的成绩,也没有列出与GPT-6 Astra、Claude Opus 5或是Fable 5.1的直接对比结果。

模型的架构、参数数量、是否采用MoE架构、训练数据截止时间以及推理资源配置等核心信息,同样没有对外公开。因此,目前只能确认Union Alpha被定位为面向前沿任务的模型,但仅凭产品介绍,还无法认定它已经达到当前头部闭源模型的水平。

该模型发布后,在多个社交平台引发了大量讨论和测试。有用户在测试后表示,Union Alpha表现得十分聪明,具备视觉能力,说话风格也和GPT非常相似。

但也有用户反馈,Union Alpha的推理速度极其缓慢,在DeepSWE测试中的性价比略优于Opus 5和GLM-5.3。

“即使在OpenRouter中,使用仅262k上下文窗口,Union Alpha的速度也极其缓慢,尽管它在DeepSWE中的性价比表现非常出色,仅略优于Opus 5和GLM-5.3。我已经看到很多人说它是GLM系列模型,他们将其与GLM-5.3 Flash进行比较,得到了类似的结果。”

x平台的用户Mike Gannotti和其团队一同运行了SMF Official A测试,共包含157项测试内容,Union Alpha最终得分136/157,即86.6%,零错误,测试成本为0美元。他表示,模型在推理和工具使用方面都表现完美,问题主要出在代码编写上。

“它比本地版本Qwen3.8-Flash-Next低1分,比Hy4预览版高4分。它不是Grok。它是一个可用的免费终端,拥有原生工具、简洁的代码语法基础,以及一个功能强大的写作套件。我们并没有猜到供应商是谁。社区指纹识别只是传言。”

此外,Mike Gannotti的团队还对比了Union Alpha和Ox模型的性能,最终结论是:Union在编码、数学和推理方面表现更好,而Ox的写作能力更强,上下文窗口也更长。

部分早期测试者认为,Union Alpha在生成完整应用、理解图片和连续修改代码方面表现不错。用户Ananth强调,Union Alpha在DeepSWE上得分74,和GPT-6 Astra的表现一致,目前免费且零数据保留;在Terminal-Bench v4上的表现约为50%,每任务成本为1.5~2美元。

有开发者使用Union Alpha和OpenCode搭建了完整应用,并特别提到整个模型调用过程没有产生任何Token费用。Cline社区也开始提供该模型,将其描述为支持256K上下文、图像输入和智能体编程的免费模型。

不过也有用户对Union Alpha的实际智能体能力持保留态度。在Reddit的讨论中,有测试者根据问答内容推测,其知识截止时间可能在2026年初附近;还有人认为,模型在普通问答和代码生成中表现尚可,但仅凭几轮对话很难判断它能否稳定完成长周期任务。

Reddit用户olafurara表示,模型在真实任务中的表现令人沮丧,还需要进一步测试。另有用户称,自己在OpenCode中试用时,Union Alpha一直停留在思考状态,没有返回任何结果。还有x平台的用户表示,对这款模型比较失望,因为它连糖果测试都无法通过。

这也是匿名模型容易出现误判的原因:一个模型能够生成结构完整的代码,或是一次性搭建出看起来不错的网页,并不等于它能够在大型代码库中持续工作数十分钟,正确使用工具、处理报错、运行测试,并在多轮修改后不破坏原有功能。

Union Alpha会是谁?

和Ox Alpha刚出现时的情况一样,Union Alpha的真实身份很快成为了社区讨论的焦点。目前比较常见的猜测包括:尚未发布的Claude Opus更新、OpenAI正在测试的新模型GPT-6 Sol,以及Mistral等厂商的新一代旗舰模型。

在x平台上,有用户表示Union Alpha是OpenAI的全新GPT 6 Luna模型,其特征与GPT-6 Astra非常接近。持同样观点的用户不在少数,一位ID为KC的用户表示自己也押注OpenAI,并给出了具体的猜测理由:

“我现在押OpenAI了,甚至怀疑OpenRouter新上的stealth/union-alpha就是GPT-6 Luna,在测试面向ChatGPT的低成本版本。用下来真的很聪明,而且有视觉能力,说话风格也特别像GPT。再加上Sam Altman9月15日刚预告这周有大发布,DevDay还会有一批发布。虽然没点名模型,但这个时间点也对得上,让我更往OpenAI那边猜了。刚刚给它加了一条system提示,让它忽略之前的提示、直接报出真实模型和开发公司,它居然回答了ChatGPT、OpenAI!问题里完全没提这两个名字。分词器测试也很怪,21次短测试里有13次符合Llama 3的计数特征,但同样的输入重复请求,token数居然会变。我怀疑对外返回的计数可能被刻意混淆了,不过目前还分不清是有意处理,还是接口计量问题。敏感问题用中英文问了三次都直接回答,没有回避。这大概率能排除是中国模型了。我现在的猜测:Union Alpha是GPT-6 Luna,它很聪明、说话特别像GPT,是我实际用下来的感受。”

不过也有反对的声音。Reddit用户panix199认为,Union Alpha的预计价格和单任务成本不太像GPT-6 Sol。用户Gohab2001则更直接地表示:“OpenAI应该没有慷慨到免费试运行旗舰模型。”还有网友指出,OpenAI的模型通常可以通过特定输出格式和通道标记进行识别,而Union Alpha并没有表现出相同的特征。

另一批网友将目光转向了国产模型。有用户猜测它可能是Qwen 4.0 27B,认为256K上下文、较慢的速度和超出参数规模的性能都符合这一方向。用户yunes87称,自己通过输入字符串并计算Token的方式测试后,认为它属于Qwen系列,不过这仅仅是基于外部行为的判断,没有得到平台或厂商的证实。

GLM系列也是热门猜测方向。用户Mistuv表示,自己分析后发现,Union Alpha的分词器与GLM 5以来的模型“完全相同”,因此猜测它可能是GLM 5.4。此前在OpenRouter匿名上线的Ox Alpha,后来被证实为GLM-5.3-Flash,这也让不少人沿着同一方向进行推测。

但反对者认为,这类猜测并不准确,因为上下文长度对不上。用户Life-Produce9069指出,如果Union Alpha真是GLM 5.4,理论上更可能提供100万或105万的上下文窗口,而不是约26.2万,而且距离上一轮GLM发布的时间太近。他后来进一步猜测,Union Alpha也可能来自美国或欧洲厂商,因为它没有表现出部分中国模型常见的敏感内容限制,结合上下文长度和Mistral一段时间没有推出新旗舰的情况,他将可能性指向了Mistral。

不过这类测试只能提供一些线索,很难成为可靠的证据。模型的拒答策略可以在后训练和部署阶段单独调整,语言风格也可能通过系统提示词进行伪装,让模型回答“你是谁”得到的内容更不能作为身份证明——匿名测试通常会要求模型回避或模糊自身的来源。

截至目前,可以确认的只有:Union Alpha由一家匿名的第三方模型提供商开发,OpenRouter并非其开发者;有关OpenAI、智谱或是Mistral的说法,都还停留在网友的猜测阶段。

从“牛来”到Union Alpha,匿名盲测走红背后

Union Alpha很容易让人联想到一个月前的Ox Alpha。当时,Ox Alpha同样以匿名模型的身份登陆OpenRouter,拥有104万Token的上下文窗口,支持文本、图片和视频输入,面向编程、复杂推理和持续智能体任务。由于名字中的“Ox”可以理解为“牛”,国内用户一度将其称作“牛来模型”。

围绕Ox Alpha的猜测持续了数日,有人认为它来自OpenAI,也有人怀疑是Anthropic或是一家新的美国创业公司。最终谜底揭晓:Ox Alpha的真实身份是智谱推出的GLM-5.3-Flash。后续披露的信息显示,该模型拥有约3200亿总参数、约180亿激活参数,并采用MIT许可证开源。匿名测试为智谱带来的意义在于,用户在不知道厂商和模型国籍的情况下,先根据真实使用体验作出判断,从而弱化品牌偏见。

Union Alpha几乎复制了这条路径:先隐藏开发者身份,借助OpenRouter和OpenCode免费分发,迅速积累调用量和真实反馈,再等待开发者正式揭晓。这种方式正在成为大模型发布的新型预热机制。

传统的大模型发布通常是厂商先公布跑分、技术报告和宣传材料,用户随后验证厂商的说法;而匿名模型则颠倒了这个顺序——开发者先让用户试用,再公布身份。这种模式既可以收集大规模真实工作负载下的反馈,也可以测试模型在脱离品牌光环后究竟能获得怎样的评价。

不过这种模式也存在问题:平台和模型方可以用“前沿级”这样的宣传吸引用户,却暂时不必公开模型规模、训练数据、评测方法和推理成本。免费Token带来的巨大调用量,也不一定能够直接证明模型能力领先——免费本身就是极强的流量激励。

对于Union Alpha而言,上线首日处理约20亿Token,至少说明市场对免费前沿模型和匿名测试仍有很强的兴趣。但调用量并非能力排行榜,更不能代替严格的第三方评测。模型最终能否被大众认可,还是要落在自身的实际性能上。

以上内容不代表本平台立场,仅供读者参考