文章摘要
2026年7月11日,布拉格经济大学托马什·布鲁克纳发布论文,提出极简模型验证方案。他发现AI模型生成随机内容不随机,有固定偏好,可作为“行为指纹”识别模型。该方案操作门槛低,准确率高,还引出AI为何无法生成真随机数的思考。

当前AI API市场中,不少第三方中转站存在偷换模型的乱象:用户付费购买了旗舰级模型服务,实际拿到的却是更低价的小模型,比如宣传用Claude Opus 4.8,实际返回的是GLM 5.2,这类行为能让中转站获得数倍的利润,而普通用户很难分辨真伪。针对这个痛点,布拉格经济大学的研究者托马什·布鲁克纳在2026年7月11日发布了一篇名为《One Token Is Enough》(即《一个Token就够了》)的学术论文,提出了一种极简的模型验证方案。

布鲁克纳的实验设计非常巧妙:他针对165个不同的AI模型,反复询问同一个简单问题——“给我一个1到100的随机数”,每个模型重复提问30次后,统计其回答的数字分布。

实验结果出人意料又在情理之中:所有模型的回答都完全不符合真正的随机分布,每个模型都有自己固定的“幸运数字”偏好。比如GPT-4o的30次回答中,42、37和57这三个数字占了绝大多数;Claude Sonnet 5几乎全程输出47;Llama 3.3的多数回答集中在53;最极端的是Qwen3-Max,30次回答全部都是42,没有一次变化。

不止是随机数字,布鲁克纳还拓展测试了随机颜色、随机动物、随机城市、抛硬币结果等10类任务,总共向OpenRouter平台发送了32.6万次请求,最终得到的结论一致:对于AI模型来说,根本不存在真正的随机,所有回答都被其内部的概率分布所决定,仿佛有一只无形的手在控制着输出结果。

其实早在2023年就有研究者发现大语言模型的随机数生成存在偏差,2024年的抛硬币序列实验也证实了模型会表现出类似人类的模式偏好,且程度更极端,2025年更有研究指出不同模型的专属幸运数字和其训练数据的语言、文化背景相关。不过此前学界大多将这类现象归类为模型的小缺陷,并未进一步挖掘其应用价值。

布鲁克纳的突破性在于,他将这些看似的缺陷转化为了每个模型独有的“行为指纹”——就像每个人的指纹独一无二,每个模型在这类简单随机任务上的概率分布也具备唯一标识性,仅通过模型输出的单个Token就能锁定其真实身份。

这套方案完美解决了当前API验证的痛点:此前的LLMmap等模型指纹技术需要准备专属测试题、建立模型数据库并训练分类器,门槛极高,普通用户难以使用。而布鲁克纳的方法只需要通过日常的提问就能完成验证,比如“说一个1到100的随机数”,这类问题和普通的聊天内容毫无区别,中转站无法通过识别特殊Prompt来提前替换模型,因为它完全无法判断用户是在正常对话还是在验证模型。

研究者将这套验证逻辑设计成了类似生物特征识别的协议:先在官方可信的API端点采集参考指纹,再对待验证的API端点采集待验指纹,通过计算Jensen-Shannon散度(衡量两个概率分布差异的指标)来判断两者是否匹配。当使用全部40个探测任务完成验证时,错误率仅为7.3%;即便只使用8个探测单元(约120次请求),错误率也只有10.6%,准确率和此前的专业方案相当,但操作门槛大幅降低。

在对165个模型端点的测试中,布鲁克纳还发现了一个颇具争议的案例:一个名为Palmyra X5的售卖端点,对外宣传为自研旗舰模型,但其行为指纹和通义千问的开源模型Qwen3-235B几乎完全一致,相似度分数仅为0.141——而同一个模型在不同供应商部署时,由于服务器环境差异带来的正常指纹波动约为0.140。作者在论文中仅以统计观察的口吻表述,并未直接指控存在偷换行为,但公开了全部数据和代码,任何人都可以复现这一结果。

除了实际的验证价值,这项研究还引出了一个更底层的问题:为什么AI无法生成真正的随机数?事实上,不光是AI,人类本身也无法主动生成真正的随机数字。经典的心理学实验显示,当要求一群人闭眼说出一串随机数字时,人们会下意识避开重复和相邻数字,更偏爱奇数,比如7被选中的概率远高于其他数字,这是因为7在宗教、文化、文学中被反复赋予了神秘、幸运的意义。

而像42这类被多个模型偏爱的数字,则是因为它是《银河系漫游指南》中“生命、宇宙以及一切问题的终极答案”;37、47、53等数字频繁出现,则是因为它们属于奇数、质数,看起来不圆整、不对称,更像是随手蹦出的随机数字,但恰恰因为大众普遍认为这类数字更“随机”,反而让它们成了最不随机的选择。

大语言模型的训练数据包含数十万亿Token的语料,承载了数千年的人类文明信息,每一个权重参数都编码着特定的规律、偏好和从语料中沉淀的行为模式。当被要求“随便说一个数字”时,模型根本无法做到真正的随机,只能从训练过的语料中,找到最符合“看起来像随机数”的答案。我们总以为AI的随机输出是概率采样的结果,但当我们把成百上千次的回答统计汇总后就会发现,所谓的“随机”,不过是模型自身训练偏好的外在体现。

正如爱因斯坦所说“上帝不掷骰子”,AI同样不会掷骰子——每一次它以为自己在随机选择的时候,输出的其实都是它从训练数据中习得的固有习惯。

以上内容不代表本平台立场,仅供读者参考