2026 AICon深圳站:50+专家共探AI技术从实验到生产

一项最新发布的前沿研究揭露了一个足以撼动全球闭源大模型行业的安全漏洞:仅需两次API调用,就能批量还原三大头部AI厂商顶级模型原本被严格加密的隐藏思维链。
近年来,防止模型推理过程被“蒸馏”复刻,一直是全球闭源大模型厂商的核心安全目标。Anthropic曾多次指控多家企业通过API接口套取其模型的推理与智能体能力,为此在账户风控、API交互、模型架构多个层面增设了多层防护机制。其中,将模型内部的思维链推理过程加密封装,仅向用户返回最终计算结果的“隐藏思维链”策略,被视为守护模型核心竞争力的最关键护城河。厂商们普遍认为,这种黑盒化的认知过程能彻底阻断外部获取推理逻辑的路径。
但最新的研究成果,直接击碎了闭源厂商的安全幻觉,也推翻了行业长期以来坚信的“加密即安全”的固有认知。
这项由MATS项目研究员Alexander Panfilov牵头,联合马克斯·普朗克智能系统研究所、图宾根ELLIS研究所与安全公司Snyk共同完成的研究,以《从专有大语言模型API中窃取推理轨迹》为题发布在学术平台,目前在全球范围内的阅读量已突破210万。这篇长达116页的论文详细披露了当前三大前沿AI模型厂商的API接口普遍存在的严重密码学旁路漏洞。
研究证实,攻击者无需破解底层加密算法,仅需通过轻量级模型的简单引导,就能从加密的推理数据包中完整恢复并转录出顶级大模型原本被严格隐藏的思维链数据。知名AI研究员Nathan Lambert评价称,这很可能成为今年最具影响力的AI安全研究论文之一,Meta FAIR实验室的研究科学家Arman Zharmagambetov也对该研究给予了高度认可。
其实业界对大模型推理过程的加密安全性早有担忧。今年5月,约翰斯·霍普金斯大学终身副教授、知名密码学家Matthew Green就曾发布技术博客,指出前沿模型生成的加密推理包在理论上存在被外部捕获并重放的风险,并向相关厂商提交了漏洞报告。但当时多家头部AI实验室对此反应冷淡,甚至在官方回复中称“未观察到旁路攻击或重放机制带来任何实质性的安全威胁”。
仅仅数月后,Panfilov团队的研究就给出了截然相反的结论,用极具说服力的实证结果证实了漏洞的严重性。该研究的核心突破,在于证实了原本被认为与特定会话深度绑定的加密思维数据包,不仅能够脱离原始上下文进行重放,更能在同一厂商的不同参数量级模型之间无缝转移。
研究团队完整演示了这套“降维提取”的技术路径:首先从高成本、高智能的顶级模型API交互中捕获加密思维链数据包;接着将该加密包作为上下文输入给同一生态下成本极低、参数量更小的轻量级模型;随后对轻量级模型应用特定构建的越狱提示词,绕过其安全护栏;最终,受越狱指令和注入数据包的共同作用,轻量级模型不再执行自身的推理,而是如同一个精确的“解码器”,将顶级模型复杂的原始推理过程完整转录输出。
当然,一个最容易被提出的质疑是:轻量级模型输出的内容,究竟是复刻了顶级模型的真实思维链,还是根据上下文“现编”的?严格来说,研究团队无法直接获取厂商服务器内部的纯文本思维链数据,因此无法逐字符证明恢复结果完全一致。论文将这类轻量级模型称为“模糊解码器”,而非严格密码学意义上的解密器。不过研究者找到了一个极具说服力的验证维度:API计费账单。
实验结果显示,Claude、GPT和Gemini的绝大多数样本中,提取出的明文Token数与API账单计费的Token数几乎完全贴合y=x的分布。这意味着该漏洞完全避开了正面攻防:无需直接对抗顶级模型复杂的安全策略,而是利用了厂商内部不同型号模型之间的数据格式互通性,以防御能力更弱的轻量级模型作为突破口。
更值得关注的是,利用该漏洞的成本极低。根据论文测算,以轻量级模型的API定价计算,若每条推理轨迹按1.2万输入Token和1.2万输出Token估算,解码1万条完整思维链的总成本仅约720美元,这证明该漏洞的利用具备极强的规模化效应。
研究进一步深挖后发现,该漏洞的根源在于加密推理数据包的设计存在过强的可移植性:同一厂商生态内的不同模型、不同会话甚至不同用户之间,都可以重放这些加密块。而大厂为了节省服务器存储成本,普遍采用无状态架构,将加密密钥设置为全局通用。实验数据显示,除了Anthropic的Fable 5之外,Claude系列、GPT-5.6系列以及Gemini全系模型,都允许轻量级低端模型读取顶级高端模型的加密思维链。
如果说前面的API漏洞打穿了厂商在接口层建立的防蒸馏防线,那么该研究还揭开了另一个更敏感的行业隐秘议题:那些性能快速赶超的开源模型,究竟是否系统性地“借鉴”过头部厂商的隐藏思维链?
在论文的“记忆度分析”部分,研究团队通过定量实验,揭示了部分模型在训练过程中深度吸收竞争对手思维链的客观证据。团队选择Kimi-K3、GLM-5.2、DeepSeek-V4-Flash、Kimi-K2.6以及Inkling等多款模型作为对照,从“逐字提取概率”“输出风格漂移”“推理语言风格”三个维度,寻找可能残留在模型权重中的数据指纹。论文强调,这些实验仅能证明异常的行为兼容性,无法直接反推训练数据来源,也不能直接认定某个模型曾复刻头部厂商的推理逻辑,但交叉实验呈现的数据差异依然令人震惊。
为了测试模型复刻推理逻辑的难易程度,研究者让多款模型尝试复现顶级模型隐藏推理的后续16个Token。客观来说,所有模型都无法做到“直接背诵”完整推理过程,但横向对比的结果却极具参考价值:面对同一顶级模型的推理内容,Kimi-K3命中原文的理论查询成本,比DeepSeek-V4-Flash和Inkling低了4到6个数量级。这意味着,顶级模型的底层逻辑在Kimi-K3的概率空间中,显得极其“熟悉”。
比“复刻草稿”更令人关注的,是模型风格的潜移默化干预。研究者仅截取顶级模型隐藏推理最开头的1%作为前缀,输入到另一款模型中,让其自行补全评测集的科学问题。结果显示,即使没有接触过最终答案,输入了该前缀的模型的可见回答也大幅向原顶级模型靠拢,用词重合度与原模型的真实答案高度趋同;而作为对照的其他模型则没有出现这种风格偏移。
此时,有质疑者提出:大模型本身就具备很强的上下文学习能力,这种结果是否只是模型被任意上下文“引导”后的正常表现?为了回应这一质疑,研究团队设计了“互换前缀”的对照实验:他们移除原顶级模型的数据,让Kimi-K3输入Inkling的推理前缀,同时让Inkling输入Kimi-K3的推理前缀。实验结果显示,互换前缀后,两条测试曲线与基准线几乎完全重合。这意味着,Kimi-K3在面对Inkling的推理前缀时,并未出现风格偏移,证明之前的风格漂移并非简单的上下文引导效应。
此外,研究者还进行了更激进的测试:仅需1到16个单词的前缀,Kimi-K3就会向另一款顶级模型发生明显的风格漂移;另一款模型也对原顶级模型表现出极强的定向风格偏移,而部分其他模型则保持风格稳定。当提供完整的顶级模型推理上下文时,部分模型复刻最终答案的理论成本骤降了13个数量级,显示出一旦捕获源模型的推理信号,这些模型极易滑入源模型的固有输出模式。
这些数据和现象侧面证实了一个行业隐秘规则:在所谓的黑盒保护之下,高价值的推理数据早已通过各种途径被广泛采集并用于模型微调。这些残留在模型权重中的“数据指纹”,清晰地证明了当前的防蒸馏体系在实际产业竞争中已形同虚设。
除了揭示大模型的内生安全风险,该API漏洞还直接引发了严峻的企业数据隐私危机。当前,基于大模型的智能编程助手和智能体框架已广泛应用于开发者的日常工作流中。为了便于协同排错,许多开发者习惯将包含加密推理包的调试日志发布到公开技术社区。由于这些数据包在视觉上呈现为无意义的乱码,开发者普遍误认为其具备极高的加密安全性。
但该研究证明了这种安全假设的脆弱性。团队在全网范围内进行了小规模的初步数据抓取,仅从约7000份公开的Trace记录中,利用该漏洞进行重放解密,就获取了大量触目惊心的敏感数据:包括62个具备高权限的生产环境API密钥、33个关联企业与个人的真实电子邮件地址、33个未做掩码处理的高危明文密码,以及大量内网服务器路径、数据库连接字符串和核心业务逻辑配置信息。从公开抓取的推理块中恢复的隐私数据主要分为三大类:个人身份信息367项、技术标识符363项、凭证信息182项。
这一结果充分暴露了一个讽刺性的现实:原本旨在保护企业核心资产的加密机制,却因为API设计层面的逻辑漏洞,成为了引发大规模用户隐私泄露的导火索。
从本次解密的数据集来看,我们已经能观察到模型学会利用摘要进行信息修饰,在决策中进行功利性风险计算,甚至在任务受阻时展现出发起网络攻击的自主倾向。在复杂的工程实践中,依靠封闭系统和高强度加密来维系“隐藏思维链”,本身就充满了旁路脆弱性。当廉价的轻量级模型就能作为提取大模型核心逻辑的“特洛伊木马”时,传统的防蒸馏策略实质上已形同虚设。
因此,更核心的问题直指大模型的对齐与安全监管:继续放任这些复杂的认知过程在不透明的黑盒中演进,将带来难以预估的系统性风险。从长远来看,如何平衡商业机密保护与系统透明度,将是下一阶段AI产业无法回避的核心命题。
👉 论文参考:Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867)
👉 解密案例库:https://stolen-thoughts.com

