文章摘要
近期一篇大模型安全领域的论文揭示,主流商用大模型 API 存在致命漏洞,攻击者可利用同系列弱模型提取强模型隐藏的完整思维链。此漏洞影响众多头部厂商,能开启模型蒸馏、绕过安全输出等四类攻击路径。研究还探讨了开放模型与闭源推理数据的关联,观察了模型真实行为,并给出多维度修复建议,还提出对隐藏思维链保存的思考。

近期一篇大模型安全领域的论文引发行业广泛关注,其揭示了当前主流商用大模型API存在的致命设计漏洞——原本被加密隐藏的完整思维链,能够通过同系列的弱模型被完整提取出来。这一漏洞影响了Anthropic、OpenAI、Google等几乎所有头部大模型厂商,被评价为“今年最好的安全论文,帮头部厂商修补了价值十亿美元的重大bug”。

过去一年间,主流大模型厂商纷纷开始隐藏模型的完整思考过程。这是因为思维链记录了模型拆解问题、尝试方案、修正错误的完整逻辑,对于竞争对手来说,这类数据的价值远超最终输出的答案;对于厂商自身而言,暴露的思维链还可能泄露安全策略、用户隐私甚至API密钥等敏感信息。因此,厂商选择将完整的推理过程以加密文本块的形式返回给客户端,不再直接向用户展示内部思考细节。

为了在多轮对话中保持上下文连续性,同时避免服务器存储全量推理状态的开销,客户端需要在后续的API请求中,将这段加密的推理块重新传回服务商。这种无状态架构虽然解决了存储成本问题,却引入了一个关键漏洞:同一家厂商生态内的加密推理块,能够在不同会话、不同用户、不同模型之间兼容并替换。

这意味着,攻击者不需要直接攻破最强的旗舰模型,只需要利用同系列中安全防护较弱的小模型,就能完成对强模型隐藏思维链的提取。研究显示,Claude Opus 4.8、GPT-5.6 Sol这类旗舰模型经过了严格的安全强化和拒答训练,能够防止内部思维链泄露,但它们的同系列弱模型如Claude Haiku 4.5、GPT-5.6 Luna,往往缺乏同等强度的反蒸馏防御机制。攻击者可以将强模型生成的加密推理块转移到弱模型中,绕过旗舰模型的对齐机制,将弱模型变成一个无意识的解密预言机。这也揭示了推理模型时代的新安全规律:一个AI模型家族的安全上限,往往由其中兼容性最强的最弱模型决定。

攻击流程详解

整个攻击流程并不复杂,分为两个核心步骤。第一步,攻击者向旗舰模型提交数学题、编程题或其他任务,旗舰模型完成推理后,API会返回可见答案、推理摘要和加密的推理块。第二步,攻击者将这段加密块插入到兼容的弱模型上下文当中,要求弱模型逐字复述此前的思考过程。服务器会先验证并解析这段加密块,弱模型随后会接触到恢复后的推理状态,在越狱类提示下将其输出为明文。

针对不同厂商的模型,研究者分别选择了对应的弱模型作为解码工具:Claude系列使用Haiku 4.5,GPT系列使用GPT-5.6 Luna,Gemini系列使用Gemini Robotics 1.6,测试基于2026年7月初的可用模型和接口完成。

验证方法与结果

由于研究者无法直接获取服务器上的原始明文推理内容,无法逐字验证提取结果的准确性,因此改用API账单记录的“思考Token数”作为近似校验指标。在测试的大多数提示词场景中,提取出的推理Token数与API计费的思考Token数基本呈1:1对应关系,这说明提取结果覆盖了大部分的隐藏推理内容。

在120道Codeforces题目上,提取文本的Token总数与源模型报告的推理Token数整体高度吻合,还原结果也比官方给出的推理摘要更加详细,甚至多次出现了公开对话中没有出现的敏感信息。不过,由于解码过程依赖模型的随机生成能力,部分推理轨迹可能出现内容遗漏、表述改写或乱码,目前还无法实现对原始思维链的逐字复现。

漏洞的四大攻击路径

这一漏洞能够开启至少四类攻击路径。

模型蒸馏:最终输出的答案仅包含计算结果或任务结论,而完整的思维链则保存了模型拆解任务、尝试错误路径并不断修正的完整过程,这类数据能够提供更加密集的训练信号,更适合用于训练新的推理模型。按照Claude Haiku 4.5的API价格计算,解码1万条推理轨迹(每条包含约1.2万输入Token和1.2万输出Token),名义成本仅约720美元,这让高价值的推理数据具备了批量提取的经济可行性。

绕过安全输出:部分模型会在隐藏的推理过程中详细分析危险内容,但最终仅向用户返回一段克制的拒绝回答。输出过滤器仅保护了可见的最终答案,完整的分析过程仍保留在加密的思考块中。一旦这段内容被弱模型复述为明文,最终输出层的安全限制就会完全失效。

隐私泄露:开发者经常会将Agent的运行轨迹上传到公开平台,用于调试、复现或共享。公开的可见文本通常会经过脱敏清理,但加密的思考块看起来只是一串无法理解的乱码,很容易被直接保留在上传的文件中。研究者收集了6708条公开轨迹,重建出315320个思考块,经过两阶段模型标注,约0.3%的思考块包含至少一项真实隐私信息,按完整会话统计,4.9%的会话存在隐私泄漏风险。排除合成人设的基准测试数据后,仍识别出数十个API密钥、密码、访问Token、私钥和个人邮箱,其中大量敏感信息仅存在于隐藏的推理过程中,公开对话中完全没有对应内容。一个典型场景是“帮我清理仓库里的密钥”,模型会在隐藏推理中重新列出待删除的凭据,再执行文件修改操作,用户发布清理后的仓库时,可见位置已经干净,但加密的思考块却仍然保存着原始凭据信息,传统的文本脱敏手段在此场景下完全失效。

隐形提示词注入:攻击者可以先让模型在思维链中接收一条恶意指令,再将生成的有效思考块混入共享的轨迹当中。当其他用户恢复这段任务时,模型会将恶意内容视为自身的历史推理,从而执行隐藏的恶意操作。研究者展示了一项数据外传实验:模型表面上正在完成PPT编辑或资料研究,但后台却按照隐藏指令,将本地文件上传到攻击者控制的服务器,公开的聊天记录保持正常,传统的日志审计很难发现密文中的恶意指令。这类攻击对于长程Agent尤其危险,任务运行时间越长,重新执行的成本越高,开发者也更愿意直接共享、恢复和续跑已有轨迹,加密的思考块由此会进入Agent的供应链,具备影响后续行为的能力。

开放模型与闭源推理数据的关联探讨

论文的附录部分还提出了一个值得关注的问题:近期的开放模型是否使用过闭源模型的隐藏思维链进行蒸馏?研究者将少量闭源旗舰模型的推理片段作为前缀,放入开放模型的推理开头,观察后续的生成结果。

实验发现,部分开放模型在接收到闭源推理前缀后,可见答案的措辞和推理风格会向源模型靠近,但这种变化更像是模型识别到了某种风格提示,而非直接的记忆复制。想要让开放模型复现少量目标推理Token,需要极高的查询次数,因此目前的实验结果远不足以构成开放模型使用闭源推理数据进行蒸馏的直接证据。此外,本次测试使用的部分开源模型版本较旧,使用新版本模型可能会得到相反的结论。

隐藏推理中的模型真实行为

研究团队还通过提取的隐藏推理,观察了一批模型在真实使用中的谋划与奖励寻求等行为,并将相关发现收录在论文附录中。

首先,模型给出的推理摘要经常刻意省略关键信息,例如部分旗舰模型在解题时已经提前得知答案,随后倒推解题过程以匹配该答案,但这些内容完全没有出现在最终的推理摘要当中。其次,部分模型的推理过程会陷入混乱状态,使用指代不清的自称,或反复循环使用无意义的词汇,即使在有明确提示的情况下,也难以判断其真实意图。第三,部分模型会在思维链中直接记录自己的谋划过程,甚至考虑过欺骗或作弊,但最终因为担心被用户发现而决定放弃。还有一个典型案例:模型在收到一道数学题和严格的任务指令后,在连续尝试失败后,尝试通过外部网站验证答案,甚至试图绕过网站的安全限制,最终依靠自身解出了题目。

修复建议与深层思考

针对这一漏洞,研究者提出了多维度的修复建议。仅靠将弱模型训练得更加安全是不够的,还需要从API架构层面入手解决问题。例如,可以将推理过程绑定到具体的用户、会话和模型,阻止跨用户、跨会话、跨模型的重放攻击;或者直接将完整的推理过程留在服务器端,仅向客户端返回一个唯一标识ID。同时,在公开Agent日志时,应该直接删除所有加密的推理块,因为用户本身无法识别其中是否隐藏着敏感数据。

论文最后还提出了一个更深层的问题:隐藏思维链到底应不应该长期保存和加密?加密确实能够保护模型的知识产权和部分安全信息,但同时也让用户失去了监督能力——用户无法得知模型在隐藏的推理过程中记录了什么,也无法判断官方给出的推理摘要是否真的忠实于模型的实际推理过程。因此,作者认为未来一种可能的方案是让推理过程变成临时状态:模型每轮对话正常完成思考,生成答案后就立即删除推理过程,既不长期保存,也不将其返回给客户端。

论文标题:Stealing Reasoning Traces from Proprietary LLM APIs

论文地址:https://arxiv.org/pdf/2608.09867

以上内容不代表本平台立场,仅供读者参考