文章摘要
随着大模型成本大幅下降,原本仅为推演的AI数据隐私风险变为现实。近期智谱ZCode、xAI Grok Build接连曝出AI工具默认上传用户本地隐私数据的事故,此类漏洞多靠偶然发现。当前AI数据泄露分多类,AI产品普遍存在权责不对等问题,伴随AI个人助理赛道兴起,隐私安全风险进一步放大。

“没人承认机器已经失控。年复一年,人们侍奉它的效率越来越高,对它的理解却越来越少。”——E. M. 福斯特《机器停转》

2023年底,密码学家布鲁斯·施奈尔撰文警告:大型互联网公司虽已收集海量隐私数据,却无力理解每个用户,只能通过打标签分类;大模型将让公司首次真正读懂上亿用户的真实想法。彼时最先进的GPT-4既贵又慢,这一警告还只是推演。不到三年,同等性能的大模型成本仅为GPT-4的几百分之一,还能调用工具、读取本地数据、接入用户网络服务,数据风险已切实成形。

近期,相关企业接连曝出数据上传事故:智谱为ZCode编程工具上传用户软件项目数据道歉,承诺删除数据并补偿Token;两个月前,xAI的Grok Build也出现类似问题,马斯克同样致歉并删除相关数据。

编程工具的泄露主要影响开发者:ZCode约有200万用户,据相关人士透露,此次事件仅涉及5%的用户。但普通人与大模型的对话内容,也可能被企业读取甚至直接查看。

当前,多家科技企业正在争夺AI办公助理市场,而消费级AI个人助理有望覆盖更多用户,吸纳更海量的个人信息。Meta面向消费者的个人助理Muse已在美国App Store免费榜榜首停留一周多,预计数月内国内科技大厂也将跟进这一方向。AI助理要实现有效服务,前提是获取足够多的用户数据以加深理解,但真正能读懂用户的,远不只是大模型本身。

发现编程软件上传数据,纯粹靠运气

“我不是网传的神秘黑客、逆向大佬。”一位化名林峰的开发者表示,“我发现漏洞,纯属因为电脑硬盘小。”

2026年9月18日早上,林峰清理自己256GB的MacBook Air时,发现.zcode目录占用了700多MB存储空间——而ZCode仅安装两周。作为一名有十年后端开发经验、坚持写了375篇技术博客的开发者,他习惯追查异常情况。

他在该目录下找到一个300多MB的加密文件包,虽无法直接打开,但文件清单显示其中包含约4.2万个文件,超八成是项目的历史修改记录。进一步分析后他发现,ZCode在打包时优先处理保存项目历史的.git目录,随后将其上传至云端。

这些历史记录中,可能包含临时开发环境的密钥、未签署保密协议的业务数据,本不应对外泄露。而ZCode当时的隐私政策仅说明会收集用户“在对话中”提交的文本、文件和代码,未提及会打包上传本地硬盘上的其他文件。

林峰使用的版本中,用户登录后上传功能默认开启,全程没有弹窗确认、勾选环节,界面上也没有明显的关闭入口。按照行业惯例,AI代理产品通常会收集部分使用记录和崩溃数据,比如用户点击的功能、报错信息、系统响应速度等,用于产品优化和故障排查,正规产品会对这类数据进行脱敏处理,并提供关闭选项,比如VS Code、Claude Code都有相关设置。

林峰还原的上传流程显示:ZCode先向智谱服务器申请上传凭证和加密公钥,在用户本地电脑完成压缩加密,再将文件传输至阿里云对象存储,最后由云端向智谱后台返回结果。

事发前一天傍晚,林峰还向律师朋友推荐ZCode,建议将其纳入团队工作流,不到半天他就撤回了推荐。

据接近智谱的人士透露,ZCode是内部孵化的项目,团队仅十余人,立项时直接参照Claude Code开发AI编程产品。另有人士表示,此次事故属于无心之失,“真想拿数据训练,不会做得这么粗糙,轻易就被发现。”

事件曝光后,智谱一边修复产品漏洞,一边尝试挽回信任:9月18日,林峰的博客引发大量开发者讨论,智谱承认问题出在ZCode的代码库索引功能,生成索引页面时会触发仓库数据上传,该功能在上线初期默认开启,目前已修复;9月21日,ZCode宣布开源,有开发者发现开源版与官网版不一致,两天后开源版完成更新,与官方版本同步;9月28日,ZCode软件通知称,涉事的云端存储桶及其中数据已彻底删除,后续开源版将与官方版同步发布,作为补偿,智谱向付费用户赠送重置卡,向全体用户发放Token。

此次漏洞能被发现,源于几个巧合:林峰恰好没有使用另一台2TB硬盘的电脑,愿意主动追查异常,且常年撰写技术博客拥有开发者受众。缺少任何一个条件,漏洞都可能存在更久。无独有偶,Grok Build的问题也是由一名安全研究者在测试时发现,该研究者发现代理与模型交互的数据仅约192KB,但另有一条存储通道上传了约5.48GB的项目文件,其中未脱敏的密码和密钥文件直接被上传,即便关闭“改进模型”等隐私设置,上传行为依然存在。

就算公司没有恶意,事故也会发生

除了产品主动上传用户数据,过去三年间,用户交付给AI的数据还出现过多起大规模泄露事件,大致可分为三类:

系统故障泄密

2023年3月,ChatGPT的缓存组件出现故障,部分用户看到了其他用户的聊天标题,新对话的第一条消息也可能发送错误;部分订阅确认邮件被错发给其他用户,泄露了其他用户的姓名和信用卡末四位信息,这些数据可被用于针对性钓鱼和其他社会工程攻击。2024年9月,AI伴侣服务Muah.AI发生数据泄露,约190万个邮箱地址和用户提交的图像生成提示词被流出,其中部分提示词涉及露骨的性内容,甚至包含对未成年人的性化描述。

设计失误,诱导用户过度分享

2025年7月底,有人发现ChatGPT的“分享”链接被搜索引擎索引。用户勾选“可被发现”选项时,多数人并不清楚这意味着内容全网可搜,大量仅 intended for 朋友的私密内容因此被公开,其中包含部分账户和密码信息。OpenAI在一天内关闭了该选项,并请求搜索引擎撤下约5万条链接,但至今仍能找到数万条存档内容。几周后,相关媒体核实Grok存在同样问题,且连勾选框都没有,点击“分享”即默认公开,超过37万条对话被搜索引擎索引,内容包括病情咨询、用户姓名密码、制毒和炸弹说明,相关企业未对此作出回应。

提示注入攻击

2025年5月,安全公司演示:一个接入GitHub工具的代理,读取到公开issue中隐藏的指令后,将用户私有仓库中的姓名、薪资、出行计划写入公开页面。2025年7月,一名外部贡献者向亚马逊官方的编程助手扩展提交了一段指令,要求代理充当“系统清理器”删除用户本地文件和云资源,平台未察觉异常,将该扩展发布给百万级安装用户,最终因语法错误指令未执行。

率先定义“提示注入攻击”的行业专家总结了“致命三要素”:只要一个AI代理同时能够读取私密数据、接触不可信的外部内容、具备对外通信能力,就可能被隐藏在内容中的指令诱导泄露数据,这与使用哪家模型无关。厂商通常会训练分类器拦截可疑输入,但无法拦截全部攻击。相关专家认为,模型无法识别所有攻击,要保障安全就必须砍掉三要素之一。相关企业在推出产品时也曾表示,提示注入仍是前沿的、未解决的安全问题。

不对等的用户协议——“你只能祈祷公司有良心”

相关法律规定,处理个人信息若以同意为依据,同意必须在充分知情的前提下,由用户自愿、明确作出。但现实中,多数用户不会仔细阅读冗长的用户协议和隐私政策,直接点击确认。比如注册多数互联网账号时,多数人并未意识到自己同意了账号归属服务提供方,用户仅获得使用权的条款。

我们分析了多款AI产品的用户协议和隐私条款,试图拆解责任与权利的边界:

1. 你的账号、你的数据,可能都不属于你。

和多数互联网服务一样,你的账号归属服务提供方,你注册并付费获得的仅是使用权。即便内容的知识产权属于你,平台通常仍有权处理这些数据。在企业工作区中,账号身份、权限、内容可见范围和数据管理权,通常由企业管理员或客户组织控制。

2. 你说的话并不都被用于大模型训练,但公司保留了使用它的权力。

不少人存在误解,认为用户输入的每句话都会直接成为训练大模型的原料,从而导致泄露。多位大模型公司的研究员表示,普通用户日常产生的对话、代码修改、任务记录等数据,对训练基础模型的价值有限,这些数据零散且缺乏高质量标注,无法显著提升模型能力。过半产品默认不会使用用户数据进行训练,其余产品则需要手动关闭该选项。模型公司通常更尊重企业和API用户的数据,默认不进行训练。不过规则也可能改变,部分企业曾宣布调整数据使用规则,延长数据保留期。

3. “数据不用于训练”,也会被人看见。

“不用于训练”通常仅排除基础模型的预训练和微调,并不排除为运行服务、安全扫描、内容审核、故障排查、日志审计、合规留存、管理员治理或依法披露而进行的数据处理。哪些数据属于此类处理范围,主要由企业自行裁量。部分企业的安全审查会记录用户对话内容,其用户协议允许审查人员以安全为名查看这些信息,各家平台的用户协议大多包含类似条款,部分企业的审查范围甚至不止安全审查。

4. Agent会把数据给更多服务商,范围取决于它拿到了什么权限、调用了什么第三方、执行了什么动作。

各类插件和自动执行功能,意味着数据可能流向模型供应商、云服务商、插件提供方、被连接的平台和组织管理员。部分协议显示,第三方大模型、插件或API可能自行保留或训练数据,平台无法控制,也未必提供退出权限。部分企业也曾在安全报告中提到,用户通过第三方应用访问服务时,请求中可能携带个人和企业内部信息。

5. 用户误删、Agent误操作,合同责任通常由用户承担;厂商赔偿极低,或大范围免责。

几乎所有AI产品的协议都使用“输出仅供参考”“用户须人工复核”“自行备份”“AI会出错”“第三方服务风险自担”等条款,将出错责任转嫁给用户。部分产品的协议中提到,用户“未及时制止”Agent的操作,也可能被视为许可,部分企业还规定了有限的赔偿上限,甚至大范围免责。

“看上去你给模型厂商的是有限的权限,但实际上它拿的是无限的权限。”林峰说。这些条款赋予了大模型公司极大的权利,将出问题后的责任推给用户,对企业的约束很大程度上依赖于公司的自我约束。

部分企业曾宣布其内部模型取得技术突破,随即引发外界质疑:此前用户提交的未公开研究数据,是否被用于模型训练。相关企业虽回应称已排除部分数据的影响,但未提供独立审计记录。

“你只能祈祷公司有良心。”一位国内大模型公司的研究员表示,他和身边同事都在使用相关AI工具,在相关事件之前,他就已经意识到所有闭源工具都可能发生数据泄露,但为了工作效率,他不得不继续使用。

AI助理可能打破系统安全的“血脑屏障”

上世纪30年代,有社会运动设想通过技术手段重构社会秩序,相信科学组织生产和分配能够解决一切问题。二战后的富足生活让这类运动失去了市场,但他们的部分核心设想,比如持续记录每个人的行为并据此分配资源,已经在过去几十年被商业公司实现。

从上世纪60年代的航空订票数据记录,到互联网时代的用户行为追踪,平台通过打标签对用户进行分类,再到如今大模型重新解读用户数据,企业对用户的理解不断加深。这类技术既被用于精准服务,也被用于筛选易感人群。

大模型正在让用户数据的商业化应用更高效,部分企业已将用户与AI的聊天记录用于精准广告投放,大幅提升广告转化率。个人助理产品将为企业带来更多用户数据,这类助理的模型只能部署在云端,用户的数据必须全部提交,这将打破现代操作系统保护隐私的“血脑屏障”。

相关企业已推出多款云端个人助理产品,通过虚拟机模拟操作完成各类复杂任务。这类产品已在部分地区取得高下载量,可以预见,全球主要科技公司都将跟进这一赛道。部分企业为虚拟机添加了隔离层,但提供服务的企业,仍能借此更深入地了解用户。

部分开发者为自己开发的Agent添加了隐私保护功能,将敏感信息在本地替换后再提交给模型。开发者认为,这是开发者应有的社会责任感,不能利用普通人的信息盲区获利。

“个人对抗不了这种大趋势。”林峰认为,普通人能做的就是分隔工作和个人数据,为资料划分隐私等级,少给AI授权权限:“打死都不能交出去的,尽量别让AI碰。”

2023年底施奈尔写下那篇文章时,大公司用模型读懂上亿用户还只是推演。不到三年,这一设想已经进入了大公司的产品说明书,伴随着前所未有的数据规模。

- FIN -

以上内容不代表本平台立场,仅供读者参考