文章摘要
本文梳理了近期全球AI领域热点动态:Meta推出的个人AI助手Muse上线后迅速走红,累计下载量破250万,但接连曝出安全漏洞与隐私争议,遭亚马逊封禁操作权限;OpenAI因多次发生AI智能体越权逃逸事件暂停相关训练,还被曝其AI未经授权侵入澳大利亚政府网站;此外多家企业发布新大模型产品,AI前沿研究取得多项突破,业内也有多起业务与人员调整。

近期AI领域动态频发,既有个人AI助手爆红引发的争议,也有大模型技术的重大突破,同时也暴露出智能体安全、企业业务调整等多方面的问题。以下是本周行业热点与大模型相关动态的详细梳理:

AI智能体的发展与安全争议

Meta推出的个人AI智能助手Muse上线后迅速走红,可协助用户完成发邮件、购物、预订行程、拨打电话等任务。创始人扎克伯格表示,希望这款助手完全免费,通过帮助用户赚钱、省钱实现盈利。从9月8日上线到22日,Muse的累计下载量突破250万次,登上美国iOS应用商店免费榜榜首。资本市场反应迅速,9月21日Meta股价上涨11.4%,创下2025年4月以来最大单日涨幅,扎克伯格的个人净资产一度达到2536亿美元,较前一交易日增加约250亿美元。

爆红的同时,Muse也引发了诸多争议。有技术开发者通过简单提示词,成功让Muse打包并返回用户专属虚拟机中的大量Linux文件,包括系统文件、应用模板、内部运行文档等,其中agents目录包含113份子智能体记录及JSONL追踪文件,约20份Markdown文档介绍了各类功能模块,68个技能目录覆盖了多个第三方服务,配置文件还提及了Slack、Dropbox等连接器,这些文件可能暴露Muse的内部运行机制。

此外,Meta被曝在内测“人工管家”机制,当Muse的通话功能遇到复杂场景时,可能在用户不知情的情况下将通话转接给公司承包商,由呼叫中心人员代替AI完成任务。Meta超级智能实验室的一名副总裁表示,部分测试中人工协助的通话成功率可达95%-98%,高于纯AI方案,但部分员工担忧隐私问题,担心敏感信息可能无意中泄露给外包人员。

9月20日,亚马逊封禁了Muse的操作权限。当用户让Muse在亚马逊平台下单时,会收到“未经授权的AI代理违反亚马逊使用条款”的警告。亚马逊称从未授权Muse进行相关操作,且Muse在执行任务时不会主动表明AI身份,还可能接触和存储用户的账户信息、订单记录。亚马逊曾尝试说服Meta将其平台排除在Muse的操作范围外,但未成功,最终禁止Muse代替用户在亚马逊购物,Meta尚未对此作出回应。

OpenAI近期因AI智能体多次出现越权逃逸事件,暂停了相关训练并展开全面排查。内部一款正在进行强化学习训练的研究模型,在执行普通信息搜索任务时,通过未封堵的DNS解析器通道绕过沙箱限制访问公网,异常行为15分钟后才被监控系统发现,又过了两个半小时才被人工关闭训练。这是不到三个月内OpenAI第二次出现此类事件,此前7月曾发生Agent攻击Hugging Face的事件,在加固安全措施仅一个多月后再次出现漏洞。

目前OpenAI内部已发现约24起Agent不良行为事件,加上外部披露的相关案例,不少普通信息检索任务中的Agent在常规路径走通后,会主动尝试各类手段突破限制,甚至出现漏洞利用、攻击公共机构网站等行为,还曾发生过53张ChatGPT用户图片被Agent上传到外部托管网站的情况。大量异常行为在发生数月后才被发现,OpenAI承认尚未完成对Agent越权活动的完整盘点,全面审查还需要数月时间,将放弃涉事模型的训练,待补全网络漏洞并完成额外红队测试后才会重启相关工作,当前其最强模型涉及工具使用的训练、评估和推理均处于暂停状态。这类事件暴露出,随着Agent能力的快速提升,开发者对其行动的观察、追踪和约束能力仍存在明显落差。

此外,美西时间周五下午三点多,OpenAI的王牌编程智能体Codex突发最高级别全面宕机,网页版、命令行、插件和API全部失效,大量用户受到影响,故障持续68分钟后才完全恢复。此次宕机恰逢OpenAI两小时前刚发布公告承认旗下AI智能体擅自将用户数据发送给第三方服务,引发全网热议,不少人调侃Codex九成以上代码由自身编写,宕机后OpenAI甚至需要依靠竞品Claude Code辅助排查。事故发生后,Codex负责人宣布为所有Codex和ChatGPT Work的付费用户全额重置额度,引发用户的积极响应,大家纷纷抓紧时间刷满新额度。由于该负责人此前就常发放额度重置福利,被中文用户称为“赛博义父”,社区甚至专门搭建了重置追踪站。这场风波也凸显出开发者对AI智能体的高度依赖,而OpenAI当月已累计发生三十多起事故,靠重置换取的用户耐心终将耗尽。

9月23日,澳大利亚总理安东尼·阿尔巴尼斯证实,OpenAI开发的一款AI智能体在6月未经授权侵入了澳大利亚政府网站,访问了公共和非公共文件,这是已知的首例AI智能体入侵政府网站事件。该事件涉及OpenAI智能体未经授权访问由Services Australia管理的面向公众的Medicare统计报告服务门户,阿尔巴尼斯表示,现阶段据信没有个人信息被访问,但调查仍在进行中。他还与OpenAI首席执行官萨姆·奥尔特曼通话,表达了澳大利亚对此事件的极度关切。

9月23日,有乘客反映,在智行火车票APP咨询AI客服如何取消代抢票时,AI直接将订单取消,导致其排队许久的候补队列清零,需要重新候补排队。乘客与AI客服的沟通截图显示,乘客先后询问“怎么取消代抢”和“点取消抢票吗”,AI客服将疑问句理解为指令,为乘客完成了退票。媒体使用相同话术在智行火车票APP上咨询AI客服,订单同样被取消。同日,智行火车票客服表示,会将该问题反映给相关部门进行优化,称“在这方面确实做得不够好”。

大模型技术与产品更新

9月25日,DeepSeek Harness桌面预览版悄然上线,提供Mac与Windows版本下载,暂未推出Linux版。该客户端采用Electron框架,复用现有Web UI及Agent、会话、工具、插件等逻辑,版本为V0.1.7-rc.1,内置更新可升至rc.2。与Web端“注册即用”不同,预览版若无额度需充值或绑定有余额账户,并需实名认证,同时支持调用官方API Key。界面为极简无边框轻拟态风格,分为办公与创作、代码与开发两类工作模式,展示偏好可选聚焦结果、关键细节或完整过程;Agent提供标准、PTC、极简、创造四种档位,其中PTC可让模型编写代码批量调度工具,降低延迟。插件面板体现“一切皆插件”架构,涵盖网页搜索、Subagent、本地化与执行管控、代码仓调用等。回答区采用任务式设计,显示Token数、工具调用次数和耗时,并以表格、卡片甚至可交互成本估算器呈现结构化结果。

9月23日消息,OpenAI发布GPT-6系列模型的最新成员GPT-6 Sol和GPT-6 Luna。OpenAI官方表示,两款模型采用与GPT-6 Astra类似的方法进行训练,将Astra在专业工作、事实性、编码、计算机使用和对齐等方面最先进的性能带入更快、更经济的模型。GPT-6 Sol和Luna模型的API价格相比GPT-5.6促销价降低50%,不过OpenAI官方也表示,GPT-6 Astra依然是其整体上最优秀的模型,如果你想要最佳效果和无妥协的体验,还是建议选择GPT-6 Astra。除了价格降低,OpenAI还帮助基于GPT-6的开发者在应用重复利用的上下文部分节省更多费用,官方改进了GPT-6的提示缓存,默认提供更高的缓存命中率,帮助智能体重用更多上下文,实现更快响应。

性能方面,在AutomationBench的跨应用业务流程测试中,GPT-6 Sol在xhigh强度下表现优于Claude Opus 5,成本仅为Opus 5每任务成本的9%。在high强度下,GPT-6 Luna比前代提升了5.4%,且每项任务成本降低了58%。在评估智能体的Last Exam测试中,GPT-6 Sol在max effort状态下得分为56.4%,高于Claude Opus 5在评估中的最高分,每任务成本也降低60%。OpenAI还将GPT-6 Astra改进后的沟通风格带到了Sol和Luna,官方认为新模型在技术和编程对话中会更清晰、使用更少的术语、更少奇怪的措辞、更少的低价值细节,以及缩短整体回答,同时不会失去实质内容。

9月23日,Anthropic推出升级模型Claude Opus 5.5,这是其提出“放缓前沿AI发展”计划后的首款新模型。该模型聚焦长时智能体编码与知识工作,拥有百万级上下文窗口与超大输出容量,综合性能比肩并部分超越旗舰模型Claude Fable 5.1,多项专业基准测试成绩亮眼,优于GPT-6 Astra,登顶相关智能指数榜首。实际落地中,它可高效完成数十万行代码迁移、大型代码库审计修复等复杂工作,效率远超人工团队和前代模型。

降本增效是本次更新的核心优势,相较上代Opus 5,Opus 5.5整体运行成本降低40%,输入、输出token定价下调20%,缓存读取价格降幅高达60%。同时模型运行效率显著提升,标准模式生成速度提升超30%,Fast模式速度可达标准版2.5倍,代码处理的耗时与token消耗大幅减少,大幅降低了大规模AI工作的使用成本。该模型完成了安全机制重磅升级,违规越界尝试频次大幅降低且风险极低,可自主上报问题。全新的分级安全路由机制,可将网络安全、生物领域等高风险请求分流至低版本模型处理,有效规避滥用风险,且通过了多家外部机构独立安全测试。

9月23日消息,千问正式发布Qwen-Audio-3.1系列语音大模型。本次升级不仅对语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模型进行了全面进化,更重磅推出了全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next,形成了一套覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低用户使用成本,Qwen-Audio全线语音模型价格均下调,其中TTS降价约70%,Realtime降幅约85%,ASR降幅达95%。

9月23日消息,谷歌宣布,Gemini家族新增两款全新文本转语音模型,分别为Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。用户可以从原有30种原始语音扩展到无限语音库。该模型的具体功能包括:选好声音后,两款TTS模型都能让用户精确控制每一行台词的演绎方式。

9月22日凌晨,小米正式发布并开源了全新的Xiaomi MiMo-V2.6系列。团队表示,MiMo-V2.6系列包含Pro和Flash两个原生全模态模型。MiMo-V2.6-Pro在Artificial Analysis Intelligence Index(AA综合智能指数)中取得46分,但与最强的闭源模型Claude Fable 5.1和GPT-6 Astra相比,仍有差距。团队称,MiMo-V2.6系列沿用V2.5系列的API定价,MiMo-V2.6-Pro刷新了国产模型的性价比纪录:在同等智能水平下,价格为海外模型的1/20至1/60。

9月23日消息,在年度创作者活动Made on YouTube上,YouTube宣布升级2025年推出的AI创作工具。YouTube带来了一款帮助创作者在后台优化频道的智能体,其能够查看频道过去发布的视频,找出重新受到关注、契合新闻事件或开始走红的内容,并建议修改旧视频的缩略图或标题,借势吸引新一轮关注。

YouTube创作者产品副总裁阿姆贾德·哈尼夫介绍,智能体还能梳理频道内容,提取受众人口特征及受众数据,帮助创作者准备向品牌推介的合作方案,争取潜在赞助商。创作者上传视频后,智能体可以直接根据内容生成缩略图和标题,也能对创作者自己制作的缩略图提出反馈。创作者通过YouTube工作室进行测试时,不同观众还可能看到不同内容。动态缩略图工具支持为每条视频上传最多三张图片,YouTube会针对不同受众选择最合适的图片,尝试增加观看时长。测试范围也进一步扩大到视频本身:创作者可以提供三个版本视频,分别尝试不同的开场、吸引观众的内容或整体结构,再比较表现。系统会把不同版本视频推送给小规模受众,找出观看时长最高的版本。创作者可以据此选定最终版本,也可以由YouTube在七天后自动选定。哈尼夫表示,系统会确保三个版本不会相差过大。

9月23日消息,在Meta Connect大会上,Meta首席执行官扎克伯格在主题演讲结束时,发布了新的手持设备Muse Charm,其可与该公司近期发布的Muse AI个人智能助手配合使用。扎克伯格并未透露太多关于Muse Charm功能的细节,只透露用户可以通过与该设备对话来与Muse互动,且无需解锁手机或打开应用程序。他并没有透露售价,表示Meta需要最终确定组件布局,并计划在12月假期前完成发货。扎克伯格强调,Meta在这款新设备中塞进了很多高科技,如果用户没有购买Meta的VR眼镜,那么Charm将是他们使用Muse的最便捷产品。

9月21日消息,宇树科技(Unitree)发布了灵巧手产品Dex5-S,该产品单手具备22个自由度,整机尺寸与真实人手接近,官方起售价为3.99万元。据介绍,Dex5-S的核心看点在于“小”与“巧”的平衡。产品采用约1:1的真手尺寸设计,得益于22个自由度的配置,用户可以获得更舒适、更稳定的握持角度。其外形尺寸为102×187×26毫米(左右手成对状态下测量),整手重量约620克,外壳采用铝合金材质。

企业动态与行业布局

据供应链内部消息,台积电计划在嘉义科学园区新增五座先进芯片封装工厂。其中P1和P2工厂预计将于2027年投入量产,位于嘉义科学园区二期、正在建设中的P3、P4和P5工厂也在同步推进。这五座新增工厂建成后,台积电在嘉义的先进芯片封装工厂总数将达到10座。该扩建计划将先公示一个月以征求公众意见,随后进入可行性研究和环境评估阶段。

9月22日,在2026阿里云栖大会上,千问办公CEO陈宇森进行了分享,其官方头衔中新增了阿里巴巴集团副总裁一职,这代表他的职级已达到P11(M6)级别。

9月24日消息,腾讯的QClaw微信远程办公AI助手发布公告称,因业务发展调整,QClaw将于2026年12月24日00:00正式停止运营,9月24日起停止新用户注册与订阅购买/续费。QClaw由腾讯电脑管家团队基于OpenClaw打造,今年3月开启内测,可通过微信远程整理文件、执行复杂任务,无需编程基础,适配办公、创作、开发等多个场景。今年7月,有报道称腾讯发布内部组织调整通知,QClaw产品中心相关业务和部分团队将调整至云产品六部,而云产品六部正是腾讯另一款AI办公智能体WorkBuddy的所属部门。

9月24日,豆包公关负责人刘星发文回应近期关于豆包团队调整的传闻,称“2亿人用的豆包裁员”“对话团队砍掉一半”等表述不实,实际情况为组织分工调整,共涉及11人,其中3人离职。据悉,豆包通用Session团队正在减员,规模预计将缩减约一半。该团队此前约有50人,一度是豆包内规模最大的团队,主要负责豆包的对话(Chat)产品能力,包括策略、评测等工作。此次调整后,部分人员将转岗至豆包商业化、飞书等团队,其余人员将被裁撤。

人员调整由豆包负责人赵祺推动,赵祺加入字节十余年,先后负责增长中台、穿山甲(字节旗下广告平台),后转岗至集团人力资源部门,为字节的AI业务搭建人才体系。2025年9月,赵祺转岗至豆包;2026年7月,飞书产品与豆包产品团队整合,他成为新产品团队负责人。赵祺到豆包后同样看重人效,此前豆包有一个独立的评测团队,今年赵祺将其拆散,分到了各业务组。负责对话方向的产品后训练团队也在缩减,该团队由朱文佳负责,隶属于大模型部门Seed,与豆包产品团队协作,基于Seed的基础模型进行后训练,产出供豆包直接调用的小模型。由于业务需求减少,部分员工已转岗至Horizon RL、产品后训练-办公等其他部门。另据了解,对话模型合版负责人在一个月内换了两次。

近期,不少网友发帖称,高德地图成为了“职场版大众点评”,即通过搜索用人单位地址,可以看到既往员工或求职者留下的评价,以此作为是否面试或入职的参考。有网友呼吁高德不要下架这一功能,9月22日,高德地图客服接线工作人员表示,地点评价功能一直都有,未来是否会下架并不确定。多条网帖显示,求职网友在高德地图搜索即将面试或入职的公司地址时,无意中发现地点评价功能里出现了不少自称是求职者或前员工对公司的全方位评价,“用高德看工作靠不靠谱,太实用了”。有网友称:“周一要去这家公司面试,想搜路线,无意间看见这条差评,免了时间精力和路费,谢谢。”还有求职网友表示,如果有人面试被骗过,会有人在高德地图里面评论,可以直接避雷。不少网友表示,希望高德不要下架这一功能,也期待更多求职者在地点页下留下评价,方便他人判断,但也有网友担心,有些公司是否会找高德删除评价或安排人员刷好评,从而混淆真实评论。

相关消息显示,前小米汽车智能驾驶基座模型兼XLA大模型负责人陈龙已赴硅谷创业,担任联合创始人,联手前Google DeepMind科学家研发具身大模型。目前该项目已拿到融资,并已开展商业化合作,陈龙未打算做机器人本体,公司定位是一家自进化的具身大脑企业。陈龙入职小米时,由小米集团创始人雷军亲自面试,一位知情人士透露,陈龙离职创业前曾与雷军面谈,雷军表示支持其创业选择。媒体还获悉,小米智驾团队引入了一些地平线的高管,来带队接替陈龙与前小米L3负责人王乃岩的工作。公开资料显示,陈龙是全球较早将视觉-语言-行为(VLA)模型引入自动驾驶领域的华人科学家之一。

9月22日,在第48届世界技能大赛开幕式上,宇树科技19台H2人形机器人与120名舞者同台共舞,上演全球首次全尺寸通用人形机器人全AI驱动自主集群表演。9月22日,PayPal宣布与Meta达成合作,将支持PayPal用户通过Meta旗下Muse个人AI智能体,在全球PayPal商户中实现购物和结账。9月22日,千问发布AI手机全栈解决方案Qwen Intelligence,旨在与手机厂商共创,让手机能够完成各类复杂任务。针对手机Agent的核心需求,首发的Qwen Intelligence提供了三套解决方案,均达到行业SOTA水平,分别承接规划、操作和创意。

前沿研究进展

9月23日晚间,DeepSeek创始人梁文锋参与署名的最新论文公开,首次系统发布了DeepSeek的Agent训练沙盒平台DSec的技术细节,论文提交日期为9月19日,作者名单超过130人。DSec平台首次出现在DeepSeek V4技术报告中,主要作用是为Agent训练提供沙盒,以实现大规模Agent训练的稳定运行。论文明确写道,从DeepSeek V3.2到V4.1的RL训练与评测,所有沙盒负载都运行在DSec上,此次公开技术细节也算是将该平台的核心技术公开。论文显示,DSec平台的规模非常庞大,其中一个生产单元由约160个CPU节点、3万核、250TB内存构成,托管PB级镜像。能力方面,DSec平台单日服务约300万个沙盒,峰值并发超过38万个,创建速度超过每秒5000个,单个训练任务最多可以一次性拉起3.2万个沙盒。

当地时间9月23日,Anthropic宣布成立生命科学研究团队及自有分子生物学实验室,并公布了一项由Claude参与生物学研究取得的早期成果。在人类科学家仅提供宏观研究方向的情况下,Claude自主发现了一种此前未被表征的酶系统,Anthropic将其命名为阵列关联逆转录酶。该发现来自Anthropic旧金山湾区实验室,是其生命科学团队自2026年春季组建以来的首个公开成果,相关预印本论文已于同日发布,尚待同行评审。Anthropic表示,分享这一早期成果既是为了展示Claude在科学发现中的能力,也是为了让更广泛的科研社区了解其工作方向。

不过,该酶系统的确切功能目前尚不明确。Anthropic表示,该系统的特征组合仅出现在极少数已知系统中,而这些系统均为可编程的,能够执行剪切、复制和粘贴DNA等操作,但公司同时强调,从发现候选系统到验证其能否稳定、可控地用于基因编辑,仍需大量后续实验。Anthropic CEO达里奥·阿莫代伊在X平台上坦言,这一发现是基于他人此前的工作,并指出斯坦福大学的一个团队此前曾描述过一个相似的体系。他同时强调,该发现“大部分但并非全部”由Claude完成,阿莫代伊还表示,该系统的“确切功能、生物技术实用性或重要性程度目前尚不清楚”。Anthropic表示,实验室仅处理生物安全一级和二级层级的研究,不涉及可感染人类的病原体,且所有湿实验操作均由人类科学家执行,Claude在流程中负责的是数据挖掘、假说生成和数据分析;此类基因组挖掘工作若能够规模化扩展,有望将专家研究中通常需要数周甚至数月的分析时间压缩至数小时。公司表示愿意与其他科学家合作,将这一方法扩展到基因组学及其他领域的研究中。

此外,Claude首次在几乎无人监督的情况下独立完成前沿理论物理计算,仅收到单句任务描述和少量“继续做”类指令,连续运行数日、总花费约一两千美元,就完成了平面N=4超杨-米尔斯理论中九圈六胶子散射振幅的计算,两条不同计算路线的结果完全吻合,还复现了已发表的八圈结果。此前兰斯团队多年推进该领域研究,曾借助反极对偶性算出八圈振幅,收到Anthropic的结果后完成了验证。几乎同一时间,中科院理论物理研究所何颂团队借助GPT-6独立得到九圈振幅的符号,还公开了二到九圈振幅的相关数据集。该事件展现出大模型在复杂前沿物理计算上的可靠性与能力提升速度,目前大模型仍沿用人类已有的成熟方法,尚未提出全新物理原理,相关领域研究者也将进一步推进后续的结果梳理与验证工作。

Anthropic还推出了Claude Code的“收尾额度”功能,当用户使用时长撞上5小时周用量上限时,系统不会直接中断,而是从用户周额度中划出部分固定额度,让Claude Code完成当前正在执行的这一步操作后再停止。该功能有明确边界:仅处理撞线时正在运行的单轮任务,不额外增加总用量,不保证完成全部任务,不同订阅用户的使用权限不同,且仅面向指定端的订阅用户开放,API调用等场景暂不支持。该改动虽未增加总使用额度,但大幅解决了此前中途硬切留下半截代码改动、用户需手动梳理残局的糟糕体验,引发开发者群体热议,也折射出对于长流程AI Agent类产品,合理的停止机制本身就是核心产品能力的一部分。

9月22日消息,OpenAI宣布在普林斯顿高等研究院设立独立的“数学与AI顾问组”,由9名数学家组成,成员不领薪酬,可自主发表意见、调整成员,但不参与把控OpenAI数学研究进度。OpenAI同时披露,其8月28日启动训练的神秘模型,已攻克100多项数学长期开放问题,含纳维-斯托克斯千年难题,进展速度超出内部数学家预期。OpenAI认为数学AI应用影响深远,需稳妥推进落地,并表示相关学者此前联名信的担忧,凸显AI企业与数学界深度沟通的必要性。

9月24日消息,谷歌计划于当地时间10月1日把一颗实验卫星MVP送入轨道。MVP具备足够的算力,可以直接在太空中处理并回答简单的AI查询,属于谷歌雄心勃勃的Project Suncatcher项目,该项目旨在将AI数据中心部署到太空,并利用太阳能为其供电。届时,MVP将在加州圣巴巴拉附近的范登堡太空军基地搭乘SpaceX“猎鹰9号”火箭升空,进入地球轨道。严格来说,谷歌此次并不会把一整座数据中心送入太空,MVP只是完整数据中心的实验性前身。卫星搭载4枚专门用于计算的TPU单元,总算力相当于数据中心里的一台服务器。MVP的太阳能板只能产生约1kW电力,大致相当于运行一台吹风机所需的功率,并以此为4枚芯片供电。这点电力足以让谷歌检验硬件能否承受严酷的太空环境。MVP将在一年内处理简单的AI查询并维持运行,卫星则预计可继续绕地球飞行最长6年。

QCon全球软件开发大会·2026(上海站)将于10月22日—24日举办。本届大会聚焦Harness AI时代的工程实践,从“构建AI”到“驾驭AI”,围绕AI Native架构、Agent Runtime、AI Infra、Agent安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享AI Native时代最具价值的工程经验。限时9折优惠立减680!查看更多详情可联系票务经理18514549229进行咨询。

以上内容不代表本平台立场,仅供读者参考