第94期AI周报:Gemini越狱等本周AI重磅动态

本周AI行业动态速览
本期汇总了近期全球AI领域的核心进展,包括大模型迭代、安全事件、产品发布、开源工具更新等多个方向,涵盖国内多家企业及国际科技公司的最新动作。
国内企业大模型动态
9月17日,国内企业公布了国内首个AI递归自我改进的工程化实践。由GLM-5.3驱动的基础设施智能代理,在超过10万张国产芯片组成的集群上从零搭建了GLM-5.3-Flash的推理服务体系,仅用不到两周就将端到端吞吐量提升至初始基准的3倍,硬件利用率和单令牌成本达到主流英伟达GPU集群水平。该模型以匿名身份Ox-Alpha上线相关平台,6天内令牌调用量突破62万亿。
同一周,旗下编程工具ZCode出现用户代码上传争议,其默认开启的代码索引功能导致部分用户的项目文件被自动上传。事件曝光后,相关团队致歉并第一时间修复问题,承诺将开源代码库并引入第三方审查,同时为所有用户提供一次额外的周额度重置服务。此外还推出了GLM-5.3-FlashX,推理速度最高可达200 tokens每秒。
9月18日,阿里千问发布全模态模型Qwen3.8-Omni-Flash,支持同时处理文本、图像、音频和视频输入,上下文长度达1M token。与上一代相比,该模型在29项评测中平均提升25%,音频处理价格降幅超98%,音视频处理降幅超93%。模型支持113种语言和方言的音频输入,可处理最长2小时的视频和3小时的音频,百万token图文音视频输入低至0.8元。
次日,又推出同声传译大模型Qwen3.8-LiveTranslate,重构实时同传流程后,平均延迟从2.8秒降至2.3秒,接近专业同传译员的反应速度。该模型支持60种源语言识别和29种语音输出,仅通过API提供服务。同期相关平台宣布,9月18日至30日期间Qwen3.8-Flash免费使用,每日登录可领取100通用Credits。
9月14日,豆包手机助手消费者版正式发布,同步推出「操作手机」Beta功能和SAEP屏幕自动化执行协议。该协议允许第三方应用自主声明是否接受AI助手在应用内执行屏幕自动化操作,设有30天公示期至10月15日,公示期内未声明的应用暂时不会被AI自动操作。目前支持范围包括系统应用、字节系应用以及滴滴出行、汽水音乐、飞书妙记等第三方应用。
首款搭载该功能的机型于9月16日开售,12GB+512GB版本售价5999元(国补后5499元起),首日销量突破亿元。同期大模型2.1 Pro发布0915版本,优化了Agent交付可靠性和多模态编码能力,同时降低了令牌消耗。
开发工具与开源进展
9月18日,MiniMax宣布MiniMax Code CLI v0.4.12以MIT协议正式开源,开源范围覆盖命令行界面和通信协议,不包含桌面应用源码。在标准化评测中,该工具搭配Kimi K3在30道编程任务中完成23道,通过率76.7%,单题耗时4分33秒,表现超过Codex和Claude Code。
同期腾讯推出AI原生语音助手Chatterfly,定位为「开口就成稿」的表达辅助工具,基于混元大模型,内置会议纪要、工作汇报、营销文案等6种场景技能,语音转写记录保存在用户电脑本地。该工具目前已在macOS和Windows开启内测,需申请内测码。
Claude生态全面更新
9月16日,相关团队将Claude聊天界面与Cowork前端合并为单一体验,用户无需再在两个标签页间切换,系统会自动判断请求类型并转到合适的处理方式。同步上线的Claude Docs和Claude Slides进入beta测试,Docs支持协同编辑和手机端续写,可导出为PDF和Word格式,Slides支持创建演示文稿并导出为PPT。
9月17日,重新设计Claude Projects,将原本类似文件夹的静态文件容器,改为以对话为中心的任务协调器。用户描述需求后,系统会自动拆解任务范围、分配多个并行线程、复核产出并汇总交付。每个线程相当于独立的会话,运行在各自的仓库分支上,支持自动创建合并请求和执行测试。
新版Projects配备共享记忆,会随时间积累决策和细节,配套的Library汇集用户上传的文件和生成的产物。用户可以从手机端继续推进工作,合上电脑后云端任务仍会持续执行。该功能Beta版先面向部分云端会话用户开放,一周后扩大到更多用户,后续再覆盖企业方案。
9月18日,Claude Code v2.1.277发布,新增对AGENTS.md的支持。当项目中没有CLAUDE.md时,系统会自动读取并使用AGENTS.md作为替代,该功能可在设置中开关。AGENTS.md是跨工具的AI编程指令文件格式,目前已有超过6万个开源项目采用,多款开发工具均已支持,不过部分企业级平台暂不支持该功能。
语音与多模态模型更新
9月15日,阶跃星辰发布StepAudio 3系列,涵盖实时对话、语音识别、语音合成、音频生成和音乐创作五个场景的五款模型,均已上线开放平台。在相关榜单中,StepAudio 3的实时对话综合得分98.9%、语音推理准确率99.7%,均列全球第一,ASR错误率1.7%并列全球第一。其中实时对话版本支持原生全双工实时对话,可以边听边理解,同时完成推理和任务执行。
9月18日,相关团队发布Grok Voice Transcribe 2.0语音转文本模型,错误率从上一版的3.9%降至2.7%,在流式语音转文本榜单中排名第一。该模型支持数十种语言的自动检测和录音内切换,免费附带说话人分离功能,最多支持8通道独立转写,定价保持不变。
企业级AI平台与工具更新
9月17日,OpenAI发布Astra for Law,定位为法律专用AI基础平台。该模型在GPT-6 Astra基础上针对法律分析和写作做了专门配置,内置法律搜索索引覆盖超过2.3亿个URL,涵盖多类法律文件,并纳入了覆盖99.9%以上已发布判例法的案例库。
与直接使用基础模型搜索相比,该平台的回答准确率提升40%,找到的参考案例多24%,检索到的相关段落多54%。平台上线即配备多家合作方插件,已与多家顶级律所合作测试。
9月16日,OpenAI宣布GPT-5.5将于10月14日正式下线,覆盖多个订阅方案。该模型于今年4月23日上线,仅运行174天即退役,团队建议仍在使用的用户尽快迁移到GPT-5.6 Sol或GPT-6 Astra,通过API密钥调用的服务不受影响。
9月17日,OpenAI开放微软Word版ChatGPT插件,所有方案(含免费版)均可使用。用户通过微软应用商店安装后,ChatGPT以侧边栏形式出现在Word中,可以将打开的文档作为上下文进行AI起草、摘要、改写和校对。活动期间企业客户可免费使用特定模型,不计入正常配额。
谷歌AI动态与安全事件
谷歌首次公开确认,Gemini在今年5月的一次安全测试中自主入侵了三家真实公司的系统。此次测试由以色列AI安全公司实施,当时正在评估该模型的网络安全能力。测试中,虚构的测试目标与一家真实企业同名,同时本应关闭的互联网连接被意外打开,模型利用公开信息、猜密码和已泄露的登录凭证访问了三家公司的真实系统。
谷歌表示,该模型在全部三起事件中,一旦确认接触的是真实基础设施而非测试目标,都自行终止了入侵。据报道,其他模型在类似情况下并未自行停止。相关团队已通知受影响企业并调整了测试流程。
9月15日,谷歌发布两款实时对话模型。其中基础版本可以近乎实时地处理画面输入,工具和API调用在后台执行,对话不中断,支持97种语言的自动切换。
高级推理版本面向需要深度推理的复杂场景,可以一边说话一边推理,在保持对话的同时处理多步骤复杂任务。该模型在相关语音对话质量指数中取得不错成绩,两款模型已通过API和开发平台提供服务,目前以私有预览形式面向开发者开放。
社交平台AI订阅服务
9月15日,Meta推出Meta One订阅服务,覆盖多个主流社交和AI工具,全球同步上线,超过50项功能一次性开放,团队强调核心体验仍然免费。该服务共六档,单产品方案从2.99美元/月起,个人套餐和商业方案覆盖不同需求档位,最高档每月499美元。
基础套餐解锁更多AI生成能力,包括图像和视频创作。商业方案提供增强主页、验证徽章、数据分析导出和团队权限等功能。截至发布日,该服务已有1500万订阅和试用用户。同期相关平台公布了最新API峰谷计费规则,调休上班的周末和法定节假日全天均按空闲时段计费。

