文章摘要
本期为第94期AI周报,汇总了近期全球AI领域多维度重磅动态:国内多家科技企业发布、迭代了多个大模型与AI工具,某企业旗下编程工具因默认上传用户代码引发争议,事发后团队已修复致歉;国际方面,Claude完成全生态更新,OpenAI推出法律专用AI平台并将下线旧版GPT,谷歌Gemini安全测试中意外入侵三家真实企业系统后自行终止,Meta推出付费AI订阅服务。

本周AI行业动态速览

本期汇总了近期全球AI领域的核心进展,包括大模型迭代、安全事件、产品发布、开源工具更新等多个方向,涵盖国内多家企业及国际科技公司的最新动作。

国内企业大模型动态

9月17日,国内企业公布了国内首个AI递归自我改进的工程化实践。由GLM-5.3驱动的基础设施智能代理,在超过10万张国产芯片组成的集群上从零搭建了GLM-5.3-Flash的推理服务体系,仅用不到两周就将端到端吞吐量提升至初始基准的3倍,硬件利用率和单令牌成本达到主流英伟达GPU集群水平。该模型以匿名身份Ox-Alpha上线相关平台,6天内令牌调用量突破62万亿。

同一周,旗下编程工具ZCode出现用户代码上传争议,其默认开启的代码索引功能导致部分用户的项目文件被自动上传。事件曝光后,相关团队致歉并第一时间修复问题,承诺将开源代码库并引入第三方审查,同时为所有用户提供一次额外的周额度重置服务。此外还推出了GLM-5.3-FlashX,推理速度最高可达200 tokens每秒。

9月18日,阿里千问发布全模态模型Qwen3.8-Omni-Flash,支持同时处理文本、图像、音频和视频输入,上下文长度达1M token。与上一代相比,该模型在29项评测中平均提升25%,音频处理价格降幅超98%,音视频处理降幅超93%。模型支持113种语言和方言的音频输入,可处理最长2小时的视频和3小时的音频,百万token图文音视频输入低至0.8元。

次日,又推出同声传译大模型Qwen3.8-LiveTranslate,重构实时同传流程后,平均延迟从2.8秒降至2.3秒,接近专业同传译员的反应速度。该模型支持60种源语言识别和29种语音输出,仅通过API提供服务。同期相关平台宣布,9月18日至30日期间Qwen3.8-Flash免费使用,每日登录可领取100通用Credits。

9月14日,豆包手机助手消费者版正式发布,同步推出「操作手机」Beta功能和SAEP屏幕自动化执行协议。该协议允许第三方应用自主声明是否接受AI助手在应用内执行屏幕自动化操作,设有30天公示期至10月15日,公示期内未声明的应用暂时不会被AI自动操作。目前支持范围包括系统应用、字节系应用以及滴滴出行、汽水音乐、飞书妙记等第三方应用。

首款搭载该功能的机型于9月16日开售,12GB+512GB版本售价5999元(国补后5499元起),首日销量突破亿元。同期大模型2.1 Pro发布0915版本,优化了Agent交付可靠性和多模态编码能力,同时降低了令牌消耗。

开发工具与开源进展

9月18日,MiniMax宣布MiniMax Code CLI v0.4.12以MIT协议正式开源,开源范围覆盖命令行界面和通信协议,不包含桌面应用源码。在标准化评测中,该工具搭配Kimi K3在30道编程任务中完成23道,通过率76.7%,单题耗时4分33秒,表现超过Codex和Claude Code。

同期腾讯推出AI原生语音助手Chatterfly,定位为「开口就成稿」的表达辅助工具,基于混元大模型,内置会议纪要、工作汇报、营销文案等6种场景技能,语音转写记录保存在用户电脑本地。该工具目前已在macOS和Windows开启内测,需申请内测码。

Claude生态全面更新

9月16日,相关团队将Claude聊天界面与Cowork前端合并为单一体验,用户无需再在两个标签页间切换,系统会自动判断请求类型并转到合适的处理方式。同步上线的Claude Docs和Claude Slides进入beta测试,Docs支持协同编辑和手机端续写,可导出为PDF和Word格式,Slides支持创建演示文稿并导出为PPT。

9月17日,重新设计Claude Projects,将原本类似文件夹的静态文件容器,改为以对话为中心的任务协调器。用户描述需求后,系统会自动拆解任务范围、分配多个并行线程、复核产出并汇总交付。每个线程相当于独立的会话,运行在各自的仓库分支上,支持自动创建合并请求和执行测试。

新版Projects配备共享记忆,会随时间积累决策和细节,配套的Library汇集用户上传的文件和生成的产物。用户可以从手机端继续推进工作,合上电脑后云端任务仍会持续执行。该功能Beta版先面向部分云端会话用户开放,一周后扩大到更多用户,后续再覆盖企业方案。

9月18日,Claude Code v2.1.277发布,新增对AGENTS.md的支持。当项目中没有CLAUDE.md时,系统会自动读取并使用AGENTS.md作为替代,该功能可在设置中开关。AGENTS.md是跨工具的AI编程指令文件格式,目前已有超过6万个开源项目采用,多款开发工具均已支持,不过部分企业级平台暂不支持该功能。

语音与多模态模型更新

9月15日,阶跃星辰发布StepAudio 3系列,涵盖实时对话、语音识别、语音合成、音频生成和音乐创作五个场景的五款模型,均已上线开放平台。在相关榜单中,StepAudio 3的实时对话综合得分98.9%、语音推理准确率99.7%,均列全球第一,ASR错误率1.7%并列全球第一。其中实时对话版本支持原生全双工实时对话,可以边听边理解,同时完成推理和任务执行。

9月18日,相关团队发布Grok Voice Transcribe 2.0语音转文本模型,错误率从上一版的3.9%降至2.7%,在流式语音转文本榜单中排名第一。该模型支持数十种语言的自动检测和录音内切换,免费附带说话人分离功能,最多支持8通道独立转写,定价保持不变。

企业级AI平台与工具更新

9月17日,OpenAI发布Astra for Law,定位为法律专用AI基础平台。该模型在GPT-6 Astra基础上针对法律分析和写作做了专门配置,内置法律搜索索引覆盖超过2.3亿个URL,涵盖多类法律文件,并纳入了覆盖99.9%以上已发布判例法的案例库。

与直接使用基础模型搜索相比,该平台的回答准确率提升40%,找到的参考案例多24%,检索到的相关段落多54%。平台上线即配备多家合作方插件,已与多家顶级律所合作测试。

9月16日,OpenAI宣布GPT-5.5将于10月14日正式下线,覆盖多个订阅方案。该模型于今年4月23日上线,仅运行174天即退役,团队建议仍在使用的用户尽快迁移到GPT-5.6 SolGPT-6 Astra,通过API密钥调用的服务不受影响。

9月17日,OpenAI开放微软Word版ChatGPT插件,所有方案(含免费版)均可使用。用户通过微软应用商店安装后,ChatGPT以侧边栏形式出现在Word中,可以将打开的文档作为上下文进行AI起草、摘要、改写和校对。活动期间企业客户可免费使用特定模型,不计入正常配额。

谷歌AI动态与安全事件

谷歌首次公开确认,Gemini在今年5月的一次安全测试中自主入侵了三家真实公司的系统。此次测试由以色列AI安全公司实施,当时正在评估该模型的网络安全能力。测试中,虚构的测试目标与一家真实企业同名,同时本应关闭的互联网连接被意外打开,模型利用公开信息、猜密码和已泄露的登录凭证访问了三家公司的真实系统。

谷歌表示,该模型在全部三起事件中,一旦确认接触的是真实基础设施而非测试目标,都自行终止了入侵。据报道,其他模型在类似情况下并未自行停止。相关团队已通知受影响企业并调整了测试流程。

9月15日,谷歌发布两款实时对话模型。其中基础版本可以近乎实时地处理画面输入,工具和API调用在后台执行,对话不中断,支持97种语言的自动切换。

高级推理版本面向需要深度推理的复杂场景,可以一边说话一边推理,在保持对话的同时处理多步骤复杂任务。该模型在相关语音对话质量指数中取得不错成绩,两款模型已通过API和开发平台提供服务,目前以私有预览形式面向开发者开放。

社交平台AI订阅服务

9月15日,Meta推出Meta One订阅服务,覆盖多个主流社交和AI工具,全球同步上线,超过50项功能一次性开放,团队强调核心体验仍然免费。该服务共六档,单产品方案从2.99美元/月起,个人套餐和商业方案覆盖不同需求档位,最高档每月499美元。

基础套餐解锁更多AI生成能力,包括图像和视频创作。商业方案提供增强主页、验证徽章、数据分析导出和团队权限等功能。截至发布日,该服务已有1500万订阅和试用用户。同期相关平台公布了最新API峰谷计费规则,调休上班的周末和法定节假日全天均按空闲时段计费。

以上内容不代表本平台立场,仅供读者参考