硬核盘点(10.02-10.09):本周AI圈新鲜事,看这一篇就够了!

AI应用场景
1.谷歌发布Gemini 4 Argon,单任务成本砍四成
谷歌发布旗舰模型Gemini 4 Argon,定位企业知识工作与网络安全防御等长周期任务:输出Token上限由6.4万提升至100万,企业自动化AutomationBench以51.3%居首,领先GPT-6 Astra与Claude Opus 5.5。缓存输入价格降95%,较GPT-6 Astra低40%。目前仅经"Fairwind计划"向受信任的安全团队开放,彭博社称部分内部员工认为实际编程表现未及基准水平。
2.Nano Banana 2.1出图腰斩,Flash反超Pro
谷歌发布Nano Banana 2.1,主线是把重心从"出图惊艳"转向"改图可靠":新增蒙版局部编辑,圈选区域外保持不变,该项得分高出上一代84分、高出自家旗舰Pro 122分;多人物一致性较上一代提升128分,支持最多14张参考图与4K输出。出图价格降至上一代一半,但输入与思考输出分别上调至3倍与2.5倍,成本重心从"画"移向"想"。
3.OpenAI四连更!API最高档付费砍半,Auto-review全面免费
OpenAI连续28天每日更新计划推进到第二天,一次放出四项,共同点是均不追逐模型能力指标,从而清理Agent进入实际工作流后的摩擦。API用量等级由五档简化为三档,最高档付费门槛从1000美元降至500美元;Meetings插件将会议记录送入ChatGPT Space,成为后续任务的上下文;Decisions API开放公测,输出概率、选项与数值三类判断,速度约为通用接口10倍。
4.GPT-6全面开放,新增智能界面
OpenAI宣布GPT-6面向全球所有ChatGPT用户开放,核心新能力Intelligent UI让模型按问题自主组合文字、图表、按钮与表单,直接生成可交互界面:产品对比用并排展示,复杂概念转为交互式图解,也可即时创建计算器或小游戏等工具。模型同时被训练为把思考与回答交错进行,内部评测中GPT-6 Extra High首字时间与GPT-5.6 Medium相当而得分更高,需联网检索的问题平均提前44%作答。
5.谷歌开源EmbeddingGemma 2,端侧跨模态检索
谷歌开源EmbeddingGemma 2,主线是把多模态检索从云端API搬到设备本地:740M参数,量化后完整模型内存占用约567MB,为谷歌首个原生多模态开源嵌入模型,文本、代码、图片、视频与音频进入同一768维空间,一句话即可跨模态检索。文本、视觉、音频按需加载,纯文本版仅270M,可与Gemma 4搭配做离线且隐私优先的RAG。
6.Vidu Q4预览版亮相,支持4K输出与15张参考图
生数科技发布视频生成旗舰 Vidu Q4,主打“传神表现力”与高性价比。新版本在人物微表情、肢体动态与镜头衔接上实现大幅突破,文戏内敛、武戏爆发均连贯自然;支持单次调用 3 段参考音频与 15 张参考图以保障人设与场景一致性,并开放 2K/4K 与 10bit 高阶画质。得益于规格普惠化,同等预算出片效率最高提升 5 倍,全面赋能电商广告多版本开场测试与影视分镜高效预演。
AI行业动向
1.影视公司自训模型,盲评挤进全球第二
Utopai Studios基于MiniMax H3后训练,Utopai X在Artificial Analysis双盲评测中位列全球第二,物理规律和音频同步两项排名第一。其优势不止是模型,而是将生成能力嵌入PAI制片系统,通过真实项目、创作者反馈和流程记忆形成数据飞轮,探索AI长片规模化生产。
2.OpenAI公开722篇数学手稿,部分可机器核验
OpenAI公开了一批由未发布内部模型生成的数学成果,包含跨越数论至量子场论的722篇手稿与372个结果家族。该模型共挑战约4000道题目,单个结果平均耗费算力相当于ChatGPT Pro思考3小时,部分手稿更附带Lean形式化证明,将人工核验压力有效转移至机器。针对此次发布,普林斯顿高等研究院学者拒绝了OpenAI的官方顾问安排,另立独立的“数学与AI顾问组”并回应强调:AI产出不等于人类理解,未来的数学研究绝不能由纯AI产出主导,数学家仍需掌控提出问题与构建方法的核心主动权。
3.Manus回归,Base北京,大举招人
Manus恢复独立运营后完成超5亿美元融资,由博裕投资、IDG资本领投,腾讯、红杉中国和真格基金继续加码,目标估值约40亿美元。公司将总部与国内团队落在北京,开放17个产品、工程和运营岗位,并推出Manus 2.0及个人智能体Cue,显示其正重启国内生态合作,迎战更拥挤的Agent市场。
AI行业观点
1.Hinton等联署报告:研发交给AI或引爆加速
AI安全与前沿实验室研究者必读。Geoffrey Hinton、Yoshua Bengio及OpenAI与Anthropic核心高管联署剑桥CASP报告,探讨“AI研发AI”的加速效应。报告指出递归自我改进已具雏形:Anthropic内部AI生成的获批代码占比已从2025年初的个位数飙升至2026年5月的80%以上,AI自主研发率达26%。报告将此拆解为工具辅助、流水线扩编、系统级自我改进三阶段。理想状态下,研发全自动化后一年半内技术进步可提速10倍,但仍面临算力与数据的物理定律约束。
2.为什么Agent越强,企业反而越需要“人”?
大模型消除了技术门槛,却加剧了业务落地难度,FDE正成为连接模型能力与业务结果的关键角色。其深入客户现场,重构流程、接入私有数据并划分人机职责,再将非标项目经验沉淀为可复用的行业能力。此模式的护城河不在于人力外包,而是将前线跑通的逻辑沉淀为平台级复用能力。商业竞争已实质性从“模型参数”转向“行业Know-how与交付标准”。
3.全网疯传,却被OpenAI公关“紧急掐麦”的奥特曼专访聊了什么?
奥特曼在专访中谈及模型能力、安全约束、公司治理及个人争议,证实OpenAI曾因能力进展快于对齐和可监控性而暂停训练。他主张开发者应对Agent失控负责,同时反对全面停止技术研发,并强调心理健康场景中的隐私与干预仍缺乏答案;在安全底线之外,人与人的真实连接不应被AI替代。

