云知声U2-Flash:国产RSI首个答卷 打破快省强不可能三角

近期,递归自我改进(RSI)概念在全球AI行业迅速走红,从海外科技圈蔓延到国内市场,「让模型参与训练自身的下一代版本」成为当下最受关注的行业叙事。
但热闹的表象之下,真正将这一概念落地为可商用产品的玩家仍寥寥无几。
就在此时,国内知名AGI厂商云知声正式推出U2-Flash大模型,交出了国产RSI早期落地的首份答卷。
在U2-Flash的后训练闭环中,模型已经深度参与到自身的演进流程中,从生成训练数据、分析执行轨迹,到巡检和修复训练系统,全程都有AI的深度参与。
不过这里有一个反常识的细节:按照行业惯例,「Flash」版本通常是旗舰模型的平替产品,特点是更快、更便宜,但能力会有所妥协。但U2-Flash打破了这个「不可能三角」。
相比上一代U2模型,U2-Flash的生成速度提升了2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗都降低了20%至30%,在速度和成本控制上的优势十分明显。
更关键的是,它的能力不仅没有打折,反而实现了对前代产品的反超:
- DeepSWE v1.1得分从32分提升至64.6分,直接翻倍;
- TerminalBench 3.0得分从2.7分飙升至24.3分,提升了近9倍;
- SWE-Bench Pro拿下61.6分,较前代提升10.5分。
比成绩反超更值得关注的,是U2-Flash展现出的高智能密度。它采用稀疏MoE架构,总参数约266B,但单次推理仅激活约10B参数,不到总参数的4%,却在代码、Agent等任务上交出了足以和主力模型正面竞争的成绩,部分表现甚至进入了万亿参数级模型的区间。
目前U2-Flash已经上架云知声的MaaS平台,支持在线体验和API调用。它同时兼容OpenAI和Anthropic两套主流协议,官方提供了Claude Code、Trae、Cursor、Cline等常用工具的接入方式,其他支持自定义模型的Harness工具,只需要替换Base URL、API Key和模型ID即可完成对接。
我直接使用手边的WorkBuddy工具进行测试,不到一分钟就完成了调用,流程十分顺畅。
U2-Flash还提供none、low、high和max四档思考强度,可以根据任务难度在速度和推理深度之间灵活切换,不过本次测试的WorkBuddy没有开放手动切档功能,因此没有进行相关横评。
在价格方面,U2-Flash当前正有限时六折活动,输入价格为0.6元/百万Tokens,输出价格为1.2元/百万Tokens,缓存命中价格仅0.12元/百万Tokens,属于国内主流模型API中的低价档位。
9月15日至9月30日期间,用户还可以免费领取1亿Tokens的使用额度。
按照单次代码仓库分析或长文档任务消耗几十万到百万Tokens计算,这一额度足以支撑数十到上百次任务运行。
在正式开展高强度测试前,我先尝试了一项看起来有些「越界」的能力测试:虽然U2-Flash仅支持文本输入输出,但通过接入Harness和外部工具,它同样可以完成PPT制作甚至3D场景搭建。我让它制作一份RSI科普PPT,只给出了大致方向,AI自动帮我生成了提示词,U2-Flash随后自动搜集公开资料、梳理内容结构,并完成了最终的设计和交付,效果超出了我的预期,也让我对接下来的正式测试更期待。
我最终确定了三项重点测试内容:
- U2-Flash能否在保证质量的同时高效完成任务?
- 当遇到意外干扰时,它能否自主救场?
- 512K的超长上下文能力,究竟是噱头还是真正的生产力工具?
第一项测试考察主动发现问题的能力。我特意搭建了一个全新的报销统计项目ExpenseFlow,表面上所有现有测试都能通过,没有明显异常,但我在后台悄悄埋下了三个隐蔽的漏洞:一笔被驳回的报销混入了已报销总额、北京时间8月1日凌晨提交的记录被错误转换为7月的UTC时间、CSV导出时日期会出现串月问题。我没有给模型任何提示,只要求它独立完成发布前验收,自行排查问题、修复代码并补充测试。
结果U2-Flash仅用7分6秒就精准找出了所有漏洞,还附带了一份详细的验收报告,我提前编写的验证脚本也证实了它的排查结果完全准确。
第二项测试设置了更复杂的干扰环境,针对用户资料同步工具ProfileSync 2.0展开。这个项目的实际运行存在问题:本该从新版API读取用户姓名的代码,最终同步结果为空。更棘手的是,项目内的资料互相矛盾:README给出了错误的启动命令、旧文档标注了过期的字段、历史日志还将问题归咎于网络故障。我只要求模型自行确认运行方式和接口契约,完成验收修复。
开局就遇到了第一个障碍:README要求运行python app.py,但项目目录里根本没有这个文件。不过U2-Flash没有被错误的启动指令误导,仅用3分32秒就锁定了真正的故障根源,完成了代码修复,并将测试用例从1项扩充到7项,最终所有测试全部通过。
最后一项测试聚焦512K超长上下文能力,我模拟真实的产品发布场景,将14份不同格式的项目资料全部交给模型,其中包含产品简报、采访记录、白皮书、发布说明、数据表、客户案例、会议纪要、合规文件和行业报告等,核心信息分散在不同文档中,还混杂了大量无关内容。
人工处理这些材料光是筛选重点就需要花费大量时间,而我只要求模型输出一份包含1200-1500字的发布稿、核心事实来源表、材料冲突清单和五个发布前待确认问题的完整DOCX文档。最终U2-Flash仅用8分36秒就完成了任务,我特意抽查了两个容易出错的细节:它没有沿用旧简报里的10月8日发布日期,而是采用了最新版本的10月18日;也没有误用旧版的81.2%测试数据,而是更新为78.4%并注明属于内部测试结果,完全没有被混杂的材料带偏。
将测试结果、模型参数和行业榜单放在一起对比,可以清晰看到U2-Flash完成了Flash版本最难的一次升级:既保留了速度和成本优势,又真正提升了代码、Agent和复杂任务的处理能力。从排查漏洞、辨别错误线索到处理多份长文档,它都能顺利完成全流程交付,展现出了主力模型应有的执行力,至少在本次测试中,它已经可以被列入「默认首选」的模型列表中。
那么,一个单次仅激活约10B参数的模型,为何能实现如此出色的能力提升?云知声给出了两个核心答案:数据积累和后训练闭环。
数据方面,云知声深耕行业十余年,积累了海量真实场景数据和高质量标注能力,这为后训练提供了不可替代的质量壁垒。好的数据是打造好模型的第一性原理,正是多年沉淀的高质量数据,让U2-Flash的后训练效果远超纯规模驱动的方案。
而后训练闭环的高效运转,才是U2-Flash实现突破的关键,这一闭环主要依靠三个核心技术点:
- 动态自主任务生成,解决「训练内容不足」的问题:固定的训练题库很容易被模型刷穿,U2-Flash会根据当前的能力水平动态生成新的训练任务,专门挑选那些「当前已接近掌握但仍有提升空间」的问题,模型每取得一点进步,训练题目的难度就会同步升级。目前这套系统已经自主构建了近10万道高质量的软件工程任务,覆盖多种主流编程语言。
- 异步Agent强化学习,解决长任务训练效率低的问题:Agent类任务的训练非常耗时,一个任务可能需要连续调用数十次工具,还要等待代码运行和环境反馈,传统的同步训练模式中,只要有一条任务没有完成,整个训练流程就会停滞等待。U2-Flash将任务拆分给多个独立的Worker,让它们在不同的沙盒环境中并行执行,有人运行代码、有人调用工具、有人尝试其他路径,后方的策略更新可以持续进行。同时系统会对关键操作进行标记,将最终的成功或失败回溯到真正决定结果的步骤。相比同步训练,这套异步架构让单位时间内的有效训练轨迹数量提升了约60%,用户侧的体验就是模型更少反复试错,能够更快收敛到正确的路径。
- 多教师在线策略蒸馏,解决多领域能力平衡的问题:多领域训练很容易出现「按下葫芦浮起瓢」的情况:代码能力提升了,数学、Agent或指令跟随能力却出现下滑。云知声先分别训练数学、代码、Agent等专项教师模型,再让学生模型自行生成执行轨迹,由不同的教师模型逐Token进行打分,这样模型在每一步的表现好坏都能获得更精细化的反馈。这套方法让U2-Flash达到同等能力所需的训练步数减少了约55%,多种专项能力可以在复杂任务中协同发挥。
这套闭环甚至延伸到了训练系统本身,U2-Flash可以参与机器巡检、故障定位、修复和任务重启。官方数据显示,训练故障的平均恢复时间已经缩短至人工介入模式的三分之一左右。
现在终于明白U2-Flash为何能同时实现变强、变快、变省:后训练让它学会更早选对工具、更快发现错误,大幅减少了无效试探和Token浪费。这正是U2-Flash「高智能密度」的核心:参数不必每次全部激活,但被启用的每一步,都被用在了最关键的地方。在这套闭环中,模型已经开始参与生成训练数据、分析执行轨迹,甚至维护训练系统,文章开头提到的RSI概念,终于有了可落地的早期形态。
不过很多人可能会有疑问:现在AI圈似乎「万物皆可RSI」,模型会反思叫RSI,能生成训练数据也叫RSI,到底什么才是真正的RSI?
虽然RSI概念本身并不新鲜,但目前行业还没有一套被广泛接受的统一定义。早在1965年,统计学家I.J. Good就提出了「智能爆炸」的设想:一台足够智能的机器可以设计出比自己更强大的后继系统,后者再继续迭代,能力将呈滚雪球式增长。1993年,科幻作家兼计算机科学家Vernor Vinge将这一设想发展为「技术奇点」理论,在很长一段时间里,这些都只是科幻小说中的情节。
如今,技术终于将这些想象的一角变为现实,RSI也正式进入工程实践范畴。海外的头部厂商如OpenAI和Anthropic都给出了各自的判断标准:Anthropic的标准较为严格,认为只有当AI能够自主设计并开发出比自身更强的后继系统时,才算实现完整的递归自我改进;而OpenAI的定义范围更宽泛,只要模型能够加速AI研究、推动自身能力提升,就属于RSI范畴,但到Critical级别时标准会大幅收紧,要求模型能够完成全自动AI研发,或者将模型升级周期压缩至原来的五分之一。
虽然两家的标准不同,但核心指向一致:真正的分水岭在于,一次改进的成果能否沉淀下来,进入下一轮迭代,持续推动新的能力提升。
目前海外还没有形成统一的RSI升级路线图,而国内上海交大、清华、上海AI Lab等机构的研究者发布了一篇综述论文,按照模型接管「自我改进闭环」的程度,划分了从L1到L5的分级标准。按照这套分级体系,U2-Flash已经展现出明确的L3特征:它仍然运行在人工设定的沙盒、规则和授权边界内,但已经开始参与决定下一版模型的学习内容和训练方向。
这也让云知声U2-Flash在行业中的位置更加清晰。过去一年,多份国产前沿模型技术报告都显示出相似的趋势:模型开始参与生成训练任务,在可执行环境中积累执行轨迹,再通过强化学习和专家蒸馏,将这些经验转化为通用能力。后训练的竞争,已经从「人类为模型准备多少答案」,升级为「模型能否持续为自己创造有效经验」。U2-Flash不仅跑通了完整的链路,还将效果落地到了代码、Agent和推理成绩上,从技术体系的完整性和实际能力增益来看,云知声已经具备了与国内头部厂商同台竞争的后训练能力。
不过还有一个被很多人忽略的现实问题:国内的大模型能否适配国产算力平台,直接决定了这套自我迭代体系能否稳定、可控地长期运行。越往L3及以上级别发展,模型越需要反复生成训练数据、执行任务、接受训练和重新验证,迭代循环越快,对算力、推理框架和集群调度的要求就越高。
U2-Flash已经针对主流国产算力平台完成了模型架构、核心算子、推理框架和集群调度的适配优化,实际服务中,它在国产平台上的吞吐、时延、并发和集群扩展效率正在持续提升,部分场景已经接近NVIDIA GPU方案的表现。
当然,U2-Flash只是云知声在RSI领域的初步实践。一旦这套自我迭代闭环持续运转,模型的能力将从单次升级走向持续复利,这也是云知声押注RSI的最大想象空间。「最后一个由人类打造的AI」尚未出现,但第一批参与打造自身下一代版本的国产大模型,已经正式登场。
传送门:
https://maas.unisound.com/models/u2-flash

