智象未来vivago R1:AI生成长视频技术突破与合肥资本布局

2026年7月,AI生成内容领域迎来一则引爆行业的消息:成立仅三年的智象未来,在三个月内完成三轮融资,累计金额突破21亿元,吸引了超20家顶级机构争相入局。这家快速崛起的独角兽企业,其核心产品vivago R1究竟有着怎样的实力,能获得资本的集体看好?
7月20日的世界人工智能大会上,智象未来正式推出了一款支持不限时长内容创作的多模态智能创作工具vivago R1。用户仅需上传少量照片并搭配简短文字描述,就能一键生成分钟级别的连贯长视频。距离产品发布仅三天,智象未来便宣布完成15亿元人民币的C轮融资。
当前AI视频生成领域普遍存在一个核心痛点:绝大多数工具只能产出15到30秒的短镜头,一旦尝试生成长视频,很容易出现人物变形、逻辑断裂的问题;如果需要调整某个角色或一段情节,用户往往需要从头开始重新生成,极大影响创作效率。而vivago R1的核心突破,正是通过“长程推理”能力解决了这些行业难题,它不再是一个“提示词输入、视频输出”的黑盒工具,而是一个能够自主规划任务、调度资源、持续推进创作的多模态智能体。
在vivago R1的设计逻辑中,Skill不再是简单的功能按钮,而是将专业创作方法进行了产品化封装。它把专业创作者需要完成的脚本拆解、镜头调度、素材复用、风格控制以及生成顺序等复杂流程,浓缩成了用户可以直接调用的标准化创作方法。用户无需理解模型参数或复杂工作流,只需明确自己需要制作产品广告、故事短片还是品牌宣传内容,Skill系统就会将创作目标转化为智能体可以执行的具体工作协议。
SkillHub是这些创作方法的统一组织系统,它将抽象的AI能力转化为用户能够直观感知的创作场景,让用户从“我想做什么”快速过渡到“我可以开始创作”。截至目前,SkillHub已经沉淀了数百个经过真实项目验证的创作Skill,覆盖了从跨境电商爆款素材生成、影视团队分镜制作到个人创作者剧情号运营等各类场景。
支撑这套Skill体系的核心,是vivago R1的分层记忆与多Agent协作架构。我们可以用最直观的方式理解它的运行逻辑:这套系统就像一个专业的影视创作团队,各司其职又协同配合。
• 最上层是调度层,相当于总导演,只锁定最终定稿的内容——包括角色设定、叙事主线以及已经确认的创作决策,过滤掉创作过程中的无效噪声,不会因为某一段生成失败就影响整体创作进度。
• 中间是专家层,分别驻守着编剧Agent、导演Agent、设计师Agent和剪辑师Agent,每个专家都拥有独立的记忆模块,负责各自的专业创作环节:编剧Agent跟进故事线推进,导演Agent把控镜头语言的一致性,设计师Agent确保视觉风格的统一。
• 最下层是执行层,负责分段执行生成任务,每个执行子Agent只处理单一段落的创作,完成后即释放资源;如果某一段生成失败,也只会针对该段落进行重试,不会影响整体项目进度。
在WAIC展会现场,智象未来创始人兼CEO梅涛将这套机制的运行逻辑概括为“记忆逐层变轻,定稿逐层上浮”,这恰好贴合真实影视创作者的工作直觉——一位成熟的导演不会在拍摄第二场戏时还纠结第一场戏的细节,已经确认的内容会作为定稿留存,被舍弃的细节则沉入底层记忆。
除了核心的架构设计,vivago R1的交互方式也充分考虑了创作者的使用习惯,提供了Chat和画布两种视图模式。Chat视图作为任务推进面板,负责承接用户的创作意图输入、素材装配,同时记录用户与智能体协作的完整时间轴;画布视图则作为项目上下文面板,将创作过程中产生的所有关键内容整合为可浏览、可调整、可复用的成果空间。这种双视图设计,让用户既可以在Chat中边沟通边推进创作,也可以在画布中整体把握项目的完整进展。
更贴心的是,当视频创作完成后,用户无需再经历“导出文件-打开平台-重新上传-填写信息-二次调整”的繁琐流程,vivago R1支持直接绑定TikTok、YouTube等海外主流内容平台账号,实现一键分发。对于内容创作者来说,这一步的流畅度往往直接决定了创作的持续性——这正是提升创作效率的关键细节。
从SkillHub的创作方法引导,到分层记忆的多Agent协同,再到Chat+画布的双视图协作,最后到一键分发的完整链路,vivago R1试图打造一个能够在用户意图引导下,完成从创意构思到内容发布全流程的“创作智能体”。这也折射出当前AI视频生成领域的核心趋势:行业竞争已经从单纯的模型效果比拼,升级为具备思考能力的智能体综合实力的较量。
20余家机构密集押注,合肥国资再下一城
7月23日,智象未来正式宣布完成15亿元人民币的C轮融资。相较于融资总额,这笔融资的节奏与资方阵容更值得关注。从今年4月完成超5亿元的首轮融资,引入东方富海、安徽省投资集团旗下产业投资平台、峰华资本等机构;到5月获得深创投、金浦投资、财鑫资本、复聚资本的加注;再到7月敲定15亿元C轮融资,智象未来在三个月内完成了三轮融资,整体融资规模突破21亿元。
此次融资后,智象未来的股东阵容已经形成了“国家队+地方国资+产业资本+顶级财务机构”的多元格局。领投方包括社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本;跟投方涵盖厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等;老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本也持续跟进加注。
值得注意的是,社保基金此次入局,标志着长期资本在原生全模态世界模型赛道的重要布局。而在产业资本方面,除了本轮进入的华策影视与上影新视野基金,湖北长江电影集团早在A轮就已入股,三家影视产业资本同时出现在AI大模型公司的融资名单中,这在行业内并不多见。目前华策影视已经专门设立了AIGC专项基金与AI视频投资基金,可见对赛道的长期看好。
在所有资方中,合肥国资的身影格外醒目。作为一家总部落地合肥的企业,智象未来的融资历程始终与合肥国资深度绑定。早在2024年,合肥产投与安徽省人工智能母基金就领投了智象未来的A轮融资;今年以来,这两家机构继续跟投,安徽省产业投资集团、合肥高投、兴泰集团等也陆续加入股东阵营。加上本轮创云海资本、航源资本等合肥本地资本的入场,合肥背景的投资机构已经覆盖了智象未来A、B、C三轮融资。
这背后正是合肥产业投资逻辑的延续。过去十年,从京东方、长鑫存储到蔚来,合肥国资的投资策略并非追逐短期风口,而是围绕关键产业链提前卡位,通过龙头项目带动产业集群发展。此次押注智象未来,逻辑同样成立:AI正在成为新一轮产业基础设施,而视觉生成与原生全模态大模型,正是其中应用外溢性最强的赛道之一。今年以来,智象未来已经多次作为合肥在人工智能领域的标杆企业,亮相中国科交会、链博会等国家级展会。从算力基础设施到AI应用生态,智象未来正在成为合肥AI产业版图中的关键拼图。如果说长鑫存储代表了合肥的存储芯片产业名片,蔚来代表了新能源汽车产业,那么智象未来所在的原生全模态大模型赛道,或将成为合肥下一张产业名片——生成式人工智能的基础设施。
从内容生成到世界构建:AI的下一站
这一轮密集融资的背后,智象未来正在重新定义AI与现实世界的关系。在WAIC 2026的主题演讲《迈向世界模型:原生全模态推动智能体能力跃迁》中,梅涛系统阐述了团队对AI下一阶段演进方向的判断,并抛出了核心命题:AI大模型正在从“理解世界”走向“改变世界”,而实现这一目标的关键,是原生全模态世界模型与智能体的双线并进。
在梅涛看来,尽管“世界模型”的概念被行业频繁提及,但当前的技术路线并不统一:有的团队从3D空间建模切入,有的通过长视频生成逼近世界模拟,还有的沿着具身智能路线解决动作规划与物理交互问题。而智象未来选择的是原生全模态(UiT)技术路线,在模型底层就将“世界的运行规律”写入了模型的核心逻辑,让AI能够以统一的方式理解视觉、语言、动作与空间关系。正是这一架构,让智象未来具备了“Any to Any”的能力:支持任意模态的输入,转化为任意模态的输出。
梅涛用一句话概括了智象未来的技术核心:“图像是通往世界的起点,也是重塑世界的入口。”在他的理解中,图像并非单纯的静态画面,而是承载了时间与空间信息:在图像序列中加入时间维度,就可以生成视频;加入立体几何参数,就能构建3D虚拟世界;与真实世界完成交互与操作,就实现了具身智能。这条技术路径,正是智象未来对“从多模态走向原生全模态,再到世界模型”的完整落地规划。
在WAIC演讲的最后,梅涛总结了这条技术路线对AI未来的意义:大模型负责让AI理解、感知世界,智能体赋予AI执行、行动的能力,而原生全模态世界模型则打通了认知、行动与反馈的完整闭环,推动AI从单纯的内容生成,走向真正改变现实世界的应用落地。
据智象未来官方披露,其自研的UiT(Unified Transformer)原生全模态架构,闭源Pro版本的参数量已经突破2000亿;而vivago R1依托HD-AgentOS全流程调度与治理能力,内容的有效可用成功率达到了85%。今年6月,智象未来的商用图像模型HiDream-O1-Image-1.5,在独立AI模型评测平台Artificial Analysis上以1265 ELO的评分位列全球第二,仅次于OpenAI,超过了Google、NVIDIA和字节跳动等科技巨头的同类产品。
从2017年梅涛团队在微软亚洲研究院发表全球第一篇文生视频论文,到2026年vivago R1实现普通用户一键生成连贯长视频,AI视频领域的进化速度远超行业预期。当几十秒的短视频不再需要数十人的团队协作,当120分钟的剧集制作周期被压缩到一个月甚至更短,那些原本被技术门槛与制作成本挡在门外的创作者,将会创造出怎样的全新叙事?答案或许才刚刚开始浮现。

