文章摘要
7月23日,智象未来宣布完成15亿元C轮融资,跻身全球AI独角兽阵营。此轮融资投资方多元,反映其独特价值。智象未来选择构建原生全模态架构,技术获第三方验证,且搭建“1+1+3”商业化体系,产品获全球认可,其发展值得长期追踪。

7月23日,多模态大模型企业智象未来(HiDream.ai)宣布完成15亿元C轮融资。这是该公司近三个月内完成的第三轮融资,三轮密集融资总额超21亿元,公司估值突破10亿美金,正式跻身全球AI独角兽阵营。

比起融资额度本身,市场更关注的是此次参与投资的机构阵容,以及资本扎堆押注这家企业的深层逻辑。此轮融资的投资方名单堪称跨类型资本的集结,领投方包括社保基金关联的四川振兴科创基金、工银资本、弘颐资管、敦鸿资本;跟投方则涵盖厦门国贸资本、上影新视野基金、湖北长江产业投资集团等多家机构,同时上影股份、华策影视两家头部影视上市公司,以及来自安徽、上海、浙江等多地的国资平台也参与其中。值得注意的是,合肥产投、东方富海等老股东也持续加注,不同风格、布局逻辑迥异的资本罕见地同步下注同一家创业公司。

智象未来此次C轮融资的时间节点颇具深意,恰好踩中了AI行业范式切换的关键拐点。过去数年,大语言模型凭借代码生成、文本交互能力成为资本和市场的核心焦点,参数规模、推理速度曾是衡量模型竞争力的核心标尺。但随着新一代开源/开放权重模型密集推出,市场对大语言模型估值溢价的分歧逐渐加剧,部分上市AI模型企业的股价波动明显加大。当模型迭代速度加快、技术领先窗口不断收窄,单纯依靠参数堆叠、文本能力领跑的模式已经逼近工程天花板,资本的关注点也从AI“当下能做什么”转向“未来能成为什么”。

与此同时,AI视觉赛道却呈现出截然不同的发展态势,迎来资本的集中爆发。据不完全统计,2026年国内AI视觉领域的融资总额已接近300亿元,既有大厂背景的相关业务线实现ARR大幅增长,也有多家独立创业公司完成大额融资,赛道整体进入技术落地与商业兑现的黄金周期。可以说,多模态已经成为继AI Coding之后,AI商业化确定性最高的赛道之一,智象未来能获得资本市场的青睐,离不开这一行业大环境的加持。

赛道升温并不意味着所有玩家都能获得机会,市场只会将筹码押给真正的头部企业,而一家公司的投资方阵容,往往是最直接的信任投票。梳理智象未来的投资方名单,可以看到三个鲜明特征:国家级资本站台、多元资本集结,以及多家机构的首次出手。此次融资是社保基金作为LP首次布局多模态大模型方向,也是工银资本首次出手该赛道的企业。这种多元化的投资结构在当前一级市场并不多见,通常来说,AI创业公司的融资轮次越靠后,股东构成会越趋集中,仅聚焦少数几类财务或产业资本。而智象未来此轮融资同时吸引国资、产业方、市场化VC密集参与,说明不同属性的资金都在这家企业身上看到了独特的价值锚点。

对于国家级资本而言,其关注的核心是技术路线的战略价值。全模态世界模型是否能最终落地尚无定论,但如果该方向得以跑通,其战略意义将远超单一商业场景,有望成为下一代AI基础设施的重要组成部分。影视产业资本的入局,则是提前卡位内容产业革命的前置布局,上影股份、华策影视与智象未来已经达成多项协同合作,包括新型内容创制、院线场景升级、AI跨屏整合营销,以及AI大屏制片标准与工作流程制定等,显然这并非简单的财务投资,双方都着眼于长期的产业协同。

地方国资的入局则更看重产业布局的长远价值,当前AI竞赛已经进入贴身肉搏阶段,各地都在寻找标志性的科技项目。过去十年,合肥通过投资长鑫科技、京东方等企业,证明了其在行业黎明期下注优质项目的能力,如今智象未来也被放在了类似的战略位置上。而敦鸿资本、弘颐资管、东方富海等顶级市场化VC的集体入局,则是基于对硬核技术落地价值的专业判断,多家机构更是首次布局视觉大模型赛道,这也从侧面印证了智象未来的技术路线、团队积淀与商业化能力具备行业稀缺性与差异化优势。

不同背景的出资人从各自的视角出发,看到了同一技术方向的不同切面,而这些切面共同拼出的完整图景,正是市场最关心的问题——他们共同押注的,究竟是怎样的技术叙事?要回答这个问题,需要回到一个更底层的行业判断:大模型通往AGI的路径,正在发生根本性的路线分歧。过去两三年,AI行业的主流叙事是“规模法则”,即参数越大、数据越多、算力越强,模型就越智能。相关行业专家曾明确表态,三到五年内世界模型将取代LLM成为主流AI架构,这一判断虽未被完全验证,但也指出了大语言模型的先天缺陷:LLM本质上是“书斋里的思想家”,其智能被局限在人类文明已编码的符号系统之内。而世界模型试图解决的正是这一问题,让AI不仅能处理符号信息,更能理解物理世界中的空间、时间、因果关系与交互逻辑。

智象未来选择从视觉像素出发,构建原生全模态架构,这一选择的核心逻辑在于,图像是信息密度极高的模态之一。一张静态图片能够定格某一时刻物理世界的完整状态,空间关系、光影变化、物体材质、色彩信息等所有要素都被压缩在像素矩阵中。传统的多模态模型本质上是“缝合怪”,在语言模型之外额外挂载图片理解模块与生成模块,各模态分别编码后再在外层拼接,以文字作为主轴,其他模态作为插件,信息在不同模块间传递时会产生损耗。

而智象的UiT架构试图颠覆这一范式,它将图像像素、文本Token、视频体素、音频、动作、空间关系等原始信号,全部交由同一套Transformer完成理解、生成与推理,不设置独立的文本编码器,也不使用VAE作为模态间的传导介质,所有信号统一进行tokenization,实现端到端的多任务处理,文生图、长文本渲染、指令编辑、主体驱动、故事板生成等任务,均可由同一个模型完成。

全模态世界模型并非停留在论文中的学术概念,2026年5月,智象的原生全模态架构迎来首个关键节点。其旗下HiDream-O1-Image(8B参数开源版本)以“Peanut”为匿名代号,登上全球知名独立AI模型评测平台Artificial Analysis的文生图榜单开源模型第一名,也是该榜单前20名模型中参数规模最小的版本。随后推出的商用版HiDream-O1-Image-1.5,再次成为该榜单中排名最高的中国图像模型,位列全球前三,在光影表现、复杂构图、指令跟随以及中英文字渲染等方面都有突出发挥。

当然,单次评测登顶并不代表最终的行业地位,视觉大模型的竞争才刚刚进入深水区,榜单排名的变动周期已经从季度缩短至月度,但这一评测结果的坐标意义在于,当行业还在争论“世界模型到底能否落地”时,至少有一条技术路线已经通过第三方评测体系交出了可被验证的答卷。

多路资本集体重仓智象未来,固然有赛道热度的因素,但更深层的驱动力,还是来自该公司在底层架构上的差异化选择,这也让智象未来在众多AI创业公司中展现出独特的质地。与多数重技术、轻落地的AI创业公司不同,智象未来早已搭建起成熟可落地的“1+1+3”商业化体系,实现底层技术、平台能力、场景应用的三级落地。

  • 体系第一层为HiDream全模态大模型底座,承载所有底层技术创新与算力支撑;
  • 第二层为HiHarness企业能力中台,对外输出标准化、可复用的模型能力,适配企业定制化需求;
  • 第三层聚焦商业营销、影视创作、社媒创作三大垂直场景,打造专属AI智能体产品,深度嵌入产业工作流。

其中,在近期行业展会中重磅发布的vivago R1多模态创作智能体,成为技术落地的核心标杆产品。针对当前AI视频生成领域普遍存在的时长受限、画面跳变、人设错乱、可用性低等长期痛点,vivago R1实现了突破性革新,成为全球首款支持无限时长视频自主生成与编辑的创作智能体。该产品搭载长链路叙事规划能力,摒弃了传统“抽卡式”的随机生成模式,先完成整体脚本与镜头规划,再分段落地生成并进行智能纠错,单段任务失败可独立重试,不会影响整体创作进度。依托这一架构革新,vivago R1将AI内容商用有效成功率提升至85%,跨过了企业规模化商用的核心门槛,让AI正式从辅助工具升级为内容生产的核心生产力。

这套技术参数在实际创作中的效果如何?近期有一个用户测试案例在创作者社群中广泛流传,测试者在vivago R1中输入了一组极具挑战性的指令:

生成一部“叶什尔查姆风格”的荒诞科幻短片。

叶什尔查姆是土耳其上世纪六七十年代的商业电影黄金时代,整体类似“土耳其好莱坞”,以高产、明星制和类型片著称,其中后期的低成本山寨片因粗粝道具、拼贴素材和夸张表演在海外电影圈走红,《土耳其星战》就是最具代表性的作品——真人穿着喷银漆的硬纸板怪兽服、用泡沫塑料制作石头道具、手绘的外星球背景、演员绑着石头在蹦床上模拟飞行,甚至直接剪辑真实爆炸镜头入画,其核心精髓在于“廉价到极致,反而形成独特的幽默感”。

对于AI视频模型来说,这种风格的真正考验在于,它要求模型理解“不完美”,既要输出符合物理规则的画面,又要刻意保持低成本的质感,还要在“假”与“可笑”之间精准踩中风格阈值。大多数模型在面对这类指令时,往往会倾向于输出“好看的画面”而非“符合要求的风格”,但vivago R1的处理结果在创作者社群中获得了一致好评,被认为“精准捕捉到了那种荒谬感”,不仅复现了硬纸板怪兽、手绘背景、廉价特效的质感,还保持了镜头之间的叙事逻辑连贯。一个将“假”做到极致的风格,反而成为检验模型对“真实”理解深度的试金石。这个案例之所以值得关注,并非因为它展示了精美的画面,而是因为它指向了更本质的能力:一个真正可用的创作工具,必须能理解风格、执行意图、保持叙事连贯,而不只是生成漂亮的单帧画面。

扎实的产品能力也为智象未来带来了全球市场的认可。目前vivago的海外版已经覆盖全球100多个国家和地区,累计服务超5000万用户,今年5月的灰度版本登顶Product Hunt日榜第一,被硅谷知名产品猎人Chris Messina强力推荐,评价为“Think Claude Code,but for video”,其商业化落地能力稳居行业第一梯队。

如果说前两年的AI竞赛比拼的是谁更能“读懂”人类已有的知识,那么从现在开始,竞赛的核心将转向谁更能“看懂”并“推演”这个物理世界。这是一场从文本智能到物理智能的范式跃迁,也是世界模型赛道最迷人的不确定性。沿着原生全模态的技术路线,智象未来的演进节奏与落地效果值得长期追踪。它不仅是国产AI在底层架构上的一次主动突围,更可能为“大模型如何跨越纸上谈兵、真正走进物理世界”这一命题,提供一个值得深挖的范本。随着此轮融资尘埃落定,世界模型的竞赛牌桌已经摆开,真正的行业角逐,才刚刚鸣枪。

以上内容不代表本平台立场,仅供读者参考