文章摘要
AI 3D建模此前普遍存在生成模型拓扑不合格、后续需花费大量时间返工整理,难以进入专业生产流程的痛点。全球领先AI 3D企业推出Tripo P2.0,核心突破为可直接产出原生四边面拓扑,布线合理可直接投入专业使用,适配3D Vibe Coding与智能代理操作;该企业刚完成合计30亿元的B轮及B+轮融资,Tripo模型全球评测排名第一。

AI驱动3D建模:从可视化到可编辑的跨越

当AI代码生成让开发者只需一句自然语言提示就能完成代码编写、Bug修复甚至独立搭建应用后,3D建模领域也迎来了类似的变革趋势。过去需要专业设计师花费数小时甚至数天完成的3D资产,现在仅需几秒就能通过AI生成,但真正的挑战往往不在生成环节,而在于生成后的可用性。

从“好看的Demo”到“可用的资产”:AI 3D的核心门槛

当AI生成的3D模型进入影视、游戏、动画开发流程,甚至交由智能代理操作时,单纯的渲染效果已经不足以满足需求。网格布线是否合理、部件能否被准确拆分、模型能不能继续编辑、绑定骨骼和制作动画,这些因素决定了生成结果究竟只是一个好看的展示Demo,还是真正可以进入后续开发流程的可用3D资产。

近期全球领先的AI 3D基础模型企业推出的Tripo P2.0版本,正是针对这一核心痛点进行了针对性升级。

原生四边面拓扑:P2.0的核心突破

P2.0最关键的升级在于,能够在生成阶段直接产出原生四边面拓扑结构。目前该模型支持最高50000面的三角面生成,以及最高25000面的原生四边面输出,可以覆盖从移动端轻量资产到高精度主资产的全场景需求。

与多数AI 3D模型先生成几何结构、再依赖额外的重拓扑处理流程不同,P2.0将“合理布线”直接整合进了模型的生成能力中。这意味着用户不需要在AI生成后再花费数小时清理杂乱的拓扑结构,直接就能获得符合工业标准的网格模型。

从实际效果来看,P2.0生成的模型细节更精细,布线也更加合理,边缘流更加清晰,网格密度会自动向细节区域倾斜,大片平面区域则保持简洁干净,这种优势在机械、工业道具等硬表面资产上表现得尤为明显。

同时,P2.0的天然分件能力也得到了进一步优化,模型中的不同部件能够按照结构逻辑被更合理地拆分,整体结构关系更加清晰。

提升生产效率:从单次生成到持续迭代

更规整的四边面拓扑结构,让3D创作者可以沿着连续的Edge Loop进行局部调整,也更加适合后续的骨骼绑定和动画形变。在正式版本中,P2.0还将加入局部重新生成功能,用户可以只修改选中的区域,其余部分保持不变,让原本一次性的AI生成结果变成可以持续迭代的创作过程。

由于管线兼容性极强,P2.0正在解锁全新的3D Vibe Coding场景。也就是说,P2.0的价值已经从单纯的“生成效果”延伸到了“后续可用性”:生成出来的3D模型,开始真正成为人类和智能代理都能继续编辑、理解和操作的工作对象。

行业认可与资本加持

除了技术升级,该企业还宣布完成了B轮和B+轮融资,合计约30亿人民币。不到半年时间,该公司累计融资额已达到约50亿元,刷新了3D原生智能领域的融资额纪录。

在独立AI 3D评测平台上,Tripo系列模型长期位居综合评分全球第一,评测结果来自超过20万用户的盲测投票。截至2026年8月,Tripo在几何、低多边形、纹理、分割四个维度均排名第一。其中在低多边形维度,P2.0 Preview版本的盲测胜率超过70%,唯一接近的仍是上一代Tripo P1.0。

我们也亲自上手测试了P2.0,其操作非常简单,只需输入一张图片或自然语言提示,就能直接生成一个布线规整、结构清晰的原生四边面Mesh,整体轮廓和局部细节都能得到较好保留,后续编辑和处理也更加便捷。

试用地址:官方体验平台

理解拓扑:AI 3D的隐形门槛

要理解P2.0的升级价值,首先需要了解3D建模中的拓扑概念。一个3D模型本质上由顶点、边和面共同组成,它们如何连接、如何沿着物体表面排列,就是拓扑结构。

对于普通用户来说,只要模型最终渲染出来足够漂亮,拓扑结构似乎无关紧要。但对于游戏开发、影视动画和专业3D创作而言,拓扑结构几乎决定了这个模型之后还能不能继续使用。

比如一个角色的脸部模型,如果眼睛、嘴角附近的边缘流按照肌肉运动方向形成连续环线,那么角色在眨眼、张嘴时,表面就能够自然形变。反过来,如果布线杂乱,即使静态画面看起来没有问题,一旦绑定骨骼、驱动表情,模型就可能出现拉伸甚至破面。

硬表面模型也是一样,比如一辆汽车,需要大片平整表面和清晰锐利的边缘。如果面数被无意义地堆在平面区域,而真正需要细节的位置反而结构混乱,后续编辑就会变得非常困难。

因此,四边面长期以来都是影视、游戏资产制作中最重要的工业标准之一,因为它更容易形成连续的Edge Loop,也更适合循环切割、角色形变和局部编辑。

过去的AI 3D模型很难做到这一点,常见的做法是先让AI生成高模或三角面模型,再增加重拓扑步骤,这相当于把生成和可用性拆成了两个阶段,流程更长,而且在转换过程中还可能损失几何细节。另一条路线则干脆只输出三角面,网格质量相对粗糙,容易出现重叠面、布线无序、边缘流不清晰等问题,一旦进入专业生产环节,这些问题就会迅速暴露。

对于游戏和实时工作流而言,“生成即可用”是核心诉求,但上述方案都存在致命问题:AI可能几十秒就能生成3D模型,但开发者和艺术家还要花数小时清理拓扑、重新布线。这不仅降低了效率,更违背了AI生成工具的初衷。当“生成”越来越快,生成之后的整理和返工,反而成了AI 3D真正进入专业生产管线的新瓶颈。

更贴近传统建模逻辑的技术路线

P2.0的选择是直接在生成阶段产出原生四边面拓扑。与很多模型在生成完成后再通过传统算法修改出四边面不同,P2.0的四边面是在扩散模型的生成过程中直接产出的。也就是说,模型在决定一个物体“长什么样”的同时,也开始决定这个物体应该“怎么布线”。

这种变化首先体现在后续的生产流程中。更规整的四边面能够形成连续的Edge Loop和相对均匀的布线,创作者可以沿着环线进行循环切割、选区和局部调整,不必先花大量时间清理杂乱的拓扑结构。

在绑定和动画阶段,这种优势会更加明显。角色关节、五官等区域在运动过程中需要频繁拉伸、弯曲和扭转,连续且合理的四边面布线能够让形变更加稳定,减少拉伸、扭曲等问题,也更符合传统动画制作管线的使用习惯。

与此同时,P2.0对网格密度的分配也更加合理:需要保持平整的区域尽可能保持干净,复杂细节处再集中增加密度,边缘流则沿着物体结构展开。尤其是在硬表面资产上,这种差异更加明显,机械结构、工业道具等模型往往既包含大片平面,又有锐利边缘和复杂连接件,过去很容易出现“该简单的地方过密、该保留细节的地方反而混乱”的问题,P2.0很好地解决了这些问题。

与拓扑一起改善的还有天然分件能力,模型中的不同组件能够按照结构被更合理地拆开,让一个复杂3D对象不再只是连成一团的几何表面,而逐渐呈现出更清晰的部件关系。

有3D创作者在体验后特别提到,硬表面资产此前一直是各类3D生成器比较棘手的方向,而P2.0一个明显的变化是网格密度开始真正“去到应该去的地方”:平面保持干净,细节区域获得更多密度,边缘也能保持住。

Agent走进3D:让自然语言成为操作层

真正让这次升级变得更有想象力的,是智能代理与3D建模的结合。过去一年,代码领域的Agent已经证明,当一个领域能够被结构化地表达,并且模型拥有足够好的工具接口之后,自然语言就可能成为新的操作层。

但AI 3D领域的情况要复杂得多。一个几十万面的高精度模型,对于Agent来说,很大程度上仍然是一团复杂的几何数据。如果模型本身没有干净的结构,也没有合理的分件,即使Agent“看见”了它,也未必知道哪部分是头、哪部分是手臂、哪一块应该旋转、哪个结构能够拆下来。

因此,3D Vibe Coding的关键问题在于,AI生成出来的3D模型本身是不是一种Agent容易理解和操作的数据结构。当一个机械模型被拆成更符合语义的组件,当拓扑沿着真实结构分布,Agent判断“谁是谁”的难度就会大大降低。

一旦这件事成立,很多原本需要专业3D软件完成的操作,就有机会进一步转向自然语言交互。这也是P2.0天然适合3D Vibe Coding的原因:它生成的网格拥有更合理的布线、更干净的结构和更清晰的部件关系,Agent更容易理解物体之间的结构关系,并在此基础上继续完成调用、修改和交互。

有开发者用P2.0生成了机械蜘蛛模型,并在天然语义分件的基础上,让大语言模型为独立部件命名、编写和调试运动逻辑,最终实现了整只机械蜘蛛的部件级动画控制。

事实上,在此之前,已经有开发者尝试将Tripo生成的3D资产交给Agent继续处理。例如有开发者将大语言模型与Tripo结合,制作了一套3D人体解剖交互应用,用户可以直接在网页中查看和操作器官模型,这个项目后来还被行业知名人士转发。

还有开发者用Tripo生成了一条拥有干净拓扑的锦鲤,最初拿到的只是一个静态Mesh,没有骨骼绑定也没有任何动画。由于自己并不会使用专业3D软件,她索性直接把这条鱼交给大语言模型,看看能不能在不碰专业软件的情况下让它“活”起来。最终,这条原本完全静态的鱼开始在网页里游动、呼吸,对鼠标位置做出反应,甚至会朝用户“游”来。整个过程中,开发者没有打开专业3D软件,也没有调用额外的3D工具。

还有一次,该开发者将大语言模型与Tripo组合起来,不到一小时就完成了一套3D无人机网页应用。另外,在行业举办的黑客松活动中,Tripo也已经出现在获奖团队的3D开发工作流里。

这些案例放在一起,可以发现一个清晰的模式:Tripo负责生成结构更干净、可继续处理的3D资产,大语言模型Agent再接手动画、交互、优化和代码开发。用户不需要先成为3D艺术家,也可以直接从一句需求或一张图片出发,继续把一个静态模型变成真正可运行的3D应用。

从P1.0到P2.0:一场Mesh技术路线的接力

P2.0的原生四边面能力,建立在企业自研的Nexus技术框架之上。其相关论文《Nexus: Native Mesh Generation with Diffusion》入选了顶级图形学会议SIGGRAPH 2026 Technical Papers,论文探索的核心问题是:Mesh能不能摆脱自回归模式,直接由扩散模型原生生成。

过去主流的Mesh生成方法,大多借用了大语言模型的自回归思路:先把顶点和面按照某种规则排成一维序列,再像生成Token一样一个接一个预测。但问题在于,Mesh天生没有这样的顺序,强行对其排序,意味着模型必须去适应一个原本不存在的序列关系。这也使得自回归路线在Mesh生成上呈现出一种“虚假繁荣”:基础效果可以做到不错,但当模型开始追求更复杂的结构、更高面数和更高质量时,误差累积、推理效率等问题就会集中暴露。

因此,该企业较早识别出自回归路线的天花板,在行业共识形成之前就把研究目标聚焦在扩散路线上。但扩散模型想真正进入Mesh生成领域,首先要跨过表征这一关。Mesh同时包含连续的几何坐标和离散的拓扑结构,而扩散模型天然更擅长处理连续信号。此前的扩散方法,要么只能处理固定数量的元素,要么很难直接建模离散拓扑。

Nexus的做法是把Mesh生成拆成两个独立的问题:顶点在哪里,以及这些顶点应该如何连接,也就是将几何结构和拓扑结构解耦。在几何生成阶段,Nexus把顶点看成分布在三维空间中的稀疏占用信号,并用八叉树组织整个空间。模型从一个粗粒度空间开始,通过扩散模型逐层判断哪些区域存在顶点,再不断向更细尺度展开,由粗到细建立物体的整体形状和局部细节。这样,模型不需要按照固定顺序逐个预测顶点,而是从全局结构出发生成完整的顶点集合,同时还能根据物体复杂度动态决定顶点数量。

更关键的是拓扑结构的处理。顶点位置是连续坐标,但“两个点是否连成边、三个点是否组成面”本质上是离散关系,并不天然适合扩散模型。为此,Nexus利用时空区间编码,把复杂的边和面连接关系编码成每个顶点上的连续特征,再让扩散模型直接生成这些拓扑表征。推理时,系统先判断哪些顶点之间应该形成边,再从已经确认的边中恢复面,最终得到完整的Mesh。由于顶点和拓扑都不需要被强行排序,整个过程可以从全局建模网格结构,也绕开了自回归方法容易出现的顺序敏感和误差累积问题。

这样一来,Mesh不再需要先被强行排成一串Token,顶点和拓扑都可以在扩散框架下进行全局建模。Nexus由此实现了无排序的原生Mesh生成,并在多个公开数据集上超过了多种自回归和两阶段基线方法。

这套方法也构成了后来P系列模型不断向前扩展的技术底座。Nexus论文首先验证了Mesh原生扩散生成的可行性;2026年3月发布的P1.0,实现了约2秒直接生成拓扑干净的原生Mesh,最高支持20000个三角面。到了P2.0,企业又继续解决了四边面Mesh的表征和生成问题,把三角面上限提高到50000,同时加入了最高25000面的原生四边面支持。

因此,从P1.0到P2.0是对同一条技术路线的一次连续扩展:Nexus解决原生Mesh怎么生成,P1.0验证这套方法能不能产品化,P2.0再把能力推向四边面和更专业的生产标准。而到了四边面这一步,高质量训练数据的重要性也进一步放大。该企业构建了专门的高质量四边面训练数据集,为模型效果的持续优化提供数据支撑,并通过自建数据平台自动化生产结构化训练数据,持续支撑模型迭代。更底层的基础,则来自其长期积累的数千万级3D原生数据资产。这也解释了为什么Nexus论文早已公开,但同等产品能力至今仍没有被迅速复制出来。

不断扩展的3D技术版图

P2.0的这次升级,是该企业在3D生成方向持续投入之后的一个阶段性成果。截至目前,该团队已发表顶会论文60余篇,数量在3D领域内位居前列;开源项目超过30个,GitHub Star总数超过3.5万;自建的高质量3D数据集规模超过2亿条。

在今年的SIGGRAPH大会上,该企业也是收获颇丰。作为本届四个主会场Keynote演讲者之一,与迪士尼、NVIDIA等企业同台,其算法团队带来了题为《The Teapot Test: First It Tested Showing. Now It Tests Making》的主题演讲。这届大会吸引了来自69个国家的近万名参会者,该企业能拿到四分之一的主会场演讲席位,说明其在3D生成这个细分领域积累的技术声量已经得到了学术圈相对广泛的认可。

另外,团队还有5篇论文入选SIGGRAPH Technical Papers,覆盖3D表征、原生网格生成、骨骼绑定、跨拓扑动画和纹理生成等三维资产创作的核心环节,并在实时展演环节拿到了最高奖项Best in Show。该企业的核心研发人员同期入选了《麻省理工科技评论》35岁以下科技创新35人中国区名单。

《麻省理工科技评论》对该研发人员的评价,聚焦于他在三维视觉与生成式AI领域的连续技术积累:从三维重建、神经渲染,到AI 3D生成,他推动相关技术从生成静态外观,进一步走向结构可用、资产可动和场景可交互,为空间智能与物理AI提供底层三维生成能力。

未来:Mesh成为3D世界的API

过去,3D模型主要是给人看的,建模师在软件里打开它,动画师给它绑定骨骼,程序员再通过引擎接口给它增加行为。但随着Agent的出现,这套关系开始改变,接手3D资产的下一位“使用者”,可能是一个AI。它需要知道模型由什么组成,哪些区域可以修改,每个部件之间是什么关系……

从这个意义上讲,一个结构干净的Mesh,很像是3D世界给Agent提供的一层接口。接口越稳定,Agent越容易继续操作。届时,用户说一句:“做一只机械蜘蛛,让四条腿可以独立运动,点击背部打开内部结构,再给它加一个巡逻行为。”背后的流程可能不再需要人在五六个专业软件之间来回切换。3D模型负责生成资产,Agent负责理解结构、编写逻辑并继续修改,人只需要决定最终想要什么。

这可能才是Vibe Coding从二维软件走向三维世界时,真正需要补上的基础设施。过去几年,AI 3D解决了“如何快速得到一个3D”的问题。接下来的问题变成了:这个3D能不能真正成为一个可编辑、可驱动、可交互、可以继续工作的对象。

Tripo P2.0的原生四边面拓扑,只是其中一步。但它至少让一个趋势开始变得更加清楚:当AI开始接管越来越多3D工作流之后,竞争的重点会逐渐深入模型表面之下。外形决定第一眼,结构,才决定这个模型接下来还能做什么。

以上内容不代表本平台立场,仅供读者参考