文章摘要
原微软亚洲研究院资深图形学学者童欣,近日正式加盟胡渊鸣创办的AI 3D赛道头部企业Meshy,出任首席科学家,负责制定公司长期科研战略。二人研究理念契合,将携手推进多模态世界模型等领域突破,探索生成式AI重构图形学、将想象具象化的发展新路径。

当前AI创新的核心赛道正在向3D生成领域聚集,从多模态生成到空间智能、具身智能机器人,三维技术已经成为下一代人工智能的核心支撑。而就在近期,图形学界的资深学者童欣,正式加入了由胡渊鸣创办的AI 3D明星企业Meshy,出任首席科学家一职,负责制定公司长期科研战略。这也意味着华人图形学界两代顶尖研究者将携手,共同推进多模态世界模型与实时交互系统的突破。

童欣此前在微软亚洲研究院工作了25年,作为该研究院的首批研究员之一,他从基层岗位起步,最终升任全球研究合伙人、网络图形组负责人。在这25年间,他几乎见证了中国计算机图形学发展的所有关键节点,在顶级学术期刊和会议上发表了大量研究成果,谷歌学术引用量超过21000次。他的研究方向覆盖计算机图形学与三维计算机视觉的多个细分领域,包括材质捕捉与建模、纹理合成、三维几何处理、光传输模拟、真实感渲染以及三维人脸动画等。

除了推动多项技术落地,比如Xbox游戏开发API、Windows三维打印驱动、Direct3D图形开发工具包等产品的落地,童欣还为行业培养了一批中坚力量。浙江大学的周昆、清华大学的徐昆、北京大学的王鹏帅等多位学界代表学者,都曾在他的指导或合作下开展研究。共事过的研究者都评价他平易近人,始终扎根一线,既能深入探讨技术细节,也能将复杂的技术问题用通俗的语言解释清楚。童欣始终认为计算机图形学是应用学科,所有研究问题都来自实际需求和新设备、新数据的出现,他还曾幽默地调侃家人不理解自己对着屏幕上的三维茶壶和兔子研究的乐趣:

我的家人除了对我做的饭菜比较认可,经常开玩笑说我每天对着屏幕上的三维茶壶、兔子甘之如饴自High不已,但是看起来我做的事情大不能改变世界局势,小不能提高百姓生活,实在不明白我的成就感来自哪里。

Meshy是胡渊鸣从MIT博士毕业后创办的第一家公司,核心业务是将文字和图片快速转化为3D模型。目前这家公司拥有超过1200万用户,客户覆盖全球市值与估值前十企业中的半数,今年7月完成了近4亿美元的B轮融资,投后估值超过100亿元人民币,创下全球AI 3D领域单轮融资规模与估值两项纪录,成为该赛道估值最高的企业。

胡渊鸣作为Meshy创始人,拥有丰富的学术与实践背景:他曾是扬州中学校运会400米冠军、清华姚班歌唱比赛二等奖得主,MIT计算机图形学博士,曾获SIGGRAPH最佳博士论文提名,同时也是Taichi编程语言与编译器的作者。他提出了“AI for Fun”的独特目标,其核心逻辑是:当通用人工智能解决了大部分生产力问题后,人类将面临如何创造、表达、连接,以及如何获得意义的核心命题。在休闲时间愈发充裕的未来,人们会追求更新颖的快乐与意义生成方式,而这一趋势将由人工智能驱动。因此,用AI为人类带来快乐和意义感,将是未来五年最重要的方向之一,而Meshy希望成为这一图景中的关键一环。用胡渊鸣的话说,团队的目标是基于生成式AI重塑图形学,找到将想象具象化的全局最优解

这种前瞻视角与童欣的研究理念高度契合。早在2016年,童欣就提出要解决图形内容生产的“人人可及、随处可得”问题,让任何地点的任何人都能创造可视媒体内容。十年后的今天,这一目标已经进化为“只需一句话就能将想象转化为可体验、可互动的三维世界”。

为了实现这一宏大目标,Meshy目前在三个核心层面开展基础性研究:首先是重新定义图形学,跳出传统基于三角形渲染管线的局部最优方案,用AI打造一套不依赖基础渲染单元的全局最优解决方案;其次是搭建配套的导演系统,为新的图形学体系制定世界运行规则与三维骨架,实现实时剧本编写;最后是构建高性能基础设施,打造低延迟、高画质、低成本的三维生成与渲染架构,这一方向与胡渊鸣的博士论文以及创业初期的Taichi编程语言底层技术一脉相承。

除了基础研究,Meshy也在攻克当前AI 3D领域的核心痛点——可控性问题,也就是生成结果是否忠实于输入内容,包括整体比例、空间分布和细节还原度。今年8月,Meshy发布了Meshy-7模型,在几何对齐方向取得了重大进展:在有机角色生成上,能够还原面部表情、解剖结构和皮肤褶皱等细节;在硬表面和机械零件生成上,各部件可以精准定位且互不粘连;在文字和纹样生成上,阴刻文字与浮雕图案清晰规整,可直接应用于激光雕刻等工业场景。

童欣近年的研究集中在3D与视频生成的交叉领域,他在2024年提出了一个经典问题:“三维是否只是视频生成的特例?”也就是如果一段视频已经能从任意角度展示物体,是否还有必要显式构建三维模型。而童欣在AI多模态训练方面的前沿研究与工程积累,将帮助Meshy将探索推向更深的层次。

就在本文成稿之际,胡渊鸣发布了Meshy团队的最新技术成果Mora,全称是Multimodal Open-world Real-time Architecture,即多模态开放世界实时架构。这套架构由三个核心部分组成:一是Coding agent,用于生成游戏世界的骨架与运行代码;二是3D生成模块,也就是Meshy的核心能力,用于丰富世界骨架并为视频模型提供控制信号;三是视频模型,接收3D场景信号后输出最终的画面与音效。胡渊鸣称这是一项“超越世界模型”的技术。

回顾今年1月谷歌发布的Genie 3可玩demo,其宣称可以通过文字生成可探索的真实环境,当时市场反应强烈,Unity和Roblox股价大幅下跌,不少人认为未来游戏开发不再需要传统游戏引擎,仅靠视频模型即可实现。但经过大半年的体验,胡渊鸣认为当前的互动视频模型存在八大核心问题:一致性弱、互动形式简单、物理模拟能力不足、体验时长有限、无法支持复杂剧情与逻辑、仅支持单人游玩、无法利用代码生成能力、延迟较高,本质上只能做出类似“散步模拟器”的产品,这些问题并非单纯优化就能解决。

Mora的路线则反其道而行之,既然视频模型无法解决三维空间一致性问题,就让其专注于画面与音效输出。由Coding agent搭建世界骨架,Meshy生成精准的三维内容,再由视频模型完成最终渲染,这样既保证了空间稳定性与细节精度,又能实现可玩的互动体验。不过目前Mora 1仍处于早期阶段,仅用于验证框架可行性,后续将通过规模化迭代逐步逼近目标。

回到童欣提出的那个问题,三维是否只是视频生成的特例?Mora给出了一个初步答案:至少在当下,二者并非替代关系,而是可以通过Coding agent串联各司其职。这一答案尚未完全明确,但也让这个行业的边界变得更加模糊。童欣在过去二三十年间经历了多轮技术冲击:从早期手写规则制作3D内容,到神经渲染让AI从照片中学习光影,再到生成式AI摆脱传统3D管线,如今视频模型又让动态世界可以凭空生成。每一次技术革新都在叩问传统图形学的未来形态,而童欣此次选择与年轻一代的创新者携手,正是为了探索新的图形学发展路径,创造出真正能将想象具象化的技术体系。

以上内容不代表本平台立场,仅供读者参考