AI视频生成速度翻倍:SageAttention技术与管理

没人喜欢等待,尤其是在AI交互的场景里。
当大模型的能力边界不断拓展,推理加速的重要性愈发凸显——这正是本次对话的核心主题。我们邀请到的嘉宾是生数科技的张金涛。
不久前,张金涛团队发布了Vidu S1:一款实时交互视频生成模型,用户只需上传一张人物、动漫角色或是宠物的照片,就能让它变成可以实时视频通话的AI角色。这款模型的生成速度远超播放帧率,还支持无限时长的交互,背后的技术逻辑值得拆解。
在这场对话中,张金涛分享了自己的技术演进路径:从SageAttention(GitHub收获3.5k星标)、TurboDiffusion(3.6k星标)到TurboServe,一整套系统级方案为Vidu S1的实时交互提供了底层支撑。同时他也分享了对AI推理加速领域的行业观察与判断。
值得一提的是,这位26岁的清华在读博士,最初踏入推理加速领域的契机格外朴素:当行业普遍认为FlashAttention已经将Attention算子做到极致时,他却注意到GPU上还有未被充分利用的高速计算单元——“这么明显的性能收益,为什么没人做?”
这场对话不仅围绕技术展开,也可以看作一份年轻AI研究者的成长样本:在快速迭代的行业中,如何找准方向、判断核心赛道,并将技术落地到前沿场景。
我们先从一些基础问题开始:
主持人:你的年龄?
张金涛:26岁。
主持人:毕业院校?
张金涛:清华大学博士在读。
主持人:MBTI和星座?
张金涛:INTJ,水瓶座。
主持人:一句话介绍Vidu S1到底是什么?
张金涛:它是一个实时交互的视频生成模型,可以通过语音实时控制生成的视频内容。
主持人:在生数科技,除了S1项目,你还负责哪些工作?
张金涛:我负责生数所有模型的推理加速和集群部署。其实我主导的是整个流式视频生成模型的全链路工程,从数据、训练算法,到推理工程化,再到模型的最终评测。
“为什么没有人做?这是很明显的一个收益。”
谈到最初接触推理加速的契机,张金涛提到了这个关键节点。
在加入生数科技之前,张金涛主要跟随朱军教授开展推理加速方向的学术研究,还曾前往加州大学伯克利分校访问学习半年。
硕士二年级时,他选择硕转博,师从朱军教授,之后由陈键飞老师指导。陈键飞老师曾直接告诉他:“推理加速是未来至关重要的方向。”这也让他正式开启了Attention底层加速的研究,SageAttention就是他的首个成果——这是一个即插即用的高性能Attention算子实现,可以直接替换大模型中的Attention计算模块。
主持人:即插即用?
张金涛:对。当时我们发现,尽管FlashAttention已经拥有巨大的行业影响力,普遍被认为将Attention算子做到了极致,但在硬件底层,其实还有更快的计算单元没有被发掘利用。
大模型的核心运算主要分为线性层计算和Attention计算两类。线性层加速早已广泛调用了更快的硬件计算单元,但在FlashAttention推出后,却没有任何工作能够利用GPU的高速计算单元来加速Attention计算。我们当时很困惑:既然性能收益如此明显,为什么没人做?于是我们决定动手实现。
主持人:那当时为什么没人做这个方向?
张金涛:因为低比特加速的Attention计算挑战极大。
首先,传统语言模型的Attention计算往往属于内存绑定,单纯加速计算单元并不会带来显著的端到端收益,这也让行业缺乏研发动力。但随着多模态模型和视频生成模型兴起,这类模型的Attention范式属于计算绑定,计算速度直接决定了Attention的耗时,加速收益变得极高——不过在2024年初之前,行业还没有意识到这一点。
其次,Attention的低比特加速本身有着极高的工程门槛。它不像普通线性层那样,只需用PyTorch写几行代码或是调用量化API就能实现。Attention的计算特性要求开发者必须深入底层,手写GPU Kernel代码,在2024年初之前,行业内手写CUDA或底层GPU编程的门槛依然较高。
主持人:需要完全手写?
张金涛:对,基本上都是手写。
第三,Attention计算的精度对低比特量化极其敏感。如果直接将Attention的所有计算量化到8比特,应用到语言模型或视频生成模型中,输出内容的质量会大幅下降。我们攻克了后续的工程和算法挑战,才成功推出了SageAttention。
从最初的SageAttention到如今的Vidu S1,背后离不开推理加速技术的迭代升级。谈到这一演进过程中的关键里程碑,张金涛做了详细拆解。
他首先强调,Vidu S1并非单点的算子加速,而是“模型+集群部署”的全栈优化,推理加速只是其中的核心一环。整个演进可以分为三个阶段:
第一阶段是算子层加速。研究如何让线性层、非线性层以及Attention算子在特定硬件上跑得更快,尽可能榨干GPU的性能极限。
第二阶段是模型层面的复杂度优化。不仅要让算子跑得更快,还要降低模型的计算量。团队通过“步数蒸馏”将Diffusion模型的去噪步数从50步压缩到4步,计算复杂度直接下降十余倍;同时引入稀疏Attention,在降低计算复杂度的同时维持模型效果。
第三阶段是工程化的集群部署。当单个模型在单卡或多卡上跑通后,如何将其部署到大规模服务器集群,支撑全球海量用户的实时请求?这涉及多卡并行、模型并行以及请求调度,团队为此做了大量工程优化,核心在于并发与调度的设计。
谈到此前开源的TurboDiffusion项目,张金涛表示,它恰好对应第二阶段的优化工作:当团队拥有了高性能的SageAttention算子后,如何让任意Diffusion模型在单卡或单机上实现高效运行?TurboDiffusion不仅集成了更快的线性层和Attention算子,还开发了一套通用的模型蒸馏和稀疏Attention算法。
这类算法和算子优化不同,需要通过模型训练和微调实现,比如通过微调稀疏Attention或是蒸馏训练,在降低模型复杂度的同时确保画面质量。同时在工程层面,团队还解决了多卡并行时卡间通信耗时与单卡计算耗时的重叠优化问题。
总体而言,TurboDiffusion是一次模型架构、微调层面的优化,叠加了部分工程优化。
主持人:在学校做这些研究时,数据和算力资源应该很有限吧?
张金涛:对。做TurboDiffusion时,我们手头的计算资源确实相对受限,但这款项目本身不需要过于庞大的训练资源。我们基于开源的视频生成模型,只用了少量微调数据就跑通了整个流程。
主持人:目前它在GitHub上拿到了多少Star?
张金涛:3600多个。
主持人:在这个领域,这算是一个什么样的成绩?
张金涛:算是还不错的表现。
主持人:在行业里,有哪些公司或模型采纳了SageAttention或TurboDiffusion吗?
张金涛:让我比较自豪的是,SageAttention已经成为了行业事实上的标准。不仅NVIDIA、AMD官方正在使用,国内的华为昇腾、摩尔线程、沐曦等硬件厂商也在显卡底层实现了SageAttention的部署。在算法公司方面,几乎所有的多模态大厂,比如字节、腾讯、生数,甚至Google都在使用。
“生成速度需要大于播放速度,它才能做到实时生成。”
回到Vidu S1,不少用户的第一感受就是“快”,但这款模型的技术突破远不止于此。
主持人:这种“快”的背后,到底沉淀了怎样的技术突破?
张金涛:我们不能单纯用“快”来概括流式视频模型。传统的视频生成模型是“离线”的:用户输入一段Prompt,等待一段时间后,模型会输出一段5秒或10秒的视频。但流式、实时视频生成的交互范式完全不同,用户是在“实时”与模型对话,每一帧都需要根据输入当场计算、渲染。这要求生成速度必须大于播放速度,用户才不会感受到卡顿。
所以这并非简单的提速问题,而是重塑了整个生成链路。
主持人:那这之中最大的挑战是什么?
张金涛:最大的挑战是如何在确保高画质的前提下,实现超长甚至无限时长的流畅生成。目前的离线视频生成模型,最长一次性生成时长约30秒,但实时交互不可能仅持续30秒,往往需要数十分钟甚至数小时的持续生成,且画面不能出现漂移或崩溃,这对模型的稳定性提出了极高要求。
主持人:听说Vidu S1可以跟用户聊上几天几夜,你们是怎么解决画面不漂移、不崩溃的?
张金涛:这依赖于我们在Diffusion训练上的底层探索,尤其是在Attention的计算架构设计以及噪声强度控制上,我们摸索出了一套先进机制,成功解决了长视频生成中的画质衰减和内容漂移问题。
在推理优化层面,Vidu S1可以实现540P的分辨率,这在当前的实时生成模型中十分少见,同时帧率可以稳定在25到42FPS。更关键的是,普通用户在消费级显卡上就能跑出这个效果。
主持人:要在速度、画质以及长时一致性上同时做到极致,必然需要做一些取舍。在这个过程中,Vidu S1牺牲了什么?
张金涛:肯定存在权衡。我们将“实时交互”作为第一优先级,首先确保响应的实时性,在此基础上尽最大可能优化画质和生成一致性。
主持人:所以“快”是第一目标?
张金涛:对,“快”是绝对的前提。
主持人:在画质、成本和一致性的优先级排布里,目前哪一个是排在最后的?
张金涛:现阶段如果非要排序,我们只能选择让画质做出一定妥协。
主持人:目前体验平台已经对公众开放,它的商业化和收费模式是怎样的?
张金涛:我们面向大众开放的网页端和App端体验完全免费,对于API平台,我们采取按时计费,大约每分钟两三块钱,没有时长限制。
“未来我们的视觉娱乐信号,会被AI生成的内容充斥掉。”
谈到实时交互视频的未来趋势,张金涛分享了自己的判断。
主持人:流式、实时的在线交互视频,未来会成为一个巨大的趋势吗?
张金涛:视频模型本质上是为了满足人类的视觉娱乐需求,这类需求可以分为两类:一类是离线预制的视频,比如电影或短视频;另一类是实时在线交互。就像我们今天的对话,就是典型的实时在线交互——一方的发言能被另一方即时接收,并做出相应反馈。
在恋爱、游戏甚至几乎所有日常社交场景中,这种“实时交互”都是人类最核心、最本能的视觉娱乐需求。在数字革命之前,人类所有的视觉娱乐基本都是实时在线交互的。离线预制视频有播放量的上限,但实时交互视频的独特之处在于,每个用户都拥有独一无二的会话,看到的画面只属于自己。
这也是不少前沿计算模型的底层逻辑。从技术路径来看,实时交互式视频生成没有瓶颈,必然会成为未来最核心、需求量最大的赛道,是大势所趋。
主持人:发布到现在,有看到用户用Vidu S1玩出什么有意思的场景吗?
张金涛:虽然上线不到一天,但社区的反馈已经非常火爆。在此之前,全球没有任何一款模型能让用户通过语音实时控制视频生成,还支持无限时长交互和自定义角色。
我看到了不少爆款案例:比如有用户上传自家小狗的照片,就能和AI化的小狗实时聊天,小狗会根据对话做出活灵活现的反应;还有用户将游戏画面作为实时视频流输入,搭配一个二次元女孩角色,女孩可以实时观看游戏画面并做出回应,陪用户一起游戏;还有玩家上传博主“峰哥”的照片和转圈舞人设,让他在屏幕里实时送出生日祝福、跳转圈舞,体验十分魔性。
主持人:那理论上,我每天写代码的编程界面也能当做视频流传给它,让它扮演一个“程序员鼓励师”?
张金涛:当然可以。它能看懂你屏幕上的每一个文字和画面,拥有极强的多模态视频理解能力,完全可以实现这类场景。
主持人:我们再回到推理加速。你做的大多是多模态模型的推理加速,但其实大语言模型的推理加速也极其重要。在过去一年,我们看到了许多芯片层面的创新,比如Cerebras、Taalas等。能为我们介绍一下,目前在推理加速领域,有哪些比较重要、值得关注的工作或方向吗?
张金涛:推理加速的字面含义就是让模型推理得更快。如果不考虑芯片设计层面,我认为核心工作主要分为两个维度:
第一,算子层优化。我们需要让模型的计算在特定硬件上跑得足够快,尽可能逼近硬件的性能极限。但不少人存在一个误解,认为推理加速仅仅是做这一件事。
主持人:就是让模型在特定硬件上计算到理论最大值?
张金涛:对,让单个算子的计算速度更快,这当然非常重要。但推理加速另一个极其关键的点,是如何降低模型的计算复杂度。我们的目标是实现端到端推理加速——用户输入请求后,模型能迅速输出结果。
AI模型就像一个黑盒,其中存在大量冗余计算,我们需要将这些冗余省去。比如通过稀疏Attention、优化模型架构或是采用蒸馏技术,这些都属于推理加速的范畴。
当然,我对芯片设计层面的了解不算多,像NVIDIA的硬件迭代,提升硬件本身的计算速度,也可以算作广义的推理加速。
目前行业内比较优秀的推理加速工作,比如在Diffusion模型或多模态模型领域,开源项目vLLM涉及了我前面提到的多层优化,但它更侧重调度和管理层面。我们此前的SageAttention,以及后续结合工程优化的Sparse Linear Attention,主要针对算子本身和模型复杂度降低进行探索。
传统的离线Diffusion生成相对简单,因为仅需处理单条用户请求,不需要做Batching和KV Cache调度。但随着流式交互需求增加,Diffusion生成过程变成了类似自回归的流程,这就涉及到KV Cache和复杂的请求调度,比如用户的接入、退出或是中途中断。因此我认为未来会涌现大量关于Diffusion模型集群部署和调度的研究。我们在生数科技的《TurboServe》工作,就是针对流式视频生成模型的集群调度和部署展开的探索。
在语言模型领域,DeepSeek提出的DSA是非常不错的工作。
主持人:大家基于开源DFlash框架所做的UltraSpeed,效果都非常显著。
张金涛:在多模态和Diffusion领域,我们开源的Sparse Linear Attention用于稀疏Attention加速,也得到了腾讯和字节跳动多模态负责人的认可,他们都在使用,认为这是一项优秀的工作。当然,我们开源的SLA版本在Linear Attention的选型上还存在一些微小缺陷。我提到的只是我接触并认可的部分工作,行业内还有大量优秀的推理加速研究。
“推理加速的未来,还是属于更底层和更上层。”
主持人:关于推理加速的未来,你提到会属于两个极端:更底层和更上层。可以展开讲讲吗?
张金涛:首先,单个算子在硬件上的物理收敛运行方向,未来会逐渐定型。当行业普遍掌握了先进的代码编写方法,也更了解硬件架构后,单纯的算子优化将不会有太高的技术壁垒。
我所说的“更底层”,是指研发通用性极强且计算速度极快的硬件,或是针对特定模型量身定制专用芯片。
主持人:就像Taalas一样,把一个特定的模型写死到芯片里?
张金涛:这是一种思路,但成本可能过高,一旦模型更新,芯片就会被淘汰。我认为更可行的底层思路是,在保持芯片定制化的同时,预留一定的通用性。
比如,语言模型的Attention计算通常属于内存绑定,受限于显存传输速度而非计算速度;而视频生成模型大多属于计算绑定。通过动态调整计算与传输的比例、显存大小、不同精度的计算单元数量等,在通用和专用之间取得平衡,这需要极强的芯片设计与算法协同能力。
而“更上层”则是在算法和模型层面进行优化,核心是大幅降低模型的计算复杂度。人类大脑仅25瓦的功耗,就能解决极其复杂的任务,从理论上讲,我们完全有可能降低模型的计算复杂度。
这同样分为通用和专用两个方向:通用方向是降低模型处理各项任务时的复杂度;专用方向是让模型针对不同用户请求,用更简化的计算就能满足需求,不需要让每个Token、每次请求都走完完整的Layer。
我认为这两个方向在未来会变得越来越重要。
主持人:在底层是不是更容易诞生创业公司?因为在顶层似乎很难独立支撑起一个商业帝国。
张金涛:一款真正优秀的推理加速产品,核心一定需要硬件和算法的协同设计,所以创业公司需要兼备这两方面的能力。不过你说的也有道理,如果创业公司专注于硬件底层或是走Co-Design路线,都有可能成功。但如果仅局限于算法层,确实很难形成壁垒,因为单纯的算法研究很难在最底层得到深度的硬件验证。
主持人:我们来聊聊整个AI视频行业。最近几个月,我发现中美两边正在发生分化。中国的视频模型表现越来越亮眼,已经稳稳站住了全球第一梯队。在你看来,国内视频模型能形成这种优势的原因是什么?
张金涛:AI的本质是对特定问题进行建模,之后通过训练数据学习输入与输出之间的映射关系。自Transformer诞生以来,在建模架构上进行微调已经很难带来本质性的突破,因此当前的核心竞争点在于数据。
这就像人类的学习:一个人能否学好,第一取决于智商(相当于大脑建模),第二取决于接受的教育。好的讲解方式和糟糕的讲解方式,学习效果天差地别。比如一个复杂的物理规律,遇到好的讲解,10分钟就能让人豁然开朗,看优质内容的收获,远超过看垃圾博客或受污染的数据数小时。
当建模架构已经相对收敛,关键就在于能否将数据清洗、构造成高品质、符合人类偏好、具备强可学习性的内容。比如在推理任务中,如果直接让模型从问题A跨越到答案Z,模型很难学会;但如果将数据构造成思维链,让模型循序渐进学习,就能掌握相关能力。
据我观察,美国的视频生成公司在数据量、数据质量、偏好对齐以及数据构造方式上,目前确实不如国内的头部视频生成公司。具体原因每个人可能有不同的思考,比如在数据获取的合规政策等方面存在客观差异,这是第一点。
第二点在于中美文化差异和市场环境的不同。国内对短视频、直播、电商的需求极大,相关行业发展更迅速。因此我们不仅能积累更丰富的视频数据,也拥有更强的动力去探索如何通过视频生成满足用户的视觉娱乐需求。
主持人:这很有意思。
张金涛:我觉得主要就是这两点。
主持人:感觉2026年有一个非常大的趋势,就是许多高校教授和PhD都在大量投身创业。早几年,像智谱AI的唐杰老师、生数科技的朱军老师,都是非常优秀的学者创业代表,但在当时还没有形成像今天这样的全民热潮。作为身处其中的一员,你对此有什么切身感受?
张金涛:首先,我认为AI并非泡沫,它确实能够解决并满足人类极大的现实需求,无论是硬件还是模型层面的发展,大方向都极其笃定。因此这波创业热潮非常合理,并且能够持续很长时间,并没有太多泡沫。
其次,因为需求体量过于庞大,没有任何一家公司能够垄断所有场景,未来会有许多不同的创业公司脱颖而出。不过我也发现,创业并不适合每个人。在生数科技的这段时间,坦诚来说,我觉得自己比较适合做管理:我能够凝聚团队,敏锐察觉到每个人的诉求,将合适的人放在合适的位置上,并做好复杂的资源协调。相比之下,有些技术水平极高的优秀人才,其实并不适合做管理。
如何让大家工作得既开心,又始终保持高昂的斗志去做世界上最领先的技术,这其实是一门很深的学问。
“知道世界上最正确、最领先的方法是什么,然后把它正确实现出来。”
主持人:那你可以在这方面分享一下你的管理实践吗?比如,具体怎么让大家在开心中高标准地工作,如何激励大家勇于追求世界最领先的水平?
张金涛:这方面我受朱军老师的影响极深。当初OpenAI刚发布GPT-3时,朱老师就告诉我们:不要觉得GPT-3遥不可及。它并不是在模型架构、数据或者训练方法上做出了多么颠覆的创新,它只是找准了最正确、最科学的方法,并在每一个环节上都做到了极致。
看清最正确的方向,然后用绝对正确的执行力在每一个细节上死磕,这就是世界领先的秘诀。我把这个逻辑贯彻到了我们推理组的每一行代码中。很多项目没做好,不是因为不知道前沿方向,可能只是因为代码库里藏着几行没有排查出来的Bug。
至于如何让大家开心,我认为核心在于“敏感度”。团队领导者必须能敏锐读懂每个人的需求:有的人需要更好的薪酬,有的人在乎个人贡献认可,有的人纯粹追求技术突破的爽感,你必须精准满足他们的核心动力。同时,领导者要帮团队树立威信,在跨部门协调资源和利益冲突时,必须展现出强大的决断力和基于本质思考的沟通方式,这也是许多单纯做学术的技术大牛容易缺失的特质。
“视频生成得跟之前像素级一模一样,但端到端推理速度快了一倍多。”
主持人:能聊聊你个人的成长经历吗?你一路上是如何磨炼出这种综合特质的?
张金涛:我小时候挺贪玩,严重偏科,数学极好但语文很差。但现在我越来越觉得,沟通、表达和对他人情绪的敏感度至关重要,这些软实力其实和“语文能力”高度相关。
到了大学,我的自学和表达能力开始显现。当时竞争不算太激烈,我稍微花点心思就能拿到很好的绩点,也借此兼顾了科研。在实验室做论文汇报时,我发现自己能极快拆解出论文的核心本质,也很享受将PPT的逻辑、文字和配图雕琢得足够清晰,让听众瞬间抓住核心要点的过程。
我认为写作是反映一个人思维深度的最好工具。
主持人:智能的边界有时就是语言的边界。能把复杂的问题讲得通俗、简单,恰恰证明你把它彻底想明白了?
张金涛:确实。把事情讲清楚不难,难的是把一个极其复杂的系统讲得极度简单。我很享受这种“提炼”的过程:写论文时,我会花大量精力凝练研究动机,将局限性、挑战以及核心贡献像雕刻一样提炼出来,每一句话、每一个词都要有强逻辑支撑。
硕转博之后,我迎来了科研和创业生涯中最快乐的一段时光。做SageAttention时,我常常独自待在清华的自强科技楼里,楼里很安静,我沉浸在代码中,和陈键飞老师讨论、向朱老师汇报,逐线程模拟排查微小的精度Bug。当底层的C++和CUDA代码一行行成型时,那种充实感无法言喻。
2024年5月,生数科技成立了Vidu推理组,负责全球上线的推理保障,朱老师直接将这个担子交给了我。我直接在Vidu模型的生产环境中手写了SageAttention,这是全球首个在实际业务中跑通的低比特Attention加速工作。当代码替换掉原本的FlashAttention,精度完全匹配的那一刻,我发现视频生成的质量像素级一致,但端到端推理速度直接翻了一倍。
那一刻我兴奋到了极点,迫不及待地将结果发给陈老师和朱老师看。后来我们开源了论文,发布了Sparse Linear Attention这项工作,并在《TurboServe》中探索了集群调度。这种能够帮助业界解决实际痛点、带来开创性突破的快乐,是任何事情都无法替代的。
第二段开心的事是,我现在也在带领一个团队。朱老师非常信任我,将这一摊子事情交给我负责,这也让我提前体验了创业的状态。刚加入实验室时,我就发现朱军老师在学术和产业上的段位和眼界都极高,具体体现在三个方面:
第一是认知极度前瞻,对前沿方向的研判和直觉非常敏锐。他的许多学生,比如翁家翌、路橙、庞天宇、宋飏等,都是行业里极度优秀的人才。
第二是朱老师能够为实验室争取并提供极其充足的计算与开发资源。
第三是实验室的学术氛围。我在加州大学伯克利分校访问过半年,朱老师有CMU任教的背景和海外经历,将实验室的氛围建设得和伯克利十分相似。我非常认可,也极其感谢朱老师的信任和培养。
主持人:听到你描述那种纯粹的技术突破和创造力带来的快乐,真的很让人振奋。希望你在接下来的研发和创业旅程中,能收获更多这样美妙的时刻。非常感谢你今天的分享,期待未来有机会再来做客。
张金涛:谢谢,我也很开心能有这个机会和大家深度交流。
主持人:好的,拜拜。
张金涛:拜拜。

