SigmaZ AI:RSI自进化+Diffusion-LM,Tap8引领交互视频革命

在当下的AI视频创作场景中,很多创作者都面临着重复劳动的困扰:一支广告只需要调整商品价格,却要重新渲染整条视频;一套产品说明仅需针对不同客户微调细节,却要输出数十个版本。传统的像素级AI视频模型生成的内容是固化的像素流,任何细微修改都需要从头生成,而SigmaZ AI推出的代码驱动交互视频方案,正在打破这个局限。
近期,基于扩散语言模型(DLM)的实时交互视频技术公司SigmaZ AI宣布完成数百万美元融资,投资方包括蓝驰创投、云启资本、德迅投资、小小基金以及多位知名投资人。这家公司由2003年出生的剑桥连续创业者杨博麟,与曾在Amazon AGI Lab担任旗舰模型视觉代码训练技术主管的Derek Law联合创办。
SigmaZ AI的核心思路是将视觉表达分为两个维度:像素擅长传递外观细节,代码则负责构建结构逻辑。二者结合后,生成的不再是单一固化的视频文件,而是可以实时交互的“活画面”——用户可以直接修改画面中的文本、组件、参数或数据源,无需重新生成整条内容。他们的首款旗舰产品Tap8即将正式发布,此前发布的视觉交互demo视频在社交平台上线6小时内播放量近8万,当日登上当日新闻榜首,24小时内吸引了数千名内测用户加入等待名单,同时促成了与20多家B端合作方的签约。
当前的AI交互大多还局限在文本对话框中,无论是打字还是语音问答,都很难匹配人类真实的信息获取习惯。人类的很多好奇心无法被精准转化为文字,比如看耳机测评时想直接查看内部结构,跟着健身视频时想实时得到动作纠正,这些可视化的需求如果只能通过文字描述来实现,本身就是一种信息损耗。
背后更深层的问题是人与AI之间的信息带宽差距:成年人静默阅读速度约为每秒5个token,而当前前沿AI模型的输出速度已经达到每秒300个token,单用户与模型的带宽差距可达60倍,如果多个智能体并行交互,差距甚至会扩大到600倍。要弥合这个差距,需要更换的不是模型本身,而是人机之间的交互界面。
OpenAI创始成员Andrej Karpathy曾指出,人脑约三分之一的算力用于处理视觉信息,视觉是信息进入大脑的十车道高速路;AI的输出形态也将从纯文本、markdown、HTML,最终走向模型直接生成的可交互视频。SigmaZ AI选择的像素代码混合路线,正是顺应了这个趋势。
为了实现实用化的实时交互视频,SigmaZ AI从基础设施层面入手,打造了三个相互咬合的技术壁垒,形成了自己的技术飞轮。
第一个核心押注是生成媒介的混合模式:将像素与代码的优势结合,代码负责结构、因果、交互和状态等需要精准性的低熵内容,像素扩散则负责纹理、细节和开放世界的高熵视觉效果。传统纯像素视频生成的画面一经固化无法修改,而SigmaZ AI的模型可以直接输出可执行的前端代码,渲染后形成的画面元素依然可以被实时调整,交互本身就是内容的一部分而非外挂功能。
需要注意的是,视觉代码生成的难点不在生成侧,而在训练侧:给视觉代码打分需要先渲染,但训练中的尝试性生成很容易导致渲染环境崩溃,尤其是动画和3D场景。为此SigmaZ AI自研了一套安全渲染、截屏和打分的基础设施,可以在代码不稳定时不阻塞训练集群,同时通过异步协调和批处理让视觉评审的反馈回流到训练过程中。
第二个核心押注是基于视觉引导的递归自进化模型。传统扩散语言模型单次生成的智能上限有限,很难同时兼顾结构逻辑和视觉效果。SigmaZ AI的思路不是要求模型一次答对,而是通过推理时扩展让模型在单个任务上多轮试错:先生成代码,渲染后由视觉评审模型找出问题,再反馈给编码代理进行修改,通过多轮生成-渲染-评审-修改的循环不断逼近最优结果。
得益于DLM更快的生成速度,这种循环首次可以在实时场景中实现。SigmaZ AI实测显示,即使加入这个循环,首帧生成时间也可以控制在数秒内。为了让模型真正进化而非仅单次修改,团队还加入了训练时内化环节:将推理过程中的批评、修改和最优轨迹转化为训练信号,蒸馏回模型权重,让迭代中获得的经验可以沉淀为模型的能力。
此外,评审标准本身也需要持续进化。视觉效果的好坏是主观的,固定的评审模型会让训练结果落后于当前审美。SigmaZ AI设计了“元评审层”持续校准机制:元评审代理会关注评审模型与人类专家打分不一致的场景,自动通过实验重新校准评分标准;同时元编码代理会批量分析评审反馈,找出编码代理反复出现的系统性错误并提出改进方案,通过回测后即可上线。整个过程中人类专家可以全程抽检,确保优化方向符合人类需求。
第三个核心押注是为实时生成重做模型栈:采用Diffusion-LM而非传统自回归模型。自回归模型逐token串行生成,速度约为每秒100token,生成复杂场景需要数分钟,无法满足实时交互需求;而DLM可以并行生成和修改所有位置的内容,业内最高速度可达每秒2146token,比自回归模型快一个数量级,几秒钟即可完成场景修改。
SigmaZ AI很早就将DLM系统性应用于实时交互视频场景,在DLM落地前就已经布局了视觉质量、评测体系和自进化基础设施,等到DLM范式成熟后,只需要补上最后一块拼图即可。与其他通用横向路线的DLM产品不同,SigmaZ AI将通用基座模型后训练为擅长动态图形代码的专家,叠加自研的训练框架、评测栈和数据飞轮,这套垂直整合的系统是无法通过购买通用模型获得的核心护城河。
SigmaZ AI的核心壁垒不仅来自技术,还来自团队在模型训练、视觉生成和消费级产品之间的复合能力。创始人杨博麟拥有华威大学和剑桥大学背景,曾将多个创业项目从零做到数千万营收并完成退出,对新技术的产品化落地有丰富经验;联合创始人Derek Law毕业于帝国理工学院,有近十年前沿AI实验室经验,曾带领跨美英印的团队在Amazon Nova上线基于HTML的可交互回答产品,比同类产品早半年到一年。他作为核心作者发表的相关论文《Vision-Guided Iterative Refinement for Frontend Code Generation》,已被ICLR 2026的RSI Workshop收录。
除了团队,SigmaZ AI的另一大优势是数据积累。交互视频作为全新品类,没有现成的公开数据集和专业标注服务。过去一年,团队通过真实生产环境积累了数十万条带人类偏好标注的真实数据,来源分为三类:C端消费产品积累的种子数据、B端试点合作产生的结构化场景数据,以及合成数据实现的规模扩展。三类数据互为补充,共同构成了模型后训练的核心素材,驱动自进化闭环持续运转。
谈及公司的诞生背景,创始人杨博麟表示,每一轮媒介革命都是底层技术先改变,再催生新的载体和平台:印刷术催生报纸,无线电催生广播,视频编码加流媒体催生短视频平台,而当下AI就是下一代媒介的底层技术,其产物将是实时交互内容。
在技术实现上,Diffusion-LM将成为实时交互时代的新模型范式,代码则会成为连接视觉世界的重要原生语言。届时同一支视频,每个用户都可以衍生出专属的版本,承载视频交互的界面将成为AGI时代人与信息之间最高频、最有价值的触点。从二维播放到实时交互,从观看者到创作者,从对话框里的AI到画面里的AI,SigmaZ AI正在打开人机交互的全新入口。

