MLNLP学术Talk:北大刘烜奕详解CamGeo图生视频技术

本次前沿学术分享讲座聚焦图生视频生成领域的最新技术进展,由专业的机器学习与自然语言处理学术社区联合国内相关学术领域的青年工作委员会主办,邀请高校青年学者带来原创研究成果的深度分享。
本场讲座的具体安排为:2026年9月12日上午9:00至10:00,由北京大学人工智能学院博士生刘烜奕带来主题为“CamGeo:基于3D几何先验的稀疏相机条件图生视频生成”的学术报告。本次活动的组织者包括王奕辰、蒋官语、张宸源、涂耿、卢俊宇,战略合作伙伴为腾讯。
讲者简介
刘烜奕目前为北京大学博士研究生,主要研究方向包括可控视频生成、3D几何先验与视频世界模型。他已在ICML、CVPR、NeurIPS等国际顶级学术会议及期刊发表多篇高质量论文,并入选2025年腾讯犀牛鸟精英人才计划。
报告核心内容
随着视频生成技术逐步向交互式创作、虚拟拍摄以及通用世界模型方向发展,如何精准控制相机运动成为了一项核心挑战。当前主流的相机条件式图生视频方法大多依赖逐帧的密集相机位姿信息,用户要么需要提供完整的相机运动轨迹,要么需要先从参考视频中提取密集位姿数据,这在实际应用场景中往往不够便捷。而如果仅采用少量关键帧的相机条件进行引导,又容易出现轨迹漂移、运动抖动以及三维结构不一致的问题。
本次报告将介绍CamGeo,一款基于稀疏相机条件的视频生成框架。该框架在训练与测试阶段均采用稀疏相机作为控制条件,同时引入VGGT提供的三维几何先验知识,通过关键帧轨迹蒸馏以及跨帧几何一致性约束,将相机控制信号有效传播到未标注的中间帧。此外,CamGeo采用了课程学习的训练策略,从粗粒度到细粒度逐步提升模型的稀疏控制能力。实验结果显示,该方法在SVD、CogVideoX等主流基础模型上均能更精准地跟随相机轨迹,同时拥有更出色的时序一致性、三维稳定性与视觉表现。报告最后还将探讨CamGeo作为连接可控视频生成、虚拟拍摄与未来视频世界模型的几何接口的发展潜力。
本场主持人
本次活动的主持人是卢俊宇,目前为大连理工大学计算机学院四年级博士生,导师为林鸿飞教授,入选2025年度中国科协青年科技人才培育工程博士生专项计划。他的研究方向包括大模型安全与仇恨言论检测,以第一作者身份在NeurIPS、ACL、SIGIR、TASLP等国际顶级会议及期刊发表多篇论文,同时担任相关学术会议的审稿人。他还参与了SemEval、NLPCC等多项国际语义评测并获得一等奖。
观看渠道
本次活动将通过视频号与B站两大平台同步直播,感兴趣的观众可以提前关注相关渠道,获取最新的直播通知。
关于主办社区
本次活动的主办社区是由国内外机器学习与自然语言处理领域的学者联合搭建的民间学术交流平台,目前已发展为国内外知名的专业社区,受众覆盖全球范围内的NLP、机器学习领域的硕博生、高校教师以及企业研发人员。该社区的愿景是推动自然语言处理、机器学习领域的学术界、产业界与广大爱好者之间的交流与进步,尤其是助力初学者的成长与发展,为相关从业者提供深造、就业及研究相关的开放交流空间。

