H3技术问答:核心架构、续写能力及优化策略

该多模态生成模型开源上线第一周,全球开发者社区已经涌现出大量量化适配、硬件优化与工作流搭建的实践案例,同时社区也围绕模型架构、长视频生成、技术局限以及后续开源计划等方向提出了诸多疑问。模型团队近期参与了海外开发者社区的问答交流与开源可视化创作工具的线上直播活动,与全球创作者深入探讨了这些问题,以下是整理后的核心技术观点。
关于模型是否使用多头自注意力,哪些Token会被稀疏化以及方案开放时间的疑问
H3并未采用传统的多头自注意力结构,其稀疏注意力方案更接近MoBA架构。由于相邻视觉Token的相关性较强,通过均值池化即可有效判断视觉块的重要程度,无需额外引入可学习的索引器。目前默认仅对占Token序列比例最高的视频Token执行3D稀疏化处理,图像与文本Token的稀疏化适配仍在探索阶段。该稀疏方案属于训练感知型优化,团队计划近期推出一个保守版本的参考实现,目标是在不造成用户可感知的画质损失的前提下提供可用的代码示例,不同硬件设备上的进一步优化则需要社区开发者共同参与适配。
关于视频VAE编码中第一帧单独处理以及采用双VAE架构的疑问
将第一帧作为独立单元,主要是为了统一图像与视频的训练逻辑,让单张独立图像和视频的首帧在数据处理流程中可以被同等对待。固定采用17帧为一组的处理方式,则是为了保持不同时长视频的潜在空间分布一致性,空间切块的设计也遵循同样的原则,与帧插值技术无关。
采用独立的视觉VAE与音频VAE而非联合VAE,核心原因是为了更好地控制多模态训练流程。如果将视觉与音频信号编码到同一个潜在空间中,很难通过DiT的训练策略分别平衡两种模态的训练进度——音频携带的信息量相对较少,更容易提前收敛并出现过拟合,而独立的VAE架构可以为管理这种模态训练不平衡提供更大的灵活性。
对于双VAE的设计目标,我们并非追求单模态最高的重建质量,而是在保证基础重建性能达标的前提下,更关注最终得到的潜在表征是否有利于后续的生成建模。尤其是视觉VAE,较高的压缩比可以减少视觉Token的数量,降低DiT模块的计算成本,但如果在潜在空间中编码过多细节,又会增加DiT的建模负担,让训练过程更难控制。因此我们会关注不同类型信号在潜在表征中的分配与平衡,并通过完整生成训练流程中的表现来评估VAE的效果,而非仅依赖孤立的重建指标或潜在空间探测结果。
关于H3如何实现优秀的指令遵循与泛化能力的疑问
本质上来说,这一能力的核心在于构建足够广泛且多样化的数据集与任务集合,采用通用架构进行训练,并避免使用无法有效扩展的设计方案。很难将优秀的指令遵循与泛化能力归因于某一个单独的架构选择或训练技巧,这一表现与H3最初的设计目标高度契合——即让单一模型实现广泛的任务泛化。为此团队在数据构建、任务设计、模型架构与训练策略等各个阶段都投入了大量精力,确保每一项设计选择都具备良好的可扩展性。
值得一提的是我们在训练过程中的一个关键观察:一个仅接受过“根据首帧和描述文本预测末帧”这一简单任务训练的模型,在未经过任何图像编辑专项微调的情况下,就能在多个图像编辑基准测试中取得不错的零样本效果。这一结果让我们相信,在自然语言指令引导下,原生的上下文学习能力可以泛化到多种不同的任务中,更多细节会在后续发布的技术报告中公布。

