文章摘要
H3开源一周热度居高不下,衍生近300个相关模型,ComfyUI版下载近700万次。开发者围绕其开展多方面工作,跨硬件适配使模型可在更多设备运行;创意拓展使H3有长视频续写等非常规场景;流程升级让其进入自动化制片;社区共建则开展定制化训练。团队将持续迭代,与社区共建开源生态。

H3开源至今已满一周,社区里涌现的创意玩法远超预期。上线以来,这个模型在开源社区的热度始终位居前列,衍生出近300个相关模型,ComfyUI版本的下载量更是接近700万次。从将120GB的模型压缩进消费级显卡,到为Mac打造原生推理引擎,从探索长视频续写到Agent自动化制片,甚至有开发者调低分辨率、缩短帧数,把视频模型当成图像和音频工具来使用,社区开发者们正在用无数尝试解答着“H3能跑在什么硬件上、能接入哪些工具、能拥有哪些新能力”这些问题。

01

跨硬件适配:让模型走进更多设备

H3的基础版本约有60B参数,BF16精度下需要约120GB内存,远超大多数消费级GPU的显存容量。开源后,社区开发者围绕推理效率和硬件适配做了大量工作,在模型质量、推理速度和资源占用之间找到了新的平衡,让H3得以在更多设备上运行。

ComfyUI团队率先降低本地运行门槛,他们移除了占总参数量四成的调制权重,改用功能等效的预计算表,加入INT8 ConvRot量化方案,还针对H3编写了专门降低推理峰值显存的定制内核。经过这些优化,最小模型组合的内存占用从全精度版本的123.6GB压缩到了42.5GB,再搭配动态显存卸载技术,H3终于可以在消费级显卡上完成本地推理。

社区还推出了GGUF、NVFP4、INT4 ConvRot、混合INT4/INT8、OrbitQuant、NF4等多种量化版本,开发者可以根据自己的显存、硬件和推理框架自由选择。

另一边,有开发者为Apple Silicon设备编写了原生推理引擎h3.c,用C和Metal从零重写了H3的本地推理链路,直接读取safetensors权重,将Qwen文本与视觉编码器、DiT、视觉与音频VAE以及最终的音视频输出全部整合进一个原生Mac程序。现在H3在Mac上不再依赖Python和PyTorch,只需一个app就能直接运行,目前已经支持文生音视频、首尾帧参考,以及Ref2VA的图像、视频和音频参考等功能。

在推理速度优化方面,开源首日有研究团队就用Sol Engine在4.5小时内完成了首轮推理优化。在8张NVIDIA GB200、分辨率1344×768、24fps、124帧、50步的测试配置下,Sol Engine相较Diffusers实现了3.95倍的端到端加速,相较SGLang则加速2.80倍。这套方案无需修改H3的权重,还可以扩展到单机设备,帮助开发者针对不同硬件优化H3的推理效率。

针对AMD硬件,有开发者为Radeon AI PRO R9700和ROCm环境编写了ComfyUI补丁,优化了partial RoPE、长序列注意力和模型加载方式。在R9700 32GB显存、分辨率864×480、124帧、20步的测试条件下,生成时间比原生ComfyUI环境进一步缩短。

当模型体积被压缩、平台适配完成、推理速度提升之后,H3的使用场景也发生了改变。它开始真正进入普通个人设备,比如RTX 3060 8GB显卡也可以生成低分辨率视频——虽然画质不适合直接出片,但足够用来调整提示词、检查分镜。有创作者摸索出了“本地打样、云端成片”的工作流:在中端显卡上生成低分辨率视频试错,用本地设备完成预览、筛选和调整,确定满意的方案后,再到云端算力平台生成正式版本并完成超分,大幅降低了创作成本,减少了预览和试错阶段对云端算力的依赖。

02

创意拓展:跳出视频生成的边界

当模型能够稳定运行后,社区开发者开始探索H3的更多可能性,提出了“H3除了生成视频,还能做什么”的问题。通过调整模型的输入、生成帧数、时长和分辨率,开发者们通过大量尝试和优化,让H3拥有了许多非常规使用场景,比如长视频续写、图像编辑和独立音频生成等。

长视频续写方面,有开发者在「ComfyUI-H3-Motion-Context」中提供了一种递归生成方法:直接读取上一段视频的画面与音频latent,截取末尾22帧作为下一段的开头条件,并将音频重新对齐到同一条时间线上。新片段生成后,工作流会裁去开头重复的部分,再与上一段拼接。相比先解码再编码的方式,这种方法减少了逐段转换带来的信息损失,让动作和声音的接续更加自然。

有开发者将这个方法扩展成一套可审核的长视频工作流,加入了分镜规划、逐段预览、重新生成、检查点保存和自动拼接功能,每一段视频都可以单独检查,确认满意后再生成下一段。有创作者用这套工作流制作了一段超过1分钟的视频:先在低分辨率下调整提示词和镜头,再以更高分辨率生成最终片段,同时用角色设定图维持人物和风格的一致性。最终成片在高端显卡设备上完成渲染。

图像编辑方面,开发者将生成的时间维度缩短到一帧,开始尝试用H3进行图像编辑。「SingleFrame」项目将输入图像固定在第0帧,让H3直接生成单帧video latent,再解码为图像。借助提示词,开发者可以在尽量保留原有构图和姿态的前提下,调整人物表情、服装、背景或光线。另一种模式则固定首尾两张图像,让H3推断两者之间的变化,再从中提取一张中间帧。这套工作流并没有为图像编辑做专门训练,直接调用的就是H3原有的能力。

音频生成方面,如果说「SingleFrame」是压缩时间维度让H3输出图像,那么有开发者则选择压缩空间维度,将联合生成的重点转向音频。他们在ComfyUI默认I2V工作流中断开输入图像,将画面分辨率降至32×32,再通过节点单独提取对白、环境声和音效,无需额外搭建专用工作流。在多次测试中,这种方式可以实现接近实时的音频生成,生成的音频时长甚至超过了实际等待时间。当视觉分辨率降低时,音质没有出现明显变化。获得满意的声音或音效后,还可以将其作为音频参考,重新传回H3的视频生成工作流。

03

流程升级:从单次生成到自动化制片

当H3可以在本地稳定部署后,社区开发者开始尝试将其接入智能代理系统,让它成为生产流程中可以反复调用的一环。从单次生成一段视频,到进入一套自动化的多镜头制片流程,H3的使用方式正在被重新组织。

有创作者尝试了一套完整的无人编辑器创作流程:用本地工具调度另一台设备上的本地模型。一台设备负责立项、事实核查、脚本编写、时间线规划、字幕制作、分镜设计和结构审核;另一台设备负责模型推理,由多个工具分别完成关键帧生成、配音、视频生成、音乐制作和音效补充。整套流程被拆分为十余个环节,从基础设定到最终输出一气呵成,H3的批量镜头生成持续了数小时,最终完成了完整作品。

有项目将这套思路封装成了可安装的插件,内置多项功能,通过工具链调用本地H3,可以根据给定的故事或商业需求,完成角色与场景设定、分镜和关键帧设计,再为不同镜头选择对应的H3工作流。镜头生成后,插件会继续完成剪辑、混音、字幕、导出和质量检查。所有创作相关的信息都会保存在项目记录中,任务中断后可以从原处继续,新的尝试也会单独保留版本。H3的单次生成,就这样进化成了一套多镜头的制片流程。

另一种优化方向是直接改造创作界面,将分段计划、条件编码、采样解码和导出整合进一个“导演台”节点。上传源视频后,用户可以手动切分、按时长均分,或者自动识别场景。多种视频生成任务都可以在同一个节点中组织,H3同步生成的立体声音频也会一起输出。原本散落在节点图中的参数被重新组织成镜头、素材和时间线;用户可以单独调整并重新生成选中的片段;在多段生成时,导演台还可以将上一段结尾的动作和音频作为下一段的上下文,保持镜头之间的连续性。

04

社区共建:让模型更贴合创作需求

当H3被接入创作流程后,社区开发者也开始基于官方模型进行定制化训练,让H3更贴合不同的创作需求。有开发者推出了提速LoRA,将H3通常需要约20步的采样缩短到4至8步。他们还为配套工具编写了加载节点和采样器,让这套权重可以适配不同版本的H3。4至8步是实际使用中的主要采样区间:4步采样速度最快,可以大幅提速,但在幅度大、速度快的动作中可能出现拖影;6至8步则会保留更多细节和音频质量。

除了提升速度,还有开发者希望让H3更擅长特定的人物、风格或输入方式。有开发者推出了LoRA训练工具,开发者可以上传视频,再加上可选的文字描述、参考图片、视频或音频。训练时,参考素材会同时进入模型的视觉条件序列和提示词,让LoRA学习参考主体和目标音视频之间的关系。工具开放了多项可调参数,支持画面与声音联合训练。

该开发者发布的写实人物LoRA就是这套工具的实际应用案例:为了让H3生成的人物更接近真实拍摄的质感,团队筛选了数百条真人视频,将素材统一为标准帧率,为每段视频标注人物、场景和动作。他们尝试了多组不同的训练参数,再用相同的提示词和种子对比加载前后的效果,最终发布的版本在人物细节和质感上都有了明显改善。

另一个方向的尝试是将线稿视频作为参考输入,生成上色后的动漫画,实现从连续线稿到完整动漫视频的转换。项目同时开放了权重、推理代码和示例素材,开发者可以直接替换线稿和提示词,测试不同的角色和场景。

除了使用现成的训练工具,开发者还可以直接用自己的音视频数据训练H3的LoRA,甚至进行全参数微调。有开发者基于官方集成,创建了微调工具,按照H3原有的音视频生成方式分别处理画面和声音的噪声日程,并将真实立体声音频纳入训练。项目已经在多显卡设备上完成了训练,社区开发者可以直接在这条路径上部署和修改,训练自己的H3模型。

目前还有很多值得记录的社区项目没有被纳入本文,新的玩法也在不断涌现。更多工作流、开源工具和实战经验已经被收录在社区精选页面,并会持续更新。

H3开源以来,越来越多的创作者和开发者加入了生态建设,每一位提交代码、分享工作流、参与测试、记录问题的创作者都为模型的完善提供了重要参考。团队将持续迭代,保持开放,和社区一起共建更丰富的开源生态。

以上内容不代表本平台立场,仅供读者参考