ECCV 2026:OmniColor支持多模态线稿任意组合上色

在动画、漫画和游戏的美术生产中,线稿上色是看似基础却对细节控制要求极高的环节。创作者不仅需要为线条填充基础色彩,还要兼顾角色身份特征、局部色块规范、前后帧风格统一,尤其是在连续的动画片段中,更需要保持服装、发色、妆容乃至整体背景的高度一致性。在实际创作流程中,用户的控制信号往往是混合出现的,比如文字描述、稀疏颜色提示、角色参考图,或是近期、远期的历史帧素材。
当前主流的线稿上色方案大多仅支持单一或少量控制信号,缺乏统一的机制来处理多条件输入下的控制对齐问题。更棘手的是,不同控制信号之间可能存在冲突——比如角色参考图要求保留人物的整体风格,但局部颜色涂鸦又需要修改特定区域的色彩。因此,面向真实创作流程的上色系统,不能简单地将所有输入信号直接拼接,而是需要动态判断每类信号在当前场景中的合理权重。
针对这些行业痛点,ECCV 2026收录的研究提出了OmniColor,这是一个统一的多模态线稿上色框架。其核心思路是将复杂的上色控制信号拆分为两类:需要严格空间对齐的条件,以及不要求像素级对齐的语义参考条件。基于这个分类,模型设计了针对性的编码策略、训练机制、冗余消除方案和自适应门控模块,从而支持任意组合的多模态控制。
论文标题:OmniColor: A Unified Framework for Multi-modal Lineart Colorization
所属会议:ECCV 2026
研究机构:香港理工大学、四川大学
公开资源:包含论文预印本链接与官方代码仓库
核心信号分类与编码思路
OmniColor将常见的上色输入信号分为两大类别。第一类是空间对齐条件,包括基础线稿、用户提供的颜色提示,以及近期历史帧,这类信息与目标图像在空间位置上存在强对应关系,生成的上色结果需要在边界、局部色彩、整体风格和几何结构上与输入条件保持精准一致。针对这类条件,模型采用双编码器策略:一条路径通过VAE编码器保留颜色边界和高频细节,另一条路径通过VLM编码器提取局部语义,让模型既能关注线条、边缘和色块的位置,也能理解这些区域对应的语义类别,比如头发、衣服或背景。
第二类是语义参考条件,包括文本描述、角色身份参考图,以及长期历史帧,这类信号提供的是更抽象的语义约束,比如角色外观、整体配色、镜头氛围或长期一致性,但不需要与当前输出逐像素对齐。针对这类条件,模型仅采用VLM编码,压缩后的语义token可以有效表达关键属性,同时减少token数量,提升推理效率。
三大核心优化模块
在确定整体编码路径后,OmniColor进一步优化了空间条件控制精度、推理效率和条件冲突处理能力,通过三大模块实现性能提升:
Dense Feature Alignment(DFA):强化空间约束。仅在VAE潜空间使用标准生成损失,往往无法保证局部结构的严格对齐。OmniColor引入了DFA损失,通过DINOv3提取预测图像和真实图像的稠密特征,利用MSE损失约束二者对齐。考虑到早期生成阶段噪声较多,该监督仅在较晚的去噪阶段生效。
Temporal Redundancy Elimination(TRE):历史帧冗余去除。动画序列的相邻帧通常包含大量重复的静止内容,如果直接编码所有历史帧,模型会接收大量冗余token,既影响推理效率,也可能稀释真正有价值的变化信息。TRE机制将参考帧划分为多个patch,计算相邻帧对应patch的颜色直方图相似度,过滤掉高度相似的冗余区域,再通过连通域分析提取最小包围框,仅保留历史帧中发生变化的局部区域,让模型接收更精准的历史参考信息。
Adaptive Spatial-Semantic Gating(AS-Gate):动态处理多条件冲突。多模态控制的难点不仅在于信息总量大,更在于不同信号之间可能存在矛盾。AS-Gate模块可以根据空间分支的信息密度,动态调节语义分支的影响权重:当线稿、色块或近期历史帧已经提供了强空间约束时,模型会降低部分语义参考的干扰;反之则会更多依赖语义参考信息。该门控被集成到MMDiT的注意力结构中,并通过零初始化的LoRA保证训练初期接近恒等映射,避免模型训练初期出现不稳定的情况。
实验验证:性能、控制与一致性同步提升
研究团队基于25部高质量动画序列构建了训练数据集,共得到12万对高质量样本;测试集来自6部未在训练中出现过的动画,包含305个视频片段和900个图像级测试样本。实验将OmniColor与三类主流方法进行对比,在相同输入条件下,OmniColor表现出更优的性能。此外,该方法支持控制信号的自由组合,同一张线稿可以结合文本、颜色提示、身份参考和历史帧等任意组合,生成高质量的上色结果。
在文本引导上色测试中,该方法可以实现文本语义与线稿结构的精准对齐。相比之下,通用多模态生成模型虽然可以理解提示词,但难以严格贴合线稿结构;传统线稿上色方法又缺乏足够灵活的多模态组合能力。参考图像着色结果展示了模型对角色身份和风格信息的保持能力,即使目标画面与参考画面存在角色旋转、镜头推拉或视角变化,模型仍能稳定恢复角色的面部特征、发色和服饰风格。
多模态协同控制实验体现了OmniColor的细粒度控制能力,加入身份参考后,角色妆容、发色等个体属性可以得到更准确的上色;加入颜色提示后,模型可以将局部色块信息准确传播到对应的语义区域。序列化生成实验展示了该方法在连续生成时的优势,当使用目标片段的第一帧作为空间参考时,生成结果与真实片段的相似性进一步提升。最后,研究团队在真实线稿上进行了测试,获得了出色的着色结果,展现出面向实际创作场景的应用潜力。
消融实验:模块有效性验证
消融实验结果显示,仅使用VLM编码可以显著降低推理延迟;DFA损失有效增强了结构保真度;TRE机制进一步减少了长期历史帧带来的token开销;加入AS-Gate模块后取得了综合最优的表现,证明自适应门控可以更好地平衡空间约束和语义参考的权重。
研究价值与未来展望
OmniColor的核心贡献在于将多样化的上色输入信号纳入同一套统一框架,而非为每种输入单独训练模型或设计独立流水线。这种统一性让模型可以适配更复杂的生产级场景,也为后续构建交互式AI上色工具提供了坚实的基础。随着未来推理速度进一步提升,并且将应用场景拓展到更抽象的草图或早期概念设计阶段,这类技术有机会成为动画、漫画和游戏资产生产中的高频辅助工具。

