FeyNoBg发布:开源自动背景去除模型,在四项基准上达到SOTA

2026年7月,Feyn Labs正式发布FeyNoBg——一款开源自动背景去除模型。该模型基于BiRefNet架构进行深度优化,将特征提取器第三阶段从18个模块扩展至24个模块,参数量从2.22亿增至2.63亿。在八个公开基准测试中,FeyNoBg在四项上取得了S-measure最佳成绩,其余四项与当前领先者的差距控制在2%以内。与此同时,团队开源了训练库NoBg,为开发者提供统一的推理与微调接口。模型与代码分别发布于Hugging Face和GitHub平台。

背景去除任务的技术挑战
图像背景去除是计算机视觉领域的一项基础性任务。其核心目标是为图像中的每个像素预测一个不透明度值(alpha值),使得背景像素变为透明,前景像素保持不透明,而边界像素呈现半透明状态。
这项任务之所以困难,在于它要求模型同时具备两种截然不同的能力。第一,模型必须准确地将前景与背景分离开来。当主体位于纯色背景前时,通过颜色对比即可完成;但在低对比度、拥挤或具有伪装效果的图像中,模型必须借助形状、纹理和上下文信息来识别哪些像素构成了主体。第二,模型必须精确追踪前景的边界。头发、毛发、细线和运动模糊会使前景和背景元素混合在一起,模型需要判断每个边缘像素有多少属于主体。这两种技能通常通过不同类型的数据集分别训练,但糟糕的训练混合可能导致模型失衡——一项技能的提升以牺牲另一项技能为代价。
从分割到抠图的技术演进
早期的背景去除方法主要依赖传统图像处理技术,如颜色键控(色度键)和边缘检测。深度学习的引入彻底改变了这一领域。U²-Net作为早期的代表性工作,采用嵌套U型结构进行显著目标检测,在背景去除任务中得到了广泛应用。随后,MODNet提出了实时无trimap的人像抠图方案,专注于软边界预测。
真正的技术突破来自BiRefNet(Bilateral Reference Network)的提出。该架构通过双边参考机制同时建模前景与背景特征,在DIS基准上实现了8.0%的S-measure提升。BiRefNet将任务拆解为两个互补的模块:定位模块负责寻找主体,重建模块负责追踪主体边界。这种分工使得模型在保持整体结构完整性的同时,能够精细处理边缘细节。
BiRefNet的成功催生了一系列衍生模型。BRIA AI基于BiRefNet架构开发了RMBG-2.0,将准确率从1.4版本的73.26%大幅提升至90.14%。此外,InSPyReNet通过引入空间金字塔注意力机制,在编码器-解码器架构中实现了高精度图像分割。BEN和BEN2则基于Confidence Guided Matting流水线,进一步优化了推理效率。
FeyNoBg的定位与创新
FeyNoBg正是在这一技术背景下诞生的。它继承了BiRefNet的核心架构优势,但在两个关键维度上实现了突破:架构微调与数据策略革新。不同于单纯追求参数规模扩张的做法,Feyn Labs团队将重心放在训练数据的优化组合上——这一策略被证明比参数扩张更为有效。
架构设计:在BiRefNet基础上精准微调
特征提取器的阶段性强化
FeyNoBg以BiRefNet作为基础架构。BiRefNet的特征提取器分为四个阶段运行:早期阶段捕捉局部细节,后期阶段将收集到的细节组合成更广泛的图像表征。定位模块利用这些特征图寻找主体,重建模块则利用它们恢复主体边界。
特征提取器的第三阶段在整个架构中承担着最核心的任务。它既能观察到足够多的图像信息以推理整个主体,同时又保留着表征主体形状所需的空间细节。定位和边界重建都高度依赖该阶段生成的特征图。
基于这一洞察,Feyn Labs团队将第三阶段从18个模块扩展至24个模块。这一改动使模型参数量从2.22亿增长至2.63亿。在扩展过程中,所有兼容的预训练权重被完整保留,仅有新增的六个模块从零开始训练。
架构决策的技术逻辑
这一架构决策体现了“精准干预”而非“全面重构”的设计哲学。BiRefNet的原始架构已被证明在背景去除任务上具备强大的能力。Feyn Labs团队选择在最关键的特征提取阶段增加容量,而非重新设计整个网络结构。这种做法的优势在于:既保留了BiRefNet已验证有效的核心机制,又为模型在最具挑战性的表征环节提供了更多学习空间。
从参数量来看,2.22亿到2.63亿的增长幅度(约18.5%)并不算大。与动辄数十亿甚至上千亿参数的大模型相比,FeyNoBg保持了相对轻量的设计。这种适度的参数扩展使得模型在推理效率与性能提升之间取得了平衡。
数据策略:十源混合驱动的性能突破
单一数据源的局限性
Feyn Labs团队在训练FeyNoBg的过程中经历了一个关键的转折点。最初,团队仅使用一套高质量合成数据MaskFactory进行训练。结果呈现出明显的“能力分裂”现象:在伪装场景基准CAMO上分数有所提升,但在高精细分割基准DIS5K上却出现了下降。
同一个模型,仅仅因为换了训练目标,两项能力就出现了此消彼长的情况。这说明单一数据源无法同时满足背景去除任务对主体识别和边界精度的双重需求。伪装场景要求模型具备强大的上下文推理能力以识别隐藏的主体,而高精细分割则要求模型具备像素级的边界感知能力——这两种能力在单一数据分布下难以兼得。
十源混合训练方案
最终的解决方案是数据配方的全面调整。团队放弃了单一数据源的训练策略,转而采用多源混合训练方案。具体而言,团队从10个不同的数据集中分别取样,每个数据源的上限设置为4000张,最终汇集出26,100张图像。
这10个数据源覆盖了多样化的场景类型:拥挤场景、伪装物体、高分辨率图像、人像、动漫等。通过这种多样化的数据组合,模型得以接触到更广泛的视觉分布,从而在不同类型的图像上都获得稳定的表现。
混合训练的效果立竿见影。原先在DIS5K上退步的问题不仅得到弥补,还反超成为八个基准中的领先结果。
数据配方的核心启示
FeyNoBg的训练历程揭示了一个重要规律:在背景去除任务中,数据的质量与多样性往往比参数规模更具决定性作用。参数扩张(从222M到263M)为模型提供了更多的学习容量,但真正释放这一容量潜力的,是覆盖10个数据源的混合训练策略。
这一发现对于开源社区具有重要的借鉴意义。在算力和数据资源有限的情况下,精心设计的数据配方可以成为提升模型性能的高效路径,而非仅仅依赖参数规模的扩张。
基准评测:八项测试四项夺冠
评测范围与指标
FeyNoBg在八个公开基准上进行了系统性评测。评测覆盖了多种具有挑战性的场景类型,包括伪装物体、低对比度图像、精细结构、高分辨率图像和视频内容。
评测采用的核心指标是S-measure(结构相似性度量)。S-measure衡量预测前景与标准答案之间的形状匹配度,其核心关注点在于主体是否完整、轮廓是否贴合。
具体成绩
在八项基准测试中,FeyNoBg在四项上取得了已发表的最佳S-measure分数。其余四项与当前最佳公开结果的差距不超过2%。
这一成绩意味着FeyNoBg在超过半数的评测基准上达到了当前最佳水平,而在所有基准上都保持在与领先者极其接近的区间内。用“击败或匹敌当前领先者”来描述FeyNoBg的表现是准确的。
成绩背后的技术支撑
这一成绩的取得是多方面因素共同作用的结果。架构层面的适度扩展(第三阶段从18块增至24块)为模型提供了更充分的学习空间。但更关键的因素是数据策略的革新——10个数据源的混合训练使模型具备了跨场景的泛化能力。
需要特别指出的是,S-measure的领先并不等同于在所有细分维度上的全面领先。S-measure主要衡量形状匹配度,对于发丝、半透明物体、运动模糊等精细透明度问题,S-measure并不直接反映模型的表现。
主流背景去除模型横向对比
为了更全面地理解FeyNoBg的技术定位,以下将其与当前主流的开源背景去除模型进行系统对比。
| 对比维度 | FeyNoBg | BiRefNet | RMBG-2.0 | InSPyReNet | BEN2 | U²-Net |
|---|---|---|---|---|---|---|
| 基础架构 | BiRefNet(改进) | Bilateral Reference Network | BiRefNet | 编码器-解码器+金字塔注意力 | Confidence Guided Matting | 嵌套U型结构 |
| 参数量 | 263M | 222M | 约200M级 | — | — | 约44M |
| 训练数据源 | 10个数据集混合(26.1K张) | 多源 | 超过15个数据集 | 多源 | 多源 | DUTS等显著目标数据集 |
| S-measure领先基准数 | 8项中4项第一 | DIS基准S-measure提升8.0% | 多项SOTA | 早期最优 | 多项领先 | 基础水平 |
| 精度指标 | 其余4项与领先者差距<2% | DIS5K领先 | 准确率90.14% | MAE: 0.042 | 误差<1% | 基础水平 |
| 推理效率 | 中等(263M参数) | 中等 | 中等 | 较快 | 0.255s/图(Ascend910) | 较快(33秒/大图) |
| 开源协议 | 开源(Hugging Face + GitHub) | 开源 | 开源 | MIT | 开源 | 开源 |
| 特色能力 | 十源混合训练+NoBg训练库 | 双边参考机制 | 发丝级精细分割 | 空间金字塔注意力 | 置信度引导抠图 | 显著目标检测 |
| 主要局限 | 发丝/半透明精度待验证 | 部分边缘场景不足 | 动漫等特殊场景不稳定 | 复杂背景表现一般 | 需NPU适配优化 | 边缘噪声较多 |
数据来源:
对比分析
从架构层面看,FeyNoBg、RMBG-2.0与BiRefNet同属一个技术家族,均基于BiRefNet的双边参考机制。FeyNoBg的差异化优势体现在两个层面:一是在特征提取器第三阶段进行了精准的容量扩展(18块→24块);二是采用了10个数据源的混合训练策略。
从数据策略来看,FeyNoBg的十源混合方案在覆盖广度上具有显著优势。相比之下,RMBG-2.0虽然也使用了超过15个数据集,但FeyNoBg在训练过程中经历的“单一源失衡→多源平衡”的迭代过程,为数据配方的优化提供了宝贵的实践经验。
从推理效率来看,FeyNoBg的263M参数在主流模型中处于中等水平。BEN2在Ascend NPU上实现了0.255秒/图的推理速度,U²-Net的轻量版本在速度上更具优势。FeyNoBg在精度与效率之间选择了偏向精度的平衡点。
从功能边界来看,FeyNoBg在S-measure指标上的领先并不自动延伸至发丝、半透明和运动模糊等精细场景。在这些维度上,专门针对人像抠图优化的模型(如MODNet的软alpha预测)可能具有额外优势。
开源生态:NoBg训练库的战略价值
统一接口的痛点
在FeyNoBg发布之前,BiRefNet及其衍生模型面临一个实际问题:不同机构发布的权重各自为政,每个仓库都有一套独立的输入输出格式。开发者若想对比不同模型的性能,或基于某个权重进行微调,首先需要花费大量时间编写适配代码。
这种“胶水工程”消耗了本可以用于模型优化和应用的宝贵资源。Feyn Labs团队在发布FeyNoBg的同时,开源了NoBg——一个专门用于训练和运行背景去除模型的Python库。
NoBg的核心功能
NoBg提供了一套统一的推理和微调接口。同一套processor既可以运行FeyNoBg,也可以用于微调用户自己的数据。这种设计大幅降低了开发者尝试不同模型、适配不同数据的门槛。
NoBg的发布还解决了另一个实际问题:性能对比的公平性。不同仓库在批量配置、预处理流程上的差异可能导致同一模型在不同环境下表现出显著差异。NoBg通过标准化的接口和配置,为公平对比创造了条件。
对开源社区的长期影响
NoBg的开源具有超越单一模型发布的战略意义。它不仅服务于FeyNoBg,更为整个背景去除开源社区提供了一套基础设施。开发者可以基于NoBg快速验证新的训练策略、对比不同架构的效果、或将背景去除能力集成到更广泛的应用中。
这种“模型+训练库”的双开源模式,降低了从研究到应用的转化成本,有望加速背景去除技术在各行各业的落地。
技术边界与局限性
S-measure的衡量范围
准确理解FeyNoBg的技术边界,需要正视S-measure这一核心指标的衡量范围。S-measure衡量的是预测前景与标准答案之间的形状匹配度——它奖励主体完整、轮廓贴合的结果。但S-measure不直接衡量发丝、半透明物体、运动模糊这类精细透明度问题。
Feyn Labs团队在训练中做了一个明确的取舍:将分割数据的mask和matting数据的alpha matte全部转换为二值前景mask。matting数据原本应提供的软透明度监督,被替换成了更精确的轮廓监督。这一取舍换来了训练稳定性和跨场景泛化能力的提升,代价是未触及alpha matting中技术难度最高的部分。
真实场景的挑战
在真实应用场景中,背景去除面临的挑战远超标准基准的覆盖范围。发丝的精细边缘、玻璃等半透明材质、运动模糊造成的边界弥散——这些在商业摄影、电商图片处理、视频编辑等场景中频繁出现的问题,FeyNoBg并未声称已经完美解决。
团队坦诚地指出:“S-measure领先不等于发丝、半透明、运动模糊这些真实抠图难点也领先”。这一实事求是的表述有助于开发者做出合理的技术选型决策。
适用场景建议
基于上述技术边界,FeyNoBg最适合的应用场景包括:批量商品图背景处理、视觉内容自动化流程中需要主体分割的环节、以及对形状准确性要求较高但对透明度细节要求相对宽松的场景。
对于发丝级精细抠图、半透明材质处理等对alpha matting精度要求极高的场景,开发者可能需要结合其他专门优化的模型或后处理方案。
总结与展望
FeyNoBg的发布代表了开源自动背景去除模型的一次重要进步。在技术层面,它通过对BiRefNet架构的精准微调和10个数据源的混合训练,在八个公开基准中的四项上取得了S-measure最佳成绩。在生态层面,NoBg训练库的开源为开发者提供了统一的推理与微调接口,降低了背景去除技术的应用门槛。
FeyNoBg的技术路径揭示了一个重要趋势:在背景去除领域,数据配方的优化比参数规模的扩张更具决定性。这一发现对于资源有限的开源社区和研究团队具有重要的指导意义。
展望未来,背景去除技术仍面临若干待突破的方向。如何在不牺牲形状精度的前提下提升对发丝、半透明等精细场景的处理能力;如何在保持开源透明性的同时推动模型性能的持续提升;如何让训练框架(如NoBg)更好地服务于多样化的硬件平台和应用场景——这些都将成为该领域下一阶段的研究重点。
FeyNoBg的完整模型权重可在Hugging Face平台获取,训练与推理代码可通过GitHub访问NoBg仓库。
常见问题(FAQ)
问:FeyNoBg与其他开源背景去除模型(如RMBG-2.0)的主要区别是什么?
FeyNoBg与RMBG-2.0均基于BiRefNet架构。两者的主要区别在于:FeyNoBg将特征提取器第三阶段从18块扩展至24块,并采用了10个数据源的混合训练策略;RMBG-2.0则侧重于更广泛的数据覆盖(超过15个数据集)和准确率的显著提升(从73.26%到90.14%)。
问:FeyNoBg在哪些基准上取得了SOTA成绩?
FeyNoBg在八个公开基准中的四项上取得了已发表的最佳S-measure分数,涵盖了伪装、低对比度、精细结构、高分辨率和视频等场景。其余四项与当前领先者的差距控制在2%以内。
问:FeyNoBg能处理发丝和半透明物体吗?
FeyNoBg在S-measure(形状匹配度)指标上表现出色,但团队明确表示该指标不直接衡量发丝、半透明物体和运动模糊等精细透明度问题。训练中将matting数据的alpha matte转换为二值mask的取舍,使模型在轮廓精度上受益,但未专门优化透明度预测。
问:NoBg训练库的作用是什么?
NoBg是Feyn Labs同步开源的Python训练库,提供统一的推理和微调接口。开发者可以用同一套processor运行FeyNoBg或微调自己的数据,无需为不同仓库编写适配代码。
问:FeyNoBg的模型大小和推理速度如何?
FeyNoBg的参数量为2.63亿。相比原BiRefNet的2.22亿增长了约18.5%。在主流背景去除模型中处于中等规模,在精度与推理效率之间选择了偏向精度的平衡点。
问:FeyNoBg可以商用吗?需要什么许可证?
FeyNoBg以开源形式发布,模型权重可在Hugging Face获取,代码可在GitHub获取。具体商用条款建议查阅官方仓库的许可证声明。
问:如何在自己的项目中集成FeyNoBg?
开发者可以通过NoBg库快速集成FeyNoBg。NoBg提供了标准化的processor接口,支持推理和微调。详细的集成方法请参考GitHub仓库的文档。
问:FeyNoBg未来会有更新吗?
Feyn Labs团队表示将持续关注社区反馈。作为开源项目,FeyNoBg和NoBg的未来发展将受到社区参与和贡献的影响。

