文章摘要
何恺明团队推出纯视觉方案NAT-ARC,攻克AI抽象推理标杆任务ARC。该方案借助MAE,在包含猫狗等自然图像的ImageNet上预训练,将通用视觉能力迁移到抽象推理任务,打通了视觉ARC方案的规模化瓶颈,集成模型成绩达70.2%,逼近专用大语言模型系统的水平。

让AI攻克抽象推理难题,居然可以靠教它认猫狗?何恺明团队最新推出的NAT-ARC,正是这样一套纯视觉的ARC解题方案。这套方案完全不依赖大语言模型,而是利用ImageNet上的自然图像做预训练,让模型学会基础的视觉理解能力,再将这些能力迁移到抽象的彩色格子推理任务中。表现最好的单模型在ARC-1数据集上跑出了63.4%的pass@2分数,集成多个模型后更是达到了70.2%,这也是纯视觉方案首次逼近专用LLM系统的水平。

ARC任务与现有解法的瓶颈

ARC全称Abstraction and Reasoning Corpus,由Keras之父François Chollet在2019年提出,是公认最难的AI视觉智力测验之一。每道题会给出2到5组30×30以内的彩色格子输入输出示例,模型需要从中推断出隐藏的变换规则,再将规则应用到全新的输入格子上,预测最终输出。

这类问题看似简单的儿童找规律题,但对AI极具挑战:一方面每道题的变换规则都不固定,没有通用模板可以套用;另一方面仅依靠寥寥2到5组示例归纳规则,还要精确执行,因此ARC成为了测量AI抽象推理能力的核心标杆。

目前ARC赛道的主流解法几乎都依赖大语言模型,这类方案的通用思路是将彩色格子翻译成文本或符号序列,再交给语言模型完成推理。而视觉路线的ARC解法则另辟蹊径,直接用视觉模型处理格子图像,后来逐渐崛起。

其中MIT团队提出的VARC是关键突破,它将ARC重新定义为条件图生图翻译任务,用19M参数量的视觉模型就达到了54%的准确率;后续的LoopViT加入循环推理机制,18M参数量拿下65.8%的成绩;Loop-OWM则用视频预训练模型做小样本学习,10.6M参数量就能达到68.5%。这些视觉模型的参数量比LLM方案小几个数量级,但效果已经开始追平大语言模型方案。

不过视觉路线一直存在结构性短板:多数视觉ARC模型从随机初始化开始训练,没有获取通用视觉预训练的红利,而LLM则通过海量语料预训练积累了通用能力,模型规模越大、预训练越充分,下游任务的表现提升越明显。为了打通视觉路线的规模化瓶颈,何恺明团队提出了NAT-ARC。

基于MAE预训练的迁移方案

NAT-ARC的核心思路,是在VARC的视觉流程中插入ImageNet MAE预训练步骤。MAE即Masked Autoencoder,是何恺明在2022年提出的自监督视觉预训练方法,训练时会遮住图像大部分区域,让模型从剩余碎片中复原原图,借此让模型理解物体的形状、结构和空间关系。

NAT-ARC直接使用MAE在ImageNet(包含约130万张猫狗、花草等自然图像的数据集)上训练得到的encoder权重初始化视觉编码器,解码器则从随机初始化开始训练。整个流程分为三步:

  • 第一步,用ImageNet上的MAE预训练encoder;
  • 第二步,在ARC训练集上离线训练整个编解码器;
  • 第三步,在测试时对每道题单独做LoRA微调。

微调阶段每道题仅提供2到5组示范对,模型需要从这些示例中学习对应题目的变换规则。需要注意的是,MAE的公开checkpoint原本是为更大尺寸的ImageNet图片设计的,而ARC格子仅为64×64像素,尺寸差异较大。为此NAT-ARC丢弃了原始的patch embedding和位置编码,仅保留backbone权重,改用2D RoPE作为位置编码,只保留MAE在ImageNet上学到的视觉特征提取能力,替换掉与ImageNet图像尺寸绑定的空间感知部分,用更灵活的方式重新适配ARC任务。

那么为什么在自然图像上学到的视觉能力,可以迁移到抽象格子推理中?论文通过注意力可视化给出了线索:研究人员对比了三种初始化方式的模型在未训练ARC任务时的注意力分布——随机初始化的模型注意力均匀分散,没有重点;而经过ImageNet MAE预训练的模型已经能够区分前景和背景,自动将注意力聚焦在格子中有意义的图案区域上。即便从未见过ARC格子,模型在ImageNet上学到的“将物体从背景中分离”的能力,在ARC任务中可以天然生效。

研究人员进一步筛选出15道预训练后性能显著提升的ARC题目,手动标注后发现这些题目主要分为两类:6道属于匹配复制类,需要模型识别匹配的对象、颜色或图案,再将对应结构复制到输出中;另外6道属于连通区域推理类,需要模型识别、填充或重新着色空间上连通的区域。这两类能力恰好对应自然图像中的视觉先验:在ImageNet上学到的“将猫从草地背景中分离”的能力,到了ARC任务中就变成了“将连通的彩色区域从格子中识别出来”。由此可见,视觉世界和抽象世界的底层逻辑,在物体分组、图案匹配、区域分割等操作上共享同一套表征。

实验结果与验证

NAT-ARC在ARC-1数据集上的表现亮眼:表现最好的单模型采用huge尺度,参数量0.6B,pass@2成绩达到63.4±0.7%;将三种不同预训练策略(无预训练、ImageNet MAE预训练、ARC风格格子MAE预训练)得到的模型池化做多数投票,集成后的成绩达到70.2±0.6%,总参数量约2B。

作为参照,专门针对ARC微调的The ARChitects采用8B的语言模型,成绩为71.6%。也就是说,视觉路线仅用约四分之一的参数量,就逼近了专用LLM系统的水平。

除了具体成绩,这篇论文最重要的发现之一是预训练打通了视觉路线的规模化瓶颈。没有预训练时,模型规模越大效果反而越差:从base到large性能还有所提升,但从large到huge反而出现掉点,这是因为ARC任务的数据量极少,模型容量增长带来的不是更强的泛化能力,而是过拟合。而加入ImageNet预训练后,规模化曲线变得健康:base、large、huge三个尺度的模型性能一路向上,模型越大效果越好。在离线训练阶段,使用ImageNet预训练的模型收敛速度明显更快,在base、large、huge三个尺度上均是如此,最终的精度也更高。

论文中还有一个极具说服力的可视化验证实验:研究人员训练了一个自编码器,将ImageNet图像映射到60×60、10种颜色的离散格子表示上,相当于将一张猫的照片“翻译”成ARC格式的格子。随后用NAT-ARC对这个格子执行ARC变换,比如旋转180度、添加一圈蓝色边框,再将变换后的格子解码回像素图像。结果显示,猫的图像确实被正确旋转,蓝色边框也准确添加。这个实验将“自然图像和ARC格子共享同一套表征空间”从统计数据变成了可视化的证据:在ARC格子上学到的变换规则,可以直接应用到自然图像的潜在表示中,反之亦然,抽象规则和视觉表征之间的连接本就存在于两个世界的底层逻辑中。

团队与论文信息

这篇论文的一作是Xiaoman Delores Ding,来自MIT CSAIL,同时也是VARC的一作,NAT-ARC正是在VARC的基础上进一步推进的工作。其余作者包括何恺明的首批女弟子之一胡珂雅(Keya Hu),本科毕业于上海交通大学,还有来自MIT的本科生Katelyn Gan和Victor Yin,两人均在CSAIL担任学生研究员。

通讯作者何恺明是ResNet和MAE的提出者,近十年视觉AI领域的核心推动者之一,本次研究使用了他在2022年提出的MAE作为预训练工具,用旧工具打通了新的研究路径。VARC已被CVPR 2026接收,NAT-ARC是其直接后续工作,该团队连续两篇论文坚持纯视觉路线攻克ARC难题,在LLM占据主流的赛道上,不断用实验数据突破视觉路线的性能天花板。

论文地址:https://eccv.ecva.net/virtual/2026/poster/5527

以上内容不代表本平台立场,仅供读者参考