☰
(论文速读)Unlocking ImageNet’s Multi-Object Nature:自动大规模多标签标注
2026/9/27 10:25:29 网站建设 项目流程

论文题目:Unlocking ImageNet’s Multi-Object Nature: Automated Large-Scale Multilabel Annotation(解锁ImageNet的多对象特性:自动大规模多标签标注)

会议:CVPR 2026

摘要:原始的ImageNet基准测试强制执行单标签假设,尽管许多图像描述了多个对象。这会导致标签噪声,并限制学习信号的丰富性。多标签注释更准确地反映了真实世界的视觉场景,其中多个对象共同出现并有助于语义理解-使模型能够学习更丰富和更健壮的表示。虽然先前的工作(例如,REAL[4]、ImageNetv2[26])已经改进了验证集,但是还没有针对训练集的可伸缩的、高质量的多标签注释。为此,我们提出了一种自动管道,将ImageNet训练集转换为多标签数据集-没有人工注释。使用自监督视觉转换器,我们执行非监督对象发现,选择与原始标签对齐的区域来训练轻量级分类器,并将其应用于所有区域以跨数据集生成连贯的多标签标注。我们的标签在定性评估中显示出与人的判断的强烈一致性,并在量化基准上持续提高绩效。与传统的单标签方案相比,使用我们的多标签监督训练的模型在整个体系结构中实现了一致更好的域内精度(在REAL上高达+2.0 TOP-1精度,在ImageNet-V2上高达+1.5),并显示出更强的下游任务转移能力(COCO和VOC上分别高达+4.2和+2.3 MAP)。这些结果强调了准确的多标签标注对于提高分类性能和表示学习的重要性。

项目代码和生成的多标签批注可在https://githorb.com/jchen175/MultiLabel-ImageNet上找到。


解锁 ImageNet 的多对象本质:自动化大规模多标签标注

一、ImageNet 的"原罪":单标签假设

ImageNet-1K 是计算机视觉领域最重要的基准数据集之一,包含 1000 个类别、128 万张训练图片和 5 万张验证图片。然而它有一个长期被忽视的根本性缺陷:每张图片只有一个标签。

这个"单标签假设"与现实世界严重脱节。现实中一张照片往往同时包含多个有意义的对象——一只狗坐在公园长椅上,一盘点心旁边放着茶壶,水族馆里既有海葵又有珊瑚礁。先前研究(ReaL 等)重新人工标注后发现,约 15% 的 ImageNet 图片至少包含两个有效类别。

单标签假设的危害是双重的:

训练阶段:标签集不完整甚至错误,给模型传递了噪声或误导性监督信号,限制了表征的丰富性。

评估阶段:模型如果正确识别出图中存在的"次要对象",反而会被惩罚,因为评估协议只认可唯一的 ground-truth 标签。这也解释了 ImageNet-V2 相比原始 ImageNet 验证集存在 11–14% 准确率下降的现象——很大程度上是因为 ImageNet-V2 中多对象图片比例更高,而非模型真正退化。

【Figure 1——对比现有重标注策略(MIIL / IN-Seg / ReLabel)与本文方法的示例图。直观展示单标签与多标签标注的差异。】


二、现有工作的局限

既然问题早已存在,为什么一直没被解决?这篇论文梳理了现有工作的边界:

  • ImageNet-ReaL和Multilabelfy:只改进了验证集的标签(约 5 万张),对 128 万张训练集无能为力。人工重标注 128 万张图片的成本极为高昂,工业界普遍认为不可行。
  • ReLabel:用预训练分类器生成 15×15 的 patch 级软标签图,训练时随机裁剪区域从对应位置获取软监督。效果优秀,但每个裁剪区域的标签仍是归一化到 1 的单一软标签分布,不能提供显式的图片级多标签集,也没有实例级的区域-标签对应关系。
  • ImageNet-Segments(IN-Seg):提供了 9K 张训练图片的像素级 mask,但每张图仍只标注了一个对象。
  • MIIL:从 ImageNet-21K 的 WordNet 层级结构派生语义多标签,但缺乏空间定位信息(不知道哪个区域对应哪个标签)。

核心缺口:目前没有任何公开的、完整的 ImageNet-1K训练集多标签标注数据集。


三、本文方法:三阶段自动化标注流程

本文的核心贡献是一套全自动、无需人工参与的流程,将 ImageNet-1K 训练集转化为多标签数据集。整个流程分三个阶段。

【此处配图:Figure 2——完整流程示意图,包括 (a) 标注器训练、(b) 推断、(c) ReLabel 过滤效果、(d) 本文标注器与 ReLabel 的局部预测对比。】

3.1 阶段一:无监督目标发现

首先需要在不使用任何标签的条件下,定位图片中的多个对象区域。

本文采用MaskCut(来自 CutLER)算法,将其应用于 DINOv3 ViT 提取的 patch 级特征上。MaskCut 的核心思路是迭代归一化图割(Normalized Cut):

  1. 将图片的 patch 特征构建成全连接相似度图,用余弦相似度定义节点间的亲和度。
  2. 求解广义特征值问题,利用第二小特征值对应的特征向量将图分割为前景/背景。
  3. 将已发现的前景 mask 排除,对剩余区域重复步骤 1-2,依次发现下一个对象。
  4. 使用 CRF(条件随机场)后处理将粗粒度 mask 细化到像素级。

为了提升覆盖率和鲁棒性,作者对三代 DINO(DINOv1/v2/v3)的多种骨干、分辨率、参数组合进行了系统搜索,最终选出 4 种互补的配置组成集成,在 ImageNet-Segments 验证集上按对象召回率(IoU ≥ 0.5)评估。4 种最优配置为:

  • DINOv3-B/patch_16/feat_v,输入 768,τ=0.35,N=4,不用 CRF
  • DINOv2-G/patch_14/feat_v,输入 672,τ=0.12,N=3,用 CRF
  • DINOv2-L/patch_14/feat_v,输入 448,τ=0.12,N=3,用 CRF
  • DINOv1-B/patch_8/feat_k,输入 480,τ=0.15,N=3,用 CRF

为什么不用 SAM?作者对比了 SAMv2 的多种自动提示配置(Figure 4),发现 SAM 在不同图片上的输出极不稳定——有时过分割,有时漏检关键对象,且对超参数高度敏感,难以找到一套在整个 ImageNet 分布上都可靠的固定配置。MaskCut 则凭借固定配置提供更稳定的实例级提案,更适合大规模流水线处理。

【此处配图:Figure 4(附录 A.3)——SAMv2 两种配置与 MaskCut 的 mask 提案对比图。】

3.2 阶段二:局部标注器训练

有了 mask 提案后,需要给每个 mask 赋予类别标签,并训练一个能泛化到所有 mask 的分类器。

核心难点:如果直接用图片的原始单标签(例如 "guinea pig")监督所有 mask,分类器会学会捷径——无论看到哪个区域都预测 "guinea pig",因为这个标签对每张训练图片都是"正确"的。Figure 2(c) 展示了这个问题:用全局分类器(EVA02)对每个 mask 区域预测,结果全部输出原始类别,完全失去了区分不同对象的能力。

解决方案:利用 ReLabel 的 patch 级置信度图进行提案过滤。具体步骤为:

  1. 将 ReLabel 输出的 [15×15×5] 稀疏 top-5 logit 张量双线性上采样为全分辨率的像素级 logit 图。
  2. 对每个 mask 提案,计算其覆盖像素上的平均 logit 向量,经 softmax 得到类别概率分布。
  3. 只保留那些对图片原始标签的置信度超过阈值(τ_sel=0.75)的 mask,丢弃背景或无关区域。

经过过滤后,留下的 mask 都是已知与原始标签对齐的干净正样本。在这些样本上,在冻结的 DINOv3 ViT-L/16 骨干之上,训练一个 2 层 MLP 分类头(隐层维度 1024)。特征提取方式为:将 mask 上采样至 patch 网格分辨率,对前景 patch 的特征做加权平均池化,得到 1024 维的区域表征。分类头用原始图片标签以交叉熵损失训练,300 个 epoch,SGD + Nesterov 动量,cosine 学习率调度,同时对前景 patch 引入 25% 的 dropout 增强鲁棒性。

这样训练出的分类头能够基于局部区域视觉特征判断类别,而不是记忆全局上下文,因此能泛化到图片中其他未见过的对象区域。训练完成后,该分类头在 IN-Val 上的 top-1 准确率达到 84.73%,ReaL 上达到 88.61%。

3.3 阶段三:多标签推断

推断阶段将训练好的标注器应用于全部128 万张训练图片的所有 mask 提案:

  1. 对每个 mask 提案,提取对应区域特征,经过分类头得到 1000 个类别的 softmax 概率分布。
  2. 取 top-1 预测类别及其置信度。
  3. 聚合同一图片所有 mask 的 top-1 预测:去重,保留最高置信度。
  4. 可选地过滤低置信度预测(τ=0.5)。
  5. 最终标签策略采用Local-Soft + Original:保留每个 mask 的连续置信度分数(而非硬阈值二值化),并叠加原始 ImageNet 全局标签作为补充全局信号。

【Figure 2(b)——推断阶段示意图,展示一张图的多个 BBox 被分别分配不同类别(pug-dog、water bottle、park bench)。】

以置信度 τ=0.5 过滤后的统计结果(附录 Table 5):

【此处配表:Table 5(附录 B.2)——训练集重标注后每张图片标签数量分布(k=0/1/2/3/≥4 的比例及平均标签数)。】

数据表明:20.5%的训练图片含有 2 个及以上标签,整体平均每张图片 1.23 个标签。这一比例印证了单标签标注对训练集多对象场景的严重低估。


四、与人工标注的对齐验证

为了评估标注质量,作者将流程应用于 ImageNet验证集,与 ReaL(由 19 个模型集成提名 + 人工审核的高质量多标签验证集,包含 57,553 个标签,覆盖 46,837 张图片)进行细粒度对比。

将模型的 softmax 输出以阈值 0.5 二值化后,按与 ReaL 的重叠程度分为 5 组,并对每组随机抽取 50 张图片(共 250 张)进行人工评估。

【Figure 3——定性对比示例图,展示本文方法在 (a) 纠正 ReaL 漏标/错标,以及 (b) 代表性失败案例方面的表现。】

【Figure 5(附录 D.1)——更详细的 5 组对比示例(a-e 正确案例,f 失败模式),包括 ReaL 无标签、精确匹配、我们是超集、ReaL 是超集、部分重叠等五类。】

关键发现(对应附录 Table 7):

【Table 7(附录 D.1)——人工评估的详细分组统计,含各组占比及本文方法的修复/遗漏率。】表7.在ImageNet验证集上,我们的重新标记和REAL[4]之间的一致性的人工评估细目。基于对250幅采样图像的详细回顾,我们估计了图像分成三类的比例:(A)REAL没有提供标签(6.33%),(B)REAL的标签集与人确定的地面真实完全匹配(估计75.6%),以及(C)REAL遗漏或错误地标记了一个或多个基本真实类别(估计18.1%)。每组根据Real的注释的质量以及我们的方法是否成功地恢复丢失或错误的标签来进一步细分。百分比表示超过完整的50,000个ImageNet验证集的估计比例。橙色单元格表示Real的标记状态和注释分解;绿色单元格表示我们的方法已修复或未修复。GT指的是我们人类验证的地面真相。

  • ReaL 无标签(6.3%):这 3,163 张图中,我们估计有64%包含有效的 ImageNet 对象——ReaL 的高精度过滤流程将其漏掉了(因为当所有模型对原始标签一致同意时,ReaL 不会发起人工审核)。在这些图中,我们的流程能正确恢复90%以上的缺失标签。

  • 精确匹配(62.9%):我们的自动流程与 ReaL 的人工多标签完全一致。在这些图片中,94%的预测 mask 准确定位了目标对象,验证了强空间定位能力。

  • 我们是 ReaL 超集(13.1%):我们额外预测了 ReaL 未包含的标签,经人工核查,其中74%确实有效——说明 ReaL 的高精度策略漏掉了相当数量的真实次要对象。

  • ReaL 是我们超集(7.7%):ReaL 包含了我们未能预测到的标签,主要原因包括:ImageNet 类别歧义(56%,如同义词、部分-整体关系),分割粒度不足(18%,小对象或遮挡物),置信度过滤剪枝(6%)。

  • 部分重叠(9.9%):两者各有对方遗漏的标签,说明自动方法和人工标注各有互补的覆盖优势。

总体而言,本文方法有效提升了标签覆盖率,在消除 ReaL 的漏标方面表现出色,为大规模数据集标注提供了可扩展的自动化路径。


五、定量实验结果

5.1 数据集与评估指标

实验在以下数据集上展开:

  • ImageNet-1K:128 万训练图、5 万验证图,标准 top-1 准确率。
  • ReaL:47K 图的人工多标签验证集,报告 top-1 和 mAP。
  • ImageNet-V2(INv2):10K 图的泛化测试集。
  • INv2-Multilabelfy(INv2-ML):INv2 的人工多标签版,47.9% 的图含多标签。
  • ImageNet-Segments(IN-Seg):11K 公开验证集,有像素级标注,报告 mAP。
  • Pascal VOC 2007:9,963 张图,20 类,迁移学习基准。
  • MS COCO 2017:118K 训练图,80 类,迁移学习基准。

5.2 与各标签聚合策略的对比

【Table 6(附录 B.3)——硬/软标签、有无全局信号的各种聚合策略对比,ResNet-50 在 100 epoch 下的结果。】

通过系统实验对比 Local-Hard、Local-Soft、加入全局信号(原始标签或分类器预测)等多种组合:

  • Local-Soft 优于 Local-Hard:保留置信度连续分数比固定阈值二值化效果更好。
  • 叠加全局信号有益:局部 mask 预测可能遗漏全局线索,加入原始 ImageNet 标签作为全局信号平均提升约 +0.2 top-1 准确率。
  • Local-Soft + Original 最优:在所有评估集上平均提升+0.96 top-1 准确率和 +1.16 mAP(相比原始单标签训练)。

5.3 ImageNet 分类主实验(ResNet-50)

【Table 1——ResNet-50 在 IN-Val、ReaL、IN-Seg、INv2、INv2-ML 上的 top-1 准确率与多标签 mAP 对比,包含 Original Label、Label Smooth、SCL、LL、ReLabel、ReLabel+Our Mask、Ours 七组方法。】

以 ResNet-50 为基准,本文方法与以下基线比较:

方法ReaL top-1ReaL mAPINv2-ML mAP
原始单标签84.087.173.0
LL(单正样本学习)84.287.272.7
ReLabel85.087.974.8
本文(Ours)85.688.276.2

关键结论:

  • 单正样本学习方法(LL、SCL)对多标签指标提升有限,甚至在 SCL 上出现大幅下降(ReaL mAP 仅 82.2)。
  • ReLabel 在原始 IN-Val top-1 上最高(78.9,因其专门对单标签目标优化),但在所有多标签指标上低于本文。
  • 本文方法在 ReaL、IN-Seg、INv2-ML 三个多标签数据集上的 mAP 均最高,对 ReLabel 平均高出0.77 mAP。
  • 将 ReLabel 的软 patch 监督替换为本文的局部多标签目标(ReLabel w/ Our Mask),在多标签指标上进一步提升,验证了空间定位标签的价值。

多对象子组分析尤其能体现本文的优势:

【Table 2——按 ReaL 中每张图片的真实标签数 k 分组的 mAP 子组分析(k=1/2/3/≥4)。】

对于含 2 个及以上对象的图片,本文方法相比单标签基线平均提升+3.35 mAP,相比 ReLabel 提升+1.48 mAP,充分验证了显式多标签监督对复杂场景的特殊价值。

5.4 跨架构鲁棒性与迁移学习

【Table 3——覆盖 ResNet-50、ResNet-101、ViT-S、ViT-B、ViT-L 五种架构,在 ImageNet 各评估集和 COCO/VOC 迁移学习上的完整对比(单标签 E2E、多标签 FT、多标签 E2E 三种模式)。】

实验涵盖两种训练模式:

  • 端到端多标签训练(E2E):从头以多标签监督训练。
  • 多标签微调(FT):在标准单标签预训练模型上用多标签标注微调 20 个 epoch(轻量级,实用性强)。

域内提升(ImageNet 评估):

微调模式下,所有架构在多标签评估集上均有显著提升。最大提升案例:

  • ResNet-101:INv2-ML mAP +5.04,ReaL top-1 +1.90
  • ResNet-50:INv2 top-1 +1.24

值得注意的是,ViT-Base 和 ViT-Large 在原始 IN-Val(单标签)top-1 上微调后没有提升甚至轻微下降,但在所有多标签评估集上依然有一致提升——这正好印证了单标签评估指标的局限性。

迁移学习(COCO 和 VOC):

多标签训练一致提升下游迁移性能:

方法COCO mAPVOC mAP
ViT-Large 单标签 E2E84.893.4
ViT-Large 多标签 FT85.294.4
ViT-Large 多标签 E2E86.495.0

E2E 多标签预训练相对单标签预训练在 COCO 上平均提升+2.0 mAP,在 VOC 上平均提升+1.7 mAP,挑战了"先单标签预训练再多标签微调"的传统流水线。

5.5 与 MIIL 的对比

【Table 4——与 MIIL(ImageNet-21K 语义多标签预训练)的对比,ViT-B/16 在 224 分辨率下的结果。】

MIIL 依赖 ImageNet-21K 的语义层级多标签进行大规模预训练,是强力基线。本文在不使用 21K 数据的条件下:

  • 仅在 MIIL 基础上用本文标签微调,多标签评估集上全面提升(ReaL mAP +0.1,IN-Seg mAP +0.4,INv2-ML mAP +1.9)。
  • 本文方法从头 E2E 训练(不用 21K 预训练)在 COCO/VOC 迁移上超过 MIIL:+1.9 mAP(COCO)和 +2.4 mAP(VOC)。

作者将此归因于:本文标签强调具体对象的存在性,与真实世界多标签任务的本质更接近;而 MIIL 的语义层级标签更抽象,与 COCO/VOC 的对象级标注存在分布差异。

5.6 特征多样性分析

【Table 11(附录 F.2)——k-NN 熵评估(ResNet-50 和 ViT-B),多标签训练 vs 单标签训练在 ImageNet、VOC、COCO 三个数据集上的特征熵对比。】

作者计算了倒数第二层特征的 k-NN 熵(k=3),以衡量表征的多样性和"神经坍缩"程度。结果表明:多标签训练在所有模型和数据集上均产生更高的特征熵,说明多标签监督能有效防止表征坍缩,促使模型学习更多元化、更具判别力的特征,从而解释了其在迁移学习上的优势。


六、消歧义类别处理

ImageNet 的类别体系中存在 26 对(详见附录 Table 8)语义歧义的类别对,如:

  • 同义词:sunglassvssunglasses, dark glasses(ReaL 中共现 153 次)
  • 部分-整体:car wheelvsgrille, radiator grille(共现 84 次)
  • 层级关系:laptopvsnotebook computer(共现 135 次)

本文提出两种后处理策略:

  1. 协出现先验传播:从 ReaL 统计构建共现矩阵,对预测的软标签向量做矩阵乘法,将一个类别的置信度传播给其高频共现伴随类别。
  2. 非对称阈值配对:基于 ReaL 中的条件概率 P(b|a) 和 P(a|b) 推导类别特定阈值,当某图片预测类别 a 且对 b 的置信度超过 τ_b 时,自动补充 b 标签。

【Table 9(附录 E.3)——两种歧义消解策略在 ResNet-50、ResNet-101、ViT-B 上的效果对比,展示对多标签基线的进一步提升。】

两种策略均带来一致提升。以 ResNet-50 为例,非对称阈值配对使 ReaL top-1 再提升 +0.27,INv2 top-1 提升 +0.32,INv2-ML mAP 提升 +0.68。由于这些后处理依赖 ReaL 的统计信息可能引入偏差,论文主实验中未包含,但提供于补充材料中作为可选增强。


七、应用扩展

除核心标注流程外,该研究还展示了区域级分类头的三个扩展应用:

软标签训练替代品:将本文分类头生成的 patch 级置信度图作为 ReLabel 的替代,仅用 ImageNet-1K 数据训练,却能在 300 epoch 下达到与 ReLabel(依赖 ImageNet-21K 预训练教师网络)持平的分类精度(IN-Val 78.9,ReaL 84.9),且收敛更快。

CutLER mask 质量过滤:将本文分类头用于过滤 CutLER 无监督分割产生的伪标签 mask,以置信度 τ=0.5 排除 12% 的低质量 mask 后,COCO 零样本分割 AP50 从 17.50 提升至 17.80,AP 从 8.71 提升至 8.82,说明该分类头可作为有效的后处理噪声过滤器。

【Figure 6(附录 F.5)——交互式标注工具示意图,对一张含哈士奇、相机、背包的图片给出各区域的类别预测与置信度。】

交互式标注工具:给定用户指定的任意边界框,通过 ROI-Align 提取区域特征,经分类头输出带置信度的类别排名列表。即使目标类别不在 ImageNet 1000 类中(如"登山靴"),分类头也能预测语义相近的类别("跑鞋")并给出较低置信度,为下游数据标注提供便捷工具。


八、总结与展望

主要贡献回顾

  1. 首个完整的 ImageNet-1K 训练集多标签标注:全自动处理 128 万张图片,无需人工参与,提供实例级空间定位,是迄今该规模下的首个此类工作。

  2. 高质量标签:与人工标注的 ReaL 高度对齐(62.9% 精确匹配,94% 正确空间定位),并补充了 ReaL 因保守过滤策略漏掉的大量有效标签。

  3. 持续且广泛的性能提升:在 5 种主流架构(ResNet-50/101、ViT-S/B/L)和多种训练模式下,均一致提升域内多标签评估性能(最高 +2.0 top-1)和下游迁移性能(最高 +4.2 COCO mAP)。

局限性

  • 每个 mask 只预测一个类别,在 ImageNet 类别边界模糊处(同义词、部分-整体、层级类别)容易产生漏标。
  • 对于极小、遮挡或多对象粘连的场景,MaskCut 难以生成干净的分离 mask。
  • 当前超参数针对单标签训练优化,大型 ViT 模型可能需要更长时间才能充分受益于多标签监督。

更广泛的启示

这项工作的意义不仅限于 ImageNet。它展示了自动化重标注这条路径的可行性:遗留数据集不必永远保持静态,通过无监督目标发现 + 局部分类器的组合,可以持续提升大规模数据集的监督质量,为未来的检测、多模态定位和基础模型预训练提供更丰富的训练信号。

代码和标注数据已开源:GitHub - jchen175/MultiLabel-ImageNet · GitHub

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询