YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family——面向异构实时检测器的结构感知参数高效微调框架
2026/8/20 23:13:03 网站建设 项目流程

核心问题:从语言模型迁移而来的通用PEFT方法(如LoRA)在异构的实时目标检测器上可能静默失效,因为检测器中包含卷积、注意力、文本融合、MoE路由等多种异构算子,而现有PEFT接口仅通过模块名称匹配来放置适配器,缺乏对算子契约、检测语义和部署兼容性的预训练检查。

主要贡献:YOLO-PEFT提出了一个结构感知框架,将适配器放置形式化为可审计的约束规划问题,在训练前返回经过验证的放置计划或明确的拒绝,并统一了训练-保存-合并-导出流程。

方法论框架(四大步骤)

  1. 角色感知图解析:将检测器解析为有向无环图,为每个模块分配独立的算子角色(如密集卷积、分组卷积、深度可分离卷积)和语义角色(如主干、颈部、分类头、回归头、DFL投影),使规划器能理解每个Conv2d的上下文含义。

  2. 约束解决规划:按固定顺序应用六类硬约束(算子有效性、语义安全、图接口兼容性、架构策略、预算可行性、部署兼容性)和可靠性校准。不满足约束的模块被排除并记录原因代码,最终返回ACCEPT(附计划)或REFUSE(附日志)。例如,固定的DFL投影、MoE路由器和深度可分离卷积会被自动排除。

  3. 统一运行时契约:确保四个不变量——基础检查点加载不变、适配器仅存张量与元数据、合并恢复普通YOLO模块、ONNX/TensorRT导出兼容。支持HuggingFace PEFT后端和手动Conv2d回退后端。

  4. 可选训练策略:层级学习率衰减、Alpha预热、正交正则化、动态丢弃,用于稳定优化。

核心实验结果

检测器Full-SFT (mAP50-95)规划器选择的最优PEFT提升
YOLO11s0.64280.7138 (LoRA/HRA)+0.0710/+0.0848
YOLO12s0.66620.7453 (HRA)+0.0791
RT-DETR-L0.6833REFUSE→Full-SFT避免灾难

关键发现

  • PEFT可靠性强烈依赖于架构,灾难率随注意力占比ϕattn​上升:YOLO11n为0/10,YOLO12n为6/7,RT-DETR-L为7/7。

  • 结构感知放置相比语言模型继承的排名,在YOLO11s和YOLO12s上分别额外提升+0.0659和+0.1195 mAP50-95。

  • 受控审计:LoRA降低峰值VRAM 43.9%(28.57GB→16.03GB),但训练时间增加1.72倍(118.2s→203.8s)。

主要局限性(作者明确声明)

  1. 架构覆盖有限:拒绝决策仅在校准覆盖范围内有效,未见的检测器架构上的拒绝仍是开放验证问题。

  2. 非通用安全保证:RT-DETR-L的拒绝规则基于7个观察到的崩溃校准,不能外推至所有Transformer检测器。

  3. 诊断矩阵非多种子聚合:320分辨率的热图诊断为种子0单次扫描,仅核心基线有种子{0,28,42}重跑。

  4. MoE压力测试:未验证专家感知规划,仅测试PEFT与MoE检测器共存;BOFT/OFT在产生指标前失败。

YOLO-PEFT是一个结构感知、约束驱动、可审计的检测器PEFT框架,通过图解析与硬约束过滤取代手动试错,在识别架构上显著超越Full-SFT,在风险架构上明确拒绝,但跨架构的泛化能力仍是未来工作。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

从语言模型迁移而来的通用参数高效微调(PEFT)方法在实时检测器上可能无声地失效,因为这些检测器的异构算子和检测特有组件带来了传统Transformer堆栈中不存在的放置约束。我们提出YOLO-PEFT,一个结构感知框架,将适配器放置形式化为一个可审计的约束规划问题。给定一个检测器计算图、一个PEFT请求和一个资源预算,YOLO-PEFT会分配算子和语义角色,评估显式的算子有效性、检测器语义、图接口和部署谓词,为每个被排除的模块记录一个原因代码,并要么输出一个符合预算的目标模块计划,要么在训练之前返回“拒绝”。在官方的VOC07+12 trainval 到 VOC07 test 协议下,规划器选择的RS-LoRA在YOLO11s和YOLO12s上分别达到0.7138和0.7307 mAP50-95,而全量微调(Full-SFT)分别为0.6428和0.6662。在RT-DETR-L上,所有七个评估的LoRA系列配置都越过了预定义的灾难性阈值,支持在所评估的覆盖范围内做出校准后的“拒绝-转-全量微调”决策。一项受控的YOLO11审计进一步显示,LoRA将峰值训练内存减少了43.9%,尽管训练时间增加了1.72倍。在所评估的检测器家族、放置策略和校准覆盖范围内,YOLO-PEFT用显式、可检查的规划取代了手动选择目标模块的试错过程,同时保留了经过验证的训练-保存-合并-导出路径;在未见过的检测器架构上的拒绝仍然是一个开放的验证问题。

1 引言

大规模部署实时检测器需要针对新的类别词汇表、领域、传感器、延迟目标和硬件后端进行反复适配。本研究涵盖了更广泛YOLO生态系统中的代表性成员,以及RT-DETR、YOLO-World和一个混合专家(MoE)检测器[4, 17, 25, 33]。全量微调为每个部署变体复制训练状态和完整的检查点,这使得参数高效微调(PEFT)成为降低适配和分发成本的一种有吸引力的方法[9, 11, 13]。面临的挑战是,为基本同构的Transformer堆栈开发的PEFT方法无法安全地迁移到异构的检测器计算图:现代检测器交错使用密集卷积、分组卷积和深度可分离卷积、与损失耦合的分布焦距损失(DFL)投影、可变形注意力、文本-图像融合以及MoE路由,因此不加区分地插入LoRA可能导致优化失败或严重的mAP下降。

现有解决方案存在四个空白。首先,通用的PEFT接口通过模块名称或类型来选择目标[26],而没有在训练前检查算子契约、检测语义、图接口或放置风险。其次,特定于检测器的方法,如SpotPatch、LoRA-Det和YOLO-IOD,展示了选择性适配的价值,但它们的放置策略与特定的检测器、任务或组件绑定,而不是一个能跨越卷积、Transformer、多模态和MoE计算图的通用抽象[29, 41, 47]。第三,仅靠放置策略并未提供一个端到端的训练、仅适配器检查点、合并以及ONNX/TensorRT导出的契约,使得部署兼容性依赖于特定方法的集成。第四,先前的接口没有提供校准机制来识别高风险架构-适配器组合,导致在可能发生静默故障时仍然进行训练。

本文贡献。我们提出YOLO-PEFT,一个结构感知框架,通过四个步骤弥合这些差距:

  1. 角色感知图解析:我们将检测器解析为一个有向无环图(DAG),并为每个模块分配独立的算子和语义角色,使规划器能够理解一个Conv2d层是位于主干、颈部、回归头还是固定DFL投影中。

  2. 约束解决规划:我们形式化地定义了一组约束(算子有效性、检测器语义安全、图接口兼容性、预算可行性和部署兼容性)。规划器要么输出一个经过验证的、符合预算的适配器放置计划,要么返回拒绝(REFUSE)并附带可审计的原因日志。

  3. 统一的运行时契约:我们实现了一个与YOLO兼容的运行时环境,确保训练、仅适配器检查点、合并(恢复为标准YOLO模块)以及通过ONNX/TensorRT导出的流程能够正常工作,从而消除了手动图修补的需要。

  4. 校准后的拒绝与训练策略:我们集成了一个可靠性校准模块,用于在风险过高时触发拒绝。同时,我们提供了可选的训练策略(如层级学习率衰减、Alpha预热、正交正则化和动态丢弃)来稳定优化过程。

图1. 系统概览。该流程 (1) 将检测器从受支持的、已评估的家族解析为角色感知的类型化计算图;(2) 过滤不安全的适配目标,选择PEFT方法,并通过预算感知的秩分配 ∑ici(ri)≤B 来解决适配器放置问题 ππ,或在校准覆盖范围内,返回“拒绝”并提供全量微调(Full-SFT)备用方案;(3) 在冻结基础权重 (W=W0+ΔW(π)) 的情况下训练侧边适配器,并保存仅含适配器的检查点及其运行时清单;(4) 可选择将适配器合并回普通的YOLO模型,并将结果模型通过ONNX/TensorRT导出,用于边缘、服务器或移动端部署。

2 相关工作

2.1 通用参数高效微调

PEFT方法最初为语言模型开发[13, 23],现已扩展到视觉领域。视觉提示调优[14]、适配器[30]、缩放与平移特征[21]以及低秩适配(LoRA)[13]构成了主流范式。针对视觉Transformer(ViT)的后续工作包括AdaptFormer[2]、Pro-Tuning[28]、SCT[48]、Conv-Adapter[1]和Convolutional Bypasses[15],它们主要关注ViT主干。VFM-Adapter[3]和VMT-Adapter[38]为密集预测任务引入了适配器,而E³VA[43]指出,仅凭少量可训练参数并不能保证低训练内存或时间,并为基于Swin的密集预测构建了独立的梯度高速通道。一篇相关的预印本使用了并行的多任务适配器用于伪装目标分割[39]。这些文献表明,适配器结构、任务和系统成本都很重要,但大多假设使用选定的主干和头部,而不是验证异构检测器全局的目标计划。

2.2 视觉-语言与开放词汇适配

VL-Adapter为视觉-语言模型的参数高效适配提供了基准[31],为多模态适配奠定了基础。在开放词汇检测中,SIA-OVD学习形状特定的区域适配器及其分配,以减少CLIP图像-区域差距[35],而模块化PEFT研究开放词汇检测器中特定任务的组件调优[6]。PET-DINO[7]统一了Grounding DINO中的视觉线索以进行视觉提示检测。这些方法表明,插入和分配应反映区域或模态语义。但它们针对的是固定的视觉-语言流程,而YOLO-PEFT额外考虑了卷积分组、多尺度颈部接口、与损失耦合的头部组件、专家路由和导出时合并等因素。

2.3 检测器的参数高效适配

已有若干研究直接适配目标检测器。SpotPatch为MobileNetV2-SSD-FPNLite层学习数据集特定的门控,并在十个检测任务中存储选定的1-bit残差[41]。LoRA-Det分析了一个基于Swin的旋转检测器的秩,并手动将LoRA与FPN、RPN和预测组件的全量调优相结合[29],而多点位置插入调优则将轻量级模块放置在冻结的小目标检测器的几个位置[8]。DA-Ada为无监督领域自适应检测学习领域感知适配器[18];CUoRA针对少样本源域自由适配[40];CoPEFT则将协作适配器与代理提示结合,用于低成本协作感知适配[36]。与本文最直接相关的是,YOLO-IOD通过选择任务重要的卷积核,对YOLO-World进行分阶段的PEFT以用于增量检测[47];SF-YOLO则通过教师-学生源域自由方案适配YOLO[34]。因此,先前的检测器工作已经研究了层、插入点、组件和核的选择。然而,它们并未提供一个通用的、在训练前检查算子约束、检测语义、图接口以及跨异构检测器家族的导出行为的可行性检查。

2.4 异构实时检测器

现代的实时检测器混合了多种执行范式:RT-DETR增加了Transformer解码器[25],YOLO-World增加了文本-图像融合[4],YOLOv12引入了以注意力为中心的计算块[33],而YOLO-Master[22]则体现了稀疏专家路由。它们的头部包含与损失耦合的组件,例如分布式边界框回归[20]。这种异构性构成了YOLO-PEFT的研究范围:它并不是提出另一种适配器参数化方法,而是验证现有的适配器方法,并将其纳入一个共同的训练-保存-合并-导出契约中,同时保留检测器特定的接口。

3 方法

所评估的检测器家族包含异构算子和任务特定的密集头部,因此不能仅通过匹配模块名称来迁移语言模型的PEFT规则。YOLO-PEFT将适配器放置视为一个受限决策问题:给定一个检测器计算图、一个PEFT请求和一个参数预算,它返回一个结构有效、可训练且可部署的计划,或者在实现规则和校准覆盖范围内没有可行计划时拒绝该请求。该流程分为四个阶段:解析检测器、解决约束有效放置、将计划落实到YOLO运行时、以及应用兼容的训练策略。完整的伪代码和实现细节在补充材料中提供。

3.1 问题形式化与检测器表示

表1. PEFT在YOLO上的测量矩阵。W&B导出基于官方VOC2007测试集(遗留日志别名:val2007);基线是相同主干的Full-SFT运行。“rs”表示RS-LoRA缩放;粗体值表示达到或超过Full-SFT。显示的是种子0的结果;在种子 {0,28,42} 上对选定的核心运行进行重跑,样本标准差 SD≤0.006mAP50:95 且排名不变。RT-DETR-L的拒绝行记录了一个范围内的规划器保护措施:所有七个扫描的LoRA系列配置都低于 Δ=−0.05,因此规划器发出REFUSE而非适配器;这不是一个未见过架构的测试。

一个模块的Python类型不足以判断它是否是一个安全的目标:同一个Conv2d可能属于主干块、特征金字塔融合层、回归头或固定的DFL投影。因此,GRAPH PARSER(图解析器)为每个模块分配两个独立的角色。算子角色捕获其计算契约。密集卷积允许使用普通的低秩因子,分组卷积需要组内局部因子,而深度可分离卷积不能接受混合通道的更新。归一化、激活和未知算子被保守地处理。语义角色捕获检测器特定的含义。固定的DFL投影、几何敏感的回归路径和MoE路由器被排除,因为即使它们的张量形状保持有效,微小的更新也可能改变校准后的区间或专家分配。

角色分配结合了图位置和检测器惯用结构。解析器识别YOLO12的区域注意力(Area-Attention)块、RT-DETR的可变形注意力模块、YOLO-World的文本融合以及MoE路由/专家结构。已知家族接收经过校准的角色配置文件,而自定义检测器则回退到拓扑扫描;不匹配的模块被分配一个未知角色且不会被适配。这个默认设置使得不受支持的结构变得明确,而不是悄然扩大目标集合。

3.2 约束解决的放置与安全性

给定角色感知的计算图,PLANNER(规划器)按固定顺序解决放置问题:过滤算子、过滤语义、应用架构策略、分配秩,然后验证可靠性。有效性优先于效率,因为在结构不安全的层上优化秩分配无法产生可部署的计划。

表2. 形式化约束接口。每行指定所消耗的信息、确定性接受规则、规划器输出以及规则失败时返回的原因。可靠性校准仅在硬约束之后进行评估。

端到端示例:YOLO12s。考虑一个在所有卷积和线性模块上应用秩16的RS-LoRA的请求。解析器首先将模型扩展为骨干、颈部和解耦头节点,并附加算子/语义角色。基于原始名称的请求包括普通的 3×3 卷积、深度可分离卷积、区域注意力内部组件、分类和回归分支以及DFL投影。算子过滤移除缺乏通道保持适配器的深度可分离卷积主机(E-DEPTHWISE-MIX);语义过滤移除*.dfl.*和几何敏感的回归节点(E-DFL-FIXED/E-HEAD-GEOMETRY);YOLO12策略在所评估的配置文件下移除attn.{qkv,proj,pe}和内部的区域注意力MLP卷积。图接口检查保留形状保持的骨干/颈部主机。然后,预算求解器将 r=16r=16 分配给幸存的密集卷积目标,直到满足预算 BB。发出的目标列表是那些幸存的骨干/颈部卷积的完全限定名称,并附有被排除模块的名称/原因映射和实际参数成本。因此,最终的目标集合是由图角色和约束生成的,而非隐藏的手动列表;更改用户范围 LL 或预算 BB 只会改变最终的交集和秩分配,而绝不会改变强制性的排除项。

预算秩分配。过滤之后,规划器通过下式分配秩

3.3 YOLO兼容的运行时与导出契约

一个在数值上有前景的放置方案如果破坏了训练或导出流程,也是无用的。因此,契约(Contract)将每个 (i,r) 实例化的同时保持四个不变量:(I1) 基础检查点加载保持不变;(I2) 适配器检查点仅存储适配器张量和运行时元数据;(I3) 合并后恢复为普通的YOLO模块;(I4) ONNX和TensorRT导出器看到的是导出兼容的计算图。

运行时通过两个后端家族暴露一个接口。HuggingFace PEFT 处理 LoRA, RS-LoRA, DoRA, LoHa, LoKr, AdaLoRA, IA³, OFT, BOFT 和 HRA。当 PEFT 不可用或被显式绕过时,一个更精简的代码库内后端提供普通的卷积 LoRA。两条路径共享相同的已解析目标集合和生命周期:在优化器构建前安装,在冻结基础权重的情况下训练,保存仅适配器状态,将其加载到兼容的基础检测器上,合并,移除包装器,然后导出。在适配器未合并时禁用卷积融合,因为过早融合会使其宿主模块失效。

3.4 训练策略

4 实验

4.1 实现细节

我们遵循官方的Ultralytics VOC配置[5, 16]:VOC2007 trainval (5,011) ∪ VOC2012 trainval (11,540) 构成16,551张图像的训练集,官方的VOC2007测试集包含4,952张图像。YAML键val解析为images/test2007;W&B的历史记录val2007字符串只是一个别名,并非训练中使用的VOC2007验证目录。年份前缀的ID交集为零(补充表17)。研究涵盖CNN检测器(YOLOv8/YOLO11)、注意力增强的YOLO12、文本融合的YOLO-World以及基于Transformer的RT-DETR-L。基于W&B的核心s-scale运行使用600周期上限和 640×640 输入;更广泛的14变体 × 5架构诊断扫描使用300周期和 320×320 输入。所有s-scale消融均使用核心协议;每次运行的日志保留实际停止周期和批量大小。对于核心运行,Ultralytics的optimizer=auto解析为SGD,初始学习率0.01,动量0.9;权重衰减为 5×10−4,启用余弦调度,Mosaic在最后十个周期关闭。除非另有说明,PEFT使用 r=16,α=32,丢弃率0.05,并启用RS-LoRA缩放。实验在一致的多加速器训练环境中使用分布式数据并行训练。Full-SFT、标准LoRA、Planner-LoRA、最佳PEFT和朴素放置方案在种子 {0,28,42} 上进行了评估。它们内部配置的最大标准差 ≤0.006mAP50:95​;所有方向和排名均未改变。表1显示了完整的种子0矩阵;重跑是稳健性检查,而非配对显著性检验。所有比较的核心方法共享相同的评估节奏、早停耐心值(100)和最佳检查点规则,因此早停不会带来方法特定的优势。我们将分数解释为受控的相对比较,而非一次性的盲测估计。

4.2 架构条件行为分析

宏观稳定性映射。如图3和补充表7所示,PEFT的可靠性在五个评估的检测器家族中与架构强耦合,而非遵循一个共同的排名。灾难率定义为mAP下降 Δ<−0.05,通常随注意力比率 ϕattn​ 上升。具体来说,在评估的纯CNN YOLO11n配置上,标准变体在十次运行中零崩溃,而YOLO12n的崩溃率为 6/7,RT-DETR-L为 7/7。补充表8中的成对Kendall-ττ 分析同样显示,在评估的家族中,等级相关性减弱或逆转;这并非针对每个YOLO家族模型的证据。

机制性失败分析。我们观察到,现有假设同质Transformer块的PEFT接口在多个层面违反了实时检测器的结构约束。在多模态架构(如YOLO-World)中,图像和文本分支的梯度范数可能相差数个数量级。

4.3 与替代范式的比较

与LM继承排名的比较。在表3中,我们将结构感知的计划与朴素的语言模型PEFT放置进行对比。显示的YOLO11s/YOLO12s值是种子0的核心快照;在种子 {0,28,42} 上,样本标准差 ≤0.006mAP50:95​ 且排名保持不变。在所评估的RT-DETR-L配置上,校准后的规划器回退到Full-SFT,而不是返回低于灾难阈值的适配器。

与全量微调(Full-SFT)的比较。在中规模目标数据集上更新所有参数可能会过度适应预训练表示,而冻结大部分检测器并将更新限制在低秩子空间可以充当隐式正则化器。在完整的VOC trainval划分上,最强的YOLO12s配置(HRA)达到 0.7453mAP50−95​,而Full-SFT为 0.6662,在种子0核心快照中提升了 +7.9 个点。种子28和42在审计的SD范围内(≤0.006)保持了这一方向,因此该观察结果不被解释为少样本结果。

MoE压力测试。表4报告了提供的YOLO-Master-EsMoE-S W&B导出结果。所有行均使用VOC、640x640 输入、批量128、600周期上限、相同的分布式训练环境、种子0,并禁用规划器、注意力、头部、路由器和专家目标选择。因此,这些运行测试的是仅限于普通合格主机的PEFT是否能与MoE检测器共存;它们并未验证专家感知的规划。HRA是完成的最佳配置,达到 0.7454mAP50:95,而记录的Full-SFT值为 0.6891。BOFT和OFT在产生指标之前失败,而所有六个产生指标的PEFT运行均完成。

这些数据扩展了评估的架构集合,但并未扩展数据集或种子覆盖范围。它们无法支持关于COCO、领域迁移、少样本学习或方差的主张。它们也说明了为什么规划器需要能力检查:两种配置消耗了设置时间但从未进入评估阶段,而已完成的方法在运行时间上存在显著差异。

表4. 种子0的YOLO-Master-ESMoE-S压力测试(来自提供的W&B导出)。规划器和MoE/注意力/头部目标选择被禁用。失败表示未报告评估指标;记录的Full-SFT运行报告了最终指标,尽管其W&B状态已崩溃。运行时间是来自导出的挂钟小时数。

分解部署经济学。在我们受控的YOLO11审计中,LoRA使用16.03 GB对比28.57 GB(减少43.9%),但耗时203.8秒对比118.2秒(1.72倍更长);其他PEFT变体也更慢。此审计是本文主要的效率声明;有意排除了外部报告的存储数据。RT-DETR-L的Full-SFT回退方案被排除在所有PEFT聚合之外;详细的核算范围见补充部署审计。

权衡的解释。审计区分了两个常被混淆的资源。相对于Full-SFT,适配器运行减少了12.54 GB的峰值训练内存,但在相同的受控配置下增加了85.6秒的训练时间。因此,内存减少伴随着优化时间的成本,而非构成一个普遍的速度提升。部署有一个独立的选择:未合并的适配器有助于检查点交换,而合并模型在导出前移除了适配器分支,恢复了基础模型的算子路径(补充表6)。因此,我们分别报告VRAM、挂钟时间以及合并/未合并行为,并将 REFUSE → Full-SFT 视为适配器风险过高时的有效结果。

4.4 消融研究

规划器约束的有效性。我们在YOLO12s上分离了各个规划器组件对性能的贡献。如补充表11详述,无约束的朴素基线达到0.6900 mAP50-95。引入算子有效性过滤以排除深度可分离卷积和归一化层,将准确率提升至0.7094。结合检测头语义排除带来了最大的稳定性提升,将性能推至0.7307 mAP,这支持语义保护是稳定性驱动因素,而不仅仅是工程安全措施。

谓词级诊断。表5将可应用的约束与仅存在于规则集中的约束区分开来。在YOLO12s上,开放注意力流规则接纳了32个模块,并使平均适配器梯度范数提高了1.581倍;开放类型化头部规则接纳了18个模块,提高了1.091倍。两次短期运行均未产生非有限梯度,因此证据支持的是优化压力的改变,而非必然的崩溃。相反,深度可分离卷积谓词在任一审计图上均未接纳额外的秩-4目标,因此在此不能归因于训练效果。单个DFL投影、12个可变形采样/注意力权重层和28个RT-DETR分数/边界框输出层仍然是反事实候选:它们的固定区间、采样几何或输出偏置语义使得直接插入成为一个不同的干预措施,而非普通的留一法开关。

安全放置下的下游解码器漂移。我们将一个RT-DETR-L VOC检查点与激活的安全适配器状态和适配器参数置零的同一检查点进行比较。通过支持的预测器路径,16张固定的VOC2007图像产生有限的 300×6300×6 输出。解码器模块中的相对 ℓ2ℓ2​ 漂移为 0.553±0.099,MSDeformAttn 中为 0.530±0.103,边界框头中为 0.613±0.100,分数头中为 0.127±0.033;最终输出漂移为 0.548±0.094(中位数0.571,P90 0.611)。因此,安全的上游适配会传播到冻结的解码器,但这些16张图像、1% 训练量的诊断并不能验证不安全的解码器插入。

图4. 论文测量的受控YOLO11系统审计。相对于Full-SFT,LoRA将峰值VRAM从28.57 GB降至16.03 GB(43.9%),但训练时间从118.2秒增至203.8秒(1.72倍);所有显示的PEFT变体都比Full-SFT慢。

表6. 受控YOLO11s和YOLO12s检查点的MPS部署审计

A 部署与导出审计

以下图表和冒烟测试表记录了七页主论文中省略的受控部署审计和合并/未合并导出检查。

ONNX/TensorRT 验证协议。未合并和合并的计算图均在 opset 18 下通过了 ONNX 检查器验证,支持静态形状 [1, 3, 640, 640] 以及动态批次、高度和宽度轴;ONNX Runtime CPU 执行显示相对于 PyTorch 的最大绝对误差低于 1.24×10−3。TensorRT 引擎在 FP32 和 FP16 下构建并执行,使用动态优化配置,验证了数值一致性、内存、吞吐量和延迟。

B 回退手动 Conv2d 后端的合并等价性

B.1 作为 im2col 矩阵乘法的密集卷积

B.2 分组卷积和每组秩分配

B.3 命题1的证明

B.4 数值容差与实现说明

上述证明涵盖了普通的回退 Conv2d LoRA 路径。RS-LoRA 和 PEFT 管理的变体委托给 PEFT 运行时;少样本和自适应回退变体需要在应用相同的合并模式之前解析秩掩码。合并和未合并路径仅在操作顺序上有所不同(展开 + 批量矩阵乘法 对比 在合并权重上的单次卷积);输出在标准浮点容差内被视为等价。合并正确性在包装器移除后进行验证,而非之前。等价性在部署/评估模式下成立,此时适配器丢弃被禁用。

C 后端路由与 PEFT 管理变体

C.1 后端选择规则

PEFT 后端是 LoRA、RS-LoRA、DoRA、LoHa、LoKr、AdaLoRA、IA³、OFT、BOFT 和 HRA 的默认路由。回退手动后端有意设计得更为狭窄:它仅在 PEFT 不可用、被显式绕过或请求回退路径时,用于普通的 Conv2d LoRA 包装。量化路径委托给 PEFT 后端,因为量化集成是后端特定的。

C.2 量化与包装必需的路径

需要包装的训练状态不被视为导出兼容的产物。如果包装器无法合并为普通的 YOLO 模块,或由 PEFT 管理的导出路径处理,契约层将拒绝导出。

C.3 导出策略

仅当结果模型满足方法中声明的运行时不变量时,才允许导出:基础检查点加载不变、仅适配器检查点、合并后的普通 YOLO 模块结构,以及 ONNX/TensorRT 工具链的导出兼容模块。PEFT 管理的适配器仅在 PEFT 合并路径成功,或契约验证了等效的非包装模块结构后,才被视为导出兼容。

D 运行时元数据模式

D.1 JSON 字段

当前实现持久化运行时元数据,而非完整的加密清单。PEFT 路径将runtime_metadata.json与 PEFT 的save_pretrained产物一起写入;回退路径写入fallback_meta.json和回退权重文件。记录的字段包括后端、变体、冻结BN设置、头部包含设置、目标模块以及后端特定的运行时元数据。

D.2 兼容性检查

在加载时,YOLO-PEFT 使用此元数据来选择 PEFT 或回退加载器,并验证请求的后端和目标配置与保存的适配器一致。完整的基础检查点、模型YAML、类别名称和架构哈希检查是部署时的扩展,而非当前硬性检查要求。

表S2. 图2的数值对比。结果来自320分辨率的诊断矩阵。Full-SFT行报告基准 mAP@0.5:0.95;所有其他行报告 Δ。红色条目为灾难性 (Δ<−0.05)。对于崩溃的RT-DETR-L运行,Δ=−0.600 表示用于可视化的截断失败值。此整个矩阵是种子0的诊断扫描;它不是多种子聚合。主文中报告的种子28/42重跑是作为核心基线和选定规划器配置的稳健性检查。

表8. ΔmAP 排名的成对 Kendall's ττ。CNN内部对(YOLOv8n vs. YOLO11n)是唯一 p<0.05 的对;所有其他对 p>0.3。

D.3 失败模式

元数据检查可防止后端/路径混淆和回退权重缺失。更强的图、类别词汇表和导出运行时不匹配检查需要前文所述的完整部署时清单扩展。

E PEFT 矩阵详情

完整的核心W&B测量矩阵在主文表1中报告。为避免重复该表,本附录提供图2的数值对应物和成对等级一致性诊断。

E.1 图2的数值对应物

表S2报告了对应于热图的紧凑 ΔmAP 视图。它将Full-SFT基准与PEFT增量分开,并标记了灾难性单元格。

E.2 成对等级一致性

表S3量化了补充缩放规律图中可见的排名反转模式。CNN内部比较是唯一强正相关的对;跨越到注意力密集、文本融合或Transformer解码器检测器时,变体排名会减弱或逆转。

表S4. 主文架构覆盖讨论背后的检测器家族覆盖范围。CNN主干共享报告的LoRA+衰减接受区间;非CNN行保留主文中显式的状态。表10. 消融A1:朴素替换与契约管理替换(LoRA r=16,RS-LoRA,YOLO11s on VOC,核心600周期上限/640分辨率协议)

F 完整的检测器家族覆盖表

主文在其架构覆盖讨论中报告了聚合的检测器家族覆盖率。表S4列举了支撑该聚合的十一个主干,并未添加超出报告家族状态的每个主干测量结果。

F.1 完整的检测器家族覆盖

此处单独列出了密切相关的CNN家族检测器,而主文将其报告为单一架构类。所有CNN家族行共享报告的LoRA+衰减接受区间。

G 详细消融研究

G.1 A1. 朴素替换 vs. 契约管理替换

YOLO-PEFT 中的两个后端都使用模块替换(B2 的手动 Conv2d 后端,B1 的 PEFT 管理包装器);问题是周围的契约管理是否对部署兼容性必不可少。表S5比较了朴素基线与完整契约层。ONNX/TRT/Ckpt 表示训练后的模型是否可以保存、重新加载、合并和导出,而无需手动图手术。

G.2 A2. 规划器组件消融

表S6在YOLO12s上对规划器的每个约束进行了消融。该序列依次分离了算子有效性、检测头语义过滤和预算剪枝的贡献。

预算匹配选择器诊断。作为一项独立的工程检查,我们在相同的秩-4适配器预算(31,104个参数)下比较了四种目标选择规则。每次运行在相同的 2% VOC07+12 子集上使用一个周期,以及固定的160张图像验证子集;种子为0、28和42。表12报告了三次运行的总均值和标准差。此协议检查预算核算和可执行目标选择,但其短周期并非核心训练协议,不得解释为性能排名。

表11. 消融A2:YOLO12s上的规划器约束,VOC,LoRA r=16,α=32,RS-LoRA启用,核心600周期上限/640分辨率协议表12. 预算匹配的YOLO12s选择器MPS诊断。所有行使用31,104个适配器参数;由于模块形状不同,目标数量可能不同。数值为三个种子的均值 ± 总体标准差。

表13. 消融A3:YOLO12s上的秩敏感性,VOC,核心600周期上限/640分辨率协议。基准(Full-SFT):0.6662 mAP50:95,9.26M总参数。参数量列包括冻结的基础模型;推理GFLOPs在合并后测量。表14. 消融A4:规划器选择放置下的变体扫描,r=16,α=32,RS-LoRA启用,官方VOC2007测试集,核心600周期上限/640分辨率协议

四个 mAP50:95 均值相差在0.0034以内,而其标准差在0.0093-0.0267之间。此外,梯度 top-k 在种子0时领先,而 backbone-only 在种子28和42时领先。因此,该诊断未提供在此周期内宣布普遍更优选择器的证据;主协议比较需要更长的训练,并应保留相同的预算和多种子控制。

G.3 A3. 秩敏感性

此消融测试规划器的默认秩是否是一个脆弱的选定值。扫描显示随秩增加呈单调增益,同时确认 r=16 是一个实用的总参数权衡点。

G.4 A4. 固定放置下的变体扫描

此消融固定规划器放置,仅改变局部的PEFT更新规则。在YOLO11s和YOLO12s上的排名变化支持了架构条件变体选择的主张。

G.5 A5. RS-LoRA 和 DoRA 交互作用

此双因素消融检查训练崩溃是由变体标签本身引起的,还是由交互的训练侧先验引起的。只有无RS-LoRA的DoRA角落越过了灾难阈值。

表15. 消融A5:YOLO12s上的RS-LoRA × DoRA 2×2 因子设计,VOC,LoRA r=16,α=32,核心600周期上限/640分辨率协议

G.6 A7. LM继承排名 vs. 结构感知放置

此消融直接测试从语言模型继承的PEFT排名是否迁移到异构检测器。结构感知计划使用相同的主干和训练预算,但从检测器计算图中选择变体和目标。

表16. 消融A7:LM继承排名与结构感知计划。数字来自W&B在官方VOC2007测试集上的导出,r=16,α=32,核心600周期上限/640分辨率协议。增益是相同主干上结构感知计划与LM继承计划之间的差异。

崩溃计数来自独立的300周期/320分辨率诊断矩阵,并激发了范围内的保护措施;它不是一个独立的未见过架构结果。

H 复现说明

实验使用官方的 Ultralytics VOC 映射:训练 YAML 键包含images/train2007images/val2007images/train2012images/val2012,而两个评估键均解析为images/test2007。因此,历史记录中的 W&B 字段val2007是 VOC2007 测试集评估的别名,而非训练中包含的 VOC2007 验证目录。报告的核心结果中未使用随机或少样本划分。核心 W&B 运行将图像调整为 640;扩展诊断矩阵使用 320;核心 W&B 运行使用 600 周期上限,而诊断矩阵使用 300 周期,除非另有说明。对于核心 W&B 运行,optimizer-auto解析为 SGD,初始学习率 0.01,动量 0.9;权重衰减为 5×10−4,启用余弦调度,Mosaic 在最后十个周期关闭,早停耐心值为 100。每种方法均以相同的节奏进行评估,且相同的最佳检查点规则提供报告的分数。因此,早停不会带来方法特定的选择优势:它是共享的官方训练协议的一部分。由于 VOC2007 测试集参与此通用的检查点选择协议,我们使用它来支持受控的相对比较,并不将绝对分数呈现为一次性的盲测估计。此模型选择问题与训练数据泄漏不同;表17验证了训练/评估图像ID交集为零。除非明确扫描,适配器使用秩16、α=32、丢弃率0.05、启用RS-LoRA缩放,并禁用DoRA的幅度分支。运行使用一致的加速器启用训练环境和固定软件栈;导出的W&B表格包括主干、变体、秩、alpha、缩放模式、可训练参数、mAP、内存和适配器大小字段。Full-SFT、标准LoRA、Planner-LoRA、最佳PEFT和朴素放置除了种子0外,还有种子28和42的重跑。主文保留种子0以紧凑地呈现完整矩阵;每次运行的日志保留相应的三种子记录。所有上述s-scale规划器、秩、变体和训练先验消融均使用核心600周期上限/640分辨率协议。秩8是未校准的YOLO12请求的保守回退,而显式的 r∈{8,16,32} 扫描则在已识别的YOLO12配置文件上评估预算批准的秩。

表17. VOC划分审计。ID直接从官方的ImageSets/Main/*.txt文件中获取,并在每个ID前加上其来源年份后进行比对。表18. 选定核心比较的三种子稳健性审计。统计量在种子 {0,28,42} 上的每个配置内计算;它是稳健性摘要,非显著性测试。

MPS部署审计存储在artifacts/deployment_mps_v2/下的JSON文件中;它记录了合并和未合并的参数计数、GFLOPs、同步延迟、吞吐量、分配器遥测、ONNX opset/形状/误差检查,以及加速器-主机TensorRT引擎验证记录。

效率核算范围。本文仅报告受控的YOLO11审计:LoRA相对于Full-SFT,峰值VRAM降低了 43.9%43.9%(16.03 GB 对比 28.57 GB),但训练时间长了 1.72×(203.8秒 对比 118.2秒)。外部存储、分发和外部来源的内存估计被排除在声明之外。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询