YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family——面向异构实时检测器的结构感知参数高效微调框架

📅 发布时间:2026/8/20 23:13:46
YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family——面向异构实时检测器的结构感知参数高效微调框架
核心问题从语言模型迁移而来的通用PEFT方法如LoRA在异构的实时目标检测器上可能静默失效因为检测器中包含卷积、注意力、文本融合、MoE路由等多种异构算子而现有PEFT接口仅通过模块名称匹配来放置适配器缺乏对算子契约、检测语义和部署兼容性的预训练检查。主要贡献YOLO-PEFT提出了一个结构感知框架将适配器放置形式化为可审计的约束规划问题在训练前返回经过验证的放置计划或明确的拒绝并统一了训练-保存-合并-导出流程。方法论框架四大步骤角色感知图解析将检测器解析为有向无环图为每个模块分配独立的算子角色如密集卷积、分组卷积、深度可分离卷积和语义角色如主干、颈部、分类头、回归头、DFL投影使规划器能理解每个Conv2d的上下文含义。约束解决规划按固定顺序应用六类硬约束算子有效性、语义安全、图接口兼容性、架构策略、预算可行性、部署兼容性和可靠性校准。不满足约束的模块被排除并记录原因代码最终返回ACCEPT附计划或REFUSE附日志。例如固定的DFL投影、MoE路由器和深度可分离卷积会被自动排除。统一运行时契约确保四个不变量——基础检查点加载不变、适配器仅存张量与元数据、合并恢复普通YOLO模块、ONNX/TensorRT导出兼容。支持HuggingFace PEFT后端和手动Conv2d回退后端。可选训练策略层级学习率衰减、Alpha预热、正交正则化、动态丢弃用于稳定优化。核心实验结果检测器Full-SFT (mAP50-95)规划器选择的最优PEFT提升YOLO11s0.64280.7138 (LoRA/HRA)0.0710/0.0848YOLO12s0.66620.7453 (HRA)0.0791RT-DETR-L0.6833REFUSE→Full-SFT避免灾难关键发现PEFT可靠性强烈依赖于架构灾难率随注意力占比ϕattn​上升YOLO11n为0/10YOLO12n为6/7RT-DETR-L为7/7。结构感知放置相比语言模型继承的排名在YOLO11s和YOLO12s上分别额外提升0.0659和0.1195 mAP50-95。受控审计LoRA降低峰值VRAM 43.9%28.57GB→16.03GB但训练时间增加1.72倍118.2s→203.8s。主要局限性作者明确声明架构覆盖有限拒绝决策仅在校准覆盖范围内有效未见的检测器架构上的拒绝仍是开放验证问题。非通用安全保证RT-DETR-L的拒绝规则基于7个观察到的崩溃校准不能外推至所有Transformer检测器。诊断矩阵非多种子聚合320分辨率的热图诊断为种子0单次扫描仅核心基线有种子{0,28,42}重跑。MoE压力测试未验证专家感知规划仅测试PEFT与MoE检测器共存BOFT/OFT在产生指标前失败。YOLO-PEFT是一个结构感知、约束驱动、可审计的检测器PEFT框架通过图解析与硬约束过滤取代手动试错在识别架构上显著超越Full-SFT在风险架构上明确拒绝但跨架构的泛化能力仍是未来工作。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示从语言模型迁移而来的通用参数高效微调PEFT方法在实时检测器上可能无声地失效因为这些检测器的异构算子和检测特有组件带来了传统Transformer堆栈中不存在的放置约束。我们提出YOLO-PEFT一个结构感知框架将适配器放置形式化为一个可审计的约束规划问题。给定一个检测器计算图、一个PEFT请求和一个资源预算YOLO-PEFT会分配算子和语义角色评估显式的算子有效性、检测器语义、图接口和部署谓词为每个被排除的模块记录一个原因代码并要么输出一个符合预算的目标模块计划要么在训练之前返回“拒绝”。在官方的VOC0712 trainval 到 VOC07 test 协议下规划器选择的RS-LoRA在YOLO11s和YOLO12s上分别达到0.7138和0.7307 mAP50-95而全量微调Full-SFT分别为0.6428和0.6662。在RT-DETR-L上所有七个评估的LoRA系列配置都越过了预定义的灾难性阈值支持在所评估的覆盖范围内做出校准后的“拒绝-转-全量微调”决策。一项受控的YOLO11审计进一步显示LoRA将峰值训练内存减少了43.9%尽管训练时间增加了1.72倍。在所评估的检测器家族、放置策略和校准覆盖范围内YOLO-PEFT用显式、可检查的规划取代了手动选择目标模块的试错过程同时保留了经过验证的训练-保存-合并-导出路径在未见过的检测器架构上的拒绝仍然是一个开放的验证问题。1 引言大规模部署实时检测器需要针对新的类别词汇表、领域、传感器、延迟目标和硬件后端进行反复适配。本研究涵盖了更广泛YOLO生态系统中的代表性成员以及RT-DETR、YOLO-World和一个混合专家MoE检测器[4, 17, 25, 33]。全量微调为每个部署变体复制训练状态和完整的检查点这使得参数高效微调PEFT成为降低适配和分发成本的一种有吸引力的方法[9, 11, 13]。面临的挑战是为基本同构的Transformer堆栈开发的PEFT方法无法安全地迁移到异构的检测器计算图现代检测器交错使用密集卷积、分组卷积和深度可分离卷积、与损失耦合的分布焦距损失DFL投影、可变形注意力、文本-图像融合以及MoE路由因此不加区分地插入LoRA可能导致优化失败或严重的mAP下降。现有解决方案存在四个空白。首先通用的PEFT接口通过模块名称或类型来选择目标[26]而没有在训练前检查算子契约、检测语义、图接口或放置风险。其次特定于检测器的方法如SpotPatch、LoRA-Det和YOLO-IOD展示了选择性适配的价值但它们的放置策略与特定的检测器、任务或组件绑定而不是一个能跨越卷积、Transformer、多模态和MoE计算图的通用抽象[29, 41, 47]。第三仅靠放置策略并未提供一个端到端的训练、仅适配器检查点、合并以及ONNX/TensorRT导出的契约使得部署兼容性依赖于特定方法的集成。第四先前的接口没有提供校准机制来识别高风险架构-适配器组合导致在可能发生静默故障时仍然进行训练。本文贡献。我们提出YOLO-PEFT一个结构感知框架通过四个步骤弥合这些差距角色感知图解析我们将检测器解析为一个有向无环图DAG并为每个模块分配独立的算子和语义角色使规划器能够理解一个Conv2d层是位于主干、颈部、回归头还是固定DFL投影中。约束解决规划我们形式化地定义了一组约束算子有效性、检测器语义安全、图接口兼容性、预算可行性和部署兼容性。规划器要么输出一个经过验证的、符合预算的适配器放置计划要么返回拒绝REFUSE并附带可审计的原因日志。统一的运行时契约我们实现了一个与YOLO兼容的运行时环境确保训练、仅适配器检查点、合并恢复为标准YOLO模块以及通过ONNX/TensorRT导出的流程能够正常工作从而消除了手动图修补的需要。校准后的拒绝与训练策略我们集成了一个可靠性校准模块用于在风险过高时触发拒绝。同时我们提供了可选的训练策略如层级学习率衰减、Alpha预热、正交正则化和动态丢弃来稳定优化过程。图1. 系统概览。该流程 (1) 将检测器从受支持的、已评估的家族解析为角色感知的类型化计算图(2) 过滤不安全的适配目标选择PEFT方法并通过预算感知的秩分配 ∑ici(ri)≤B 来解决适配器放置问题 ππ或在校准覆盖范围内返回“拒绝”并提供全量微调Full-SFT备用方案(3) 在冻结基础权重 (WW0ΔW(π)) 的情况下训练侧边适配器并保存仅含适配器的检查点及其运行时清单(4) 可选择将适配器合并回普通的YOLO模型并将结果模型通过ONNX/TensorRT导出用于边缘、服务器或移动端部署。2 相关工作2.1 通用参数高效微调PEFT方法最初为语言模型开发[13, 23]现已扩展到视觉领域。视觉提示调优[14]、适配器[30]、缩放与平移特征[21]以及低秩适配LoRA[13]构成了主流范式。针对视觉TransformerViT的后续工作包括AdaptFormer[2]、Pro-Tuning[28]、SCT[48]、Conv-Adapter[1]和Convolutional Bypasses[15]它们主要关注ViT主干。VFM-Adapter[3]和VMT-Adapter[38]为密集预测任务引入了适配器而E³VA[43]指出仅凭少量可训练参数并不能保证低训练内存或时间并为基于Swin的密集预测构建了独立的梯度高速通道。一篇相关的预印本使用了并行的多任务适配器用于伪装目标分割[39]。这些文献表明适配器结构、任务和系统成本都很重要但大多假设使用选定的主干和头部而不是验证异构检测器全局的目标计划。2.2 视觉-语言与开放词汇适配VL-Adapter为视觉-语言模型的参数高效适配提供了基准[31]为多模态适配奠定了基础。在开放词汇检测中SIA-OVD学习形状特定的区域适配器及其分配以减少CLIP图像-区域差距[35]而模块化PEFT研究开放词汇检测器中特定任务的组件调优[6]。PET-DINO[7]统一了Grounding DINO中的视觉线索以进行视觉提示检测。这些方法表明插入和分配应反映区域或模态语义。但它们针对的是固定的视觉-语言流程而YOLO-PEFT额外考虑了卷积分组、多尺度颈部接口、与损失耦合的头部组件、专家路由和导出时合并等因素。2.3 检测器的参数高效适配已有若干研究直接适配目标检测器。SpotPatch为MobileNetV2-SSD-FPNLite层学习数据集特定的门控并在十个检测任务中存储选定的1-bit残差[41]。LoRA-Det分析了一个基于Swin的旋转检测器的秩并手动将LoRA与FPN、RPN和预测组件的全量调优相结合[29]而多点位置插入调优则将轻量级模块放置在冻结的小目标检测器的几个位置[8]。DA-Ada为无监督领域自适应检测学习领域感知适配器[18]CUoRA针对少样本源域自由适配[40]CoPEFT则将协作适配器与代理提示结合用于低成本协作感知适配[36]。与本文最直接相关的是YOLO-IOD通过选择任务重要的卷积核对YOLO-World进行分阶段的PEFT以用于增量检测[47]SF-YOLO则通过教师-学生源域自由方案适配YOLO[34]。因此先前的检测器工作已经研究了层、插入点、组件和核的选择。然而它们并未提供一个通用的、在训练前检查算子约束、检测语义、图接口以及跨异构检测器家族的导出行为的可行性检查。2.4 异构实时检测器现代的实时检测器混合了多种执行范式RT-DETR增加了Transformer解码器[25]YOLO-World增加了文本-图像融合[4]YOLOv12引入了以注意力为中心的计算块[33]而YOLO-Master[22]则体现了稀疏专家路由。它们的头部包含与损失耦合的组件例如分布式边界框回归[20]。这种异构性构成了YOLO-PEFT的研究范围它并不是提出另一种适配器参数化方法而是验证现有的适配器方法并将其纳入一个共同的训练-保存-合并-导出契约中同时保留检测器特定的接口。3 方法所评估的检测器家族包含异构算子和任务特定的密集头部因此不能仅通过匹配模块名称来迁移语言模型的PEFT规则。YOLO-PEFT将适配器放置视为一个受限决策问题给定一个检测器计算图、一个PEFT请求和一个参数预算它返回一个结构有效、可训练且可部署的计划或者在实现规则和校准覆盖范围内没有可行计划时拒绝该请求。该流程分为四个阶段解析检测器、解决约束有效放置、将计划落实到YOLO运行时、以及应用兼容的训练策略。完整的伪代码和实现细节在补充材料中提供。3.1 问题形式化与检测器表示表1. PEFT在YOLO上的测量矩阵。WB导出基于官方VOC2007测试集遗留日志别名val2007基线是相同主干的Full-SFT运行。“rs”表示RS-LoRA缩放粗体值表示达到或超过Full-SFT。显示的是种子0的结果在种子 {0,28,42} 上对选定的核心运行进行重跑样本标准差 SD≤0.006mAP50:95 且排名不变。RT-DETR-L的拒绝行记录了一个范围内的规划器保护措施所有七个扫描的LoRA系列配置都低于 Δ−0.05因此规划器发出REFUSE而非适配器这不是一个未见过架构的测试。一个模块的Python类型不足以判断它是否是一个安全的目标同一个Conv2d可能属于主干块、特征金字塔融合层、回归头或固定的DFL投影。因此GRAPH PARSER图解析器为每个模块分配两个独立的角色。算子角色捕获其计算契约。密集卷积允许使用普通的低秩因子分组卷积需要组内局部因子而深度可分离卷积不能接受混合通道的更新。归一化、激活和未知算子被保守地处理。语义角色捕获检测器特定的含义。固定的DFL投影、几何敏感的回归路径和MoE路由器被排除因为即使它们的张量形状保持有效微小的更新也可能改变校准后的区间或专家分配。角色分配结合了图位置和检测器惯用结构。解析器识别YOLO12的区域注意力Area-Attention块、RT-DETR的可变形注意力模块、YOLO-World的文本融合以及MoE路由/专家结构。已知家族接收经过校准的角色配置文件而自定义检测器则回退到拓扑扫描不匹配的模块被分配一个未知角色且不会被适配。这个默认设置使得不受支持的结构变得明确而不是悄然扩大目标集合。3.2 约束解决的放置与安全性给定角色感知的计算图PLANNER规划器按固定顺序解决放置问题过滤算子、过滤语义、应用架构策略、分配秩然后验证可靠性。有效性优先于效率因为在结构不安全的层上优化秩分配无法产生可部署的计划。表2. 形式化约束接口。每行指定所消耗的信息、确定性接受规则、规划器输出以及规则失败时返回的原因。可靠性校准仅在硬约束之后进行评估。端到端示例YOLO12s。考虑一个在所有卷积和线性模块上应用秩16的RS-LoRA的请求。解析器首先将模型扩展为骨干、颈部和解耦头节点并附加算子/语义角色。基于原始名称的请求包括普通的 3×3 卷积、深度可分离卷积、区域注意力内部组件、分类和回归分支以及DFL投影。算子过滤移除缺乏通道保持适配器的深度可分离卷积主机E-DEPTHWISE-MIX语义过滤移除*.dfl.*和几何敏感的回归节点E-DFL-FIXED/E-HEAD-GEOMETRYYOLO12策略在所评估的配置文件下移除attn.{qkv,proj,pe}和内部的区域注意力MLP卷积。图接口检查保留形状保持的骨干/颈部主机。然后预算求解器将 r16r16 分配给幸存的密集卷积目标直到满足预算 BB。发出的目标列表是那些幸存的骨干/颈部卷积的完全限定名称并附有被排除模块的名称/原因映射和实际参数成本。因此最终的目标集合是由图角色和约束生成的而非隐藏的手动列表更改用户范围 LL 或预算 BB 只会改变最终的交集和秩分配而绝不会改变强制性的排除项。预算秩分配。过滤之后规划器通过下式分配秩3.3 YOLO兼容的运行时与导出契约一个在数值上有前景的放置方案如果破坏了训练或导出流程也是无用的。因此契约Contract将每个 (i,r) 实例化的同时保持四个不变量(I1) 基础检查点加载保持不变(I2) 适配器检查点仅存储适配器张量和运行时元数据(I3) 合并后恢复为普通的YOLO模块(I4) ONNX和TensorRT导出器看到的是导出兼容的计算图。运行时通过两个后端家族暴露一个接口。HuggingFace PEFT 处理 LoRA, RS-LoRA, DoRA, LoHa, LoKr, AdaLoRA, IA³, OFT, BOFT 和 HRA。当 PEFT 不可用或被显式绕过时一个更精简的代码库内后端提供普通的卷积 LoRA。两条路径共享相同的已解析目标集合和生命周期在优化器构建前安装在冻结基础权重的情况下训练保存仅适配器状态将其加载到兼容的基础检测器上合并移除包装器然后导出。在适配器未合并时禁用卷积融合因为过早融合会使其宿主模块失效。3.4 训练策略4 实验4.1 实现细节我们遵循官方的Ultralytics VOC配置[5, 16]VOC2007 trainval (5,011) ∪ VOC2012 trainval (11,540) 构成16,551张图像的训练集官方的VOC2007测试集包含4,952张图像。YAML键val解析为images/test2007WB的历史记录val2007字符串只是一个别名并非训练中使用的VOC2007验证目录。年份前缀的ID交集为零补充表17。研究涵盖CNN检测器YOLOv8/YOLO11、注意力增强的YOLO12、文本融合的YOLO-World以及基于Transformer的RT-DETR-L。基于WB的核心s-scale运行使用600周期上限和 640×640 输入更广泛的14变体 × 5架构诊断扫描使用300周期和 320×320 输入。所有s-scale消融均使用核心协议每次运行的日志保留实际停止周期和批量大小。对于核心运行Ultralytics的optimizerauto解析为SGD初始学习率0.01动量0.9权重衰减为 5×10−4启用余弦调度Mosaic在最后十个周期关闭。除非另有说明PEFT使用 r16α32丢弃率0.05并启用RS-LoRA缩放。实验在一致的多加速器训练环境中使用分布式数据并行训练。Full-SFT、标准LoRA、Planner-LoRA、最佳PEFT和朴素放置方案在种子 {0,28,42} 上进行了评估。它们内部配置的最大标准差 ≤0.006mAP50:95​所有方向和排名均未改变。表1显示了完整的种子0矩阵重跑是稳健性检查而非配对显著性检验。所有比较的核心方法共享相同的评估节奏、早停耐心值100和最佳检查点规则因此早停不会带来方法特定的优势。我们将分数解释为受控的相对比较而非一次性的盲测估计。4.2 架构条件行为分析宏观稳定性映射。如图3和补充表7所示PEFT的可靠性在五个评估的检测器家族中与架构强耦合而非遵循一个共同的排名。灾难率定义为mAP下降 Δ−0.05通常随注意力比率 ϕattn​ 上升。具体来说在评估的纯CNN YOLO11n配置上标准变体在十次运行中零崩溃而YOLO12n的崩溃率为 6/7RT-DETR-L为 7/7。补充表8中的成对Kendall-ττ 分析同样显示在评估的家族中等级相关性减弱或逆转这并非针对每个YOLO家族模型的证据。机制性失败分析。我们观察到现有假设同质Transformer块的PEFT接口在多个层面违反了实时检测器的结构约束。在多模态架构如YOLO-World中图像和文本分支的梯度范数可能相差数个数量级。4.3 与替代范式的比较与LM继承排名的比较。在表3中我们将结构感知的计划与朴素的语言模型PEFT放置进行对比。显示的YOLO11s/YOLO12s值是种子0的核心快照在种子 {0,28,42} 上样本标准差 ≤0.006mAP50:95​ 且排名保持不变。在所评估的RT-DETR-L配置上校准后的规划器回退到Full-SFT而不是返回低于灾难阈值的适配器。与全量微调Full-SFT的比较。在中规模目标数据集上更新所有参数可能会过度适应预训练表示而冻结大部分检测器并将更新限制在低秩子空间可以充当隐式正则化器。在完整的VOC trainval划分上最强的YOLO12s配置HRA达到 0.7453mAP50−95​而Full-SFT为 0.6662在种子0核心快照中提升了 7.9 个点。种子28和42在审计的SD范围内≤0.006保持了这一方向因此该观察结果不被解释为少样本结果。MoE压力测试。表4报告了提供的YOLO-Master-EsMoE-S WB导出结果。所有行均使用VOC、640x640 输入、批量128、600周期上限、相同的分布式训练环境、种子0并禁用规划器、注意力、头部、路由器和专家目标选择。因此这些运行测试的是仅限于普通合格主机的PEFT是否能与MoE检测器共存它们并未验证专家感知的规划。HRA是完成的最佳配置达到 0.7454mAP50:95而记录的Full-SFT值为 0.6891。BOFT和OFT在产生指标之前失败而所有六个产生指标的PEFT运行均完成。这些数据扩展了评估的架构集合但并未扩展数据集或种子覆盖范围。它们无法支持关于COCO、领域迁移、少样本学习或方差的主张。它们也说明了为什么规划器需要能力检查两种配置消耗了设置时间但从未进入评估阶段而已完成的方法在运行时间上存在显著差异。表4. 种子0的YOLO-Master-ESMoE-S压力测试来自提供的WB导出。规划器和MoE/注意力/头部目标选择被禁用。失败表示未报告评估指标记录的Full-SFT运行报告了最终指标尽管其WB状态已崩溃。运行时间是来自导出的挂钟小时数。分解部署经济学。在我们受控的YOLO11审计中LoRA使用16.03 GB对比28.57 GB减少43.9%但耗时203.8秒对比118.2秒1.72倍更长其他PEFT变体也更慢。此审计是本文主要的效率声明有意排除了外部报告的存储数据。RT-DETR-L的Full-SFT回退方案被排除在所有PEFT聚合之外详细的核算范围见补充部署审计。权衡的解释。审计区分了两个常被混淆的资源。相对于Full-SFT适配器运行减少了12.54 GB的峰值训练内存但在相同的受控配置下增加了85.6秒的训练时间。因此内存减少伴随着优化时间的成本而非构成一个普遍的速度提升。部署有一个独立的选择未合并的适配器有助于检查点交换而合并模型在导出前移除了适配器分支恢复了基础模型的算子路径补充表6。因此我们分别报告VRAM、挂钟时间以及合并/未合并行为并将 REFUSE → Full-SFT 视为适配器风险过高时的有效结果。4.4 消融研究规划器约束的有效性。我们在YOLO12s上分离了各个规划器组件对性能的贡献。如补充表11详述无约束的朴素基线达到0.6900 mAP50-95。引入算子有效性过滤以排除深度可分离卷积和归一化层将准确率提升至0.7094。结合检测头语义排除带来了最大的稳定性提升将性能推至0.7307 mAP这支持语义保护是稳定性驱动因素而不仅仅是工程安全措施。谓词级诊断。表5将可应用的约束与仅存在于规则集中的约束区分开来。在YOLO12s上开放注意力流规则接纳了32个模块并使平均适配器梯度范数提高了1.581倍开放类型化头部规则接纳了18个模块提高了1.091倍。两次短期运行均未产生非有限梯度因此证据支持的是优化压力的改变而非必然的崩溃。相反深度可分离卷积谓词在任一审计图上均未接纳额外的秩-4目标因此在此不能归因于训练效果。单个DFL投影、12个可变形采样/注意力权重层和28个RT-DETR分数/边界框输出层仍然是反事实候选它们的固定区间、采样几何或输出偏置语义使得直接插入成为一个不同的干预措施而非普通的留一法开关。安全放置下的下游解码器漂移。我们将一个RT-DETR-L VOC检查点与激活的安全适配器状态和适配器参数置零的同一检查点进行比较。通过支持的预测器路径16张固定的VOC2007图像产生有限的 300×6300×6 输出。解码器模块中的相对 ℓ2ℓ2​ 漂移为 0.553±0.099MSDeformAttn 中为 0.530±0.103边界框头中为 0.613±0.100分数头中为 0.127±0.033最终输出漂移为 0.548±0.094中位数0.571P90 0.611。因此安全的上游适配会传播到冻结的解码器但这些16张图像、1% 训练量的诊断并不能验证不安全的解码器插入。图4. 论文测量的受控YOLO11系统审计。相对于Full-SFTLoRA将峰值VRAM从28.57 GB降至16.03 GB43.9%但训练时间从118.2秒增至203.8秒1.72倍所有显示的PEFT变体都比Full-SFT慢。表6. 受控YOLO11s和YOLO12s检查点的MPS部署审计。A 部署与导出审计以下图表和冒烟测试表记录了七页主论文中省略的受控部署审计和合并/未合并导出检查。ONNX/TensorRT 验证协议。未合并和合并的计算图均在 opset 18 下通过了 ONNX 检查器验证支持静态形状 [1, 3, 640, 640] 以及动态批次、高度和宽度轴ONNX Runtime CPU 执行显示相对于 PyTorch 的最大绝对误差低于 1.24×10−3。TensorRT 引擎在 FP32 和 FP16 下构建并执行使用动态优化配置验证了数值一致性、内存、吞吐量和延迟。B 回退手动 Conv2d 后端的合并等价性B.1 作为 im2col 矩阵乘法的密集卷积B.2 分组卷积和每组秩分配B.3 命题1的证明B.4 数值容差与实现说明上述证明涵盖了普通的回退 Conv2d LoRA 路径。RS-LoRA 和 PEFT 管理的变体委托给 PEFT 运行时少样本和自适应回退变体需要在应用相同的合并模式之前解析秩掩码。合并和未合并路径仅在操作顺序上有所不同展开 批量矩阵乘法 对比 在合并权重上的单次卷积输出在标准浮点容差内被视为等价。合并正确性在包装器移除后进行验证而非之前。等价性在部署/评估模式下成立此时适配器丢弃被禁用。C 后端路由与 PEFT 管理变体C.1 后端选择规则PEFT 后端是 LoRA、RS-LoRA、DoRA、LoHa、LoKr、AdaLoRA、IA³、OFT、BOFT 和 HRA 的默认路由。回退手动后端有意设计得更为狭窄它仅在 PEFT 不可用、被显式绕过或请求回退路径时用于普通的 Conv2d LoRA 包装。量化路径委托给 PEFT 后端因为量化集成是后端特定的。C.2 量化与包装必需的路径需要包装的训练状态不被视为导出兼容的产物。如果包装器无法合并为普通的 YOLO 模块或由 PEFT 管理的导出路径处理契约层将拒绝导出。C.3 导出策略仅当结果模型满足方法中声明的运行时不变量时才允许导出基础检查点加载不变、仅适配器检查点、合并后的普通 YOLO 模块结构以及 ONNX/TensorRT 工具链的导出兼容模块。PEFT 管理的适配器仅在 PEFT 合并路径成功或契约验证了等效的非包装模块结构后才被视为导出兼容。D 运行时元数据模式D.1 JSON 字段当前实现持久化运行时元数据而非完整的加密清单。PEFT 路径将runtime_metadata.json与 PEFT 的save_pretrained产物一起写入回退路径写入fallback_meta.json和回退权重文件。记录的字段包括后端、变体、冻结BN设置、头部包含设置、目标模块以及后端特定的运行时元数据。D.2 兼容性检查在加载时YOLO-PEFT 使用此元数据来选择 PEFT 或回退加载器并验证请求的后端和目标配置与保存的适配器一致。完整的基础检查点、模型YAML、类别名称和架构哈希检查是部署时的扩展而非当前硬性检查要求。表S2. 图2的数值对比。结果来自320分辨率的诊断矩阵。Full-SFT行报告基准 mAP0.5:0.95所有其他行报告 Δ。红色条目为灾难性 (Δ−0.05)。对于崩溃的RT-DETR-L运行Δ−0.600 表示用于可视化的截断失败值。此整个矩阵是种子0的诊断扫描它不是多种子聚合。主文中报告的种子28/42重跑是作为核心基线和选定规划器配置的稳健性检查。表8. ΔmAP 排名的成对 Kendalls ττ。CNN内部对YOLOv8n vs. YOLO11n是唯一 p0.05 的对所有其他对 p0.3。D.3 失败模式元数据检查可防止后端/路径混淆和回退权重缺失。更强的图、类别词汇表和导出运行时不匹配检查需要前文所述的完整部署时清单扩展。E PEFT 矩阵详情完整的核心WB测量矩阵在主文表1中报告。为避免重复该表本附录提供图2的数值对应物和成对等级一致性诊断。E.1 图2的数值对应物表S2报告了对应于热图的紧凑 ΔmAP 视图。它将Full-SFT基准与PEFT增量分开并标记了灾难性单元格。E.2 成对等级一致性表S3量化了补充缩放规律图中可见的排名反转模式。CNN内部比较是唯一强正相关的对跨越到注意力密集、文本融合或Transformer解码器检测器时变体排名会减弱或逆转。表S4. 主文架构覆盖讨论背后的检测器家族覆盖范围。CNN主干共享报告的LoRA衰减接受区间非CNN行保留主文中显式的状态。表10. 消融A1朴素替换与契约管理替换LoRA r16RS-LoRAYOLO11s on VOC核心600周期上限/640分辨率协议。F 完整的检测器家族覆盖表主文在其架构覆盖讨论中报告了聚合的检测器家族覆盖率。表S4列举了支撑该聚合的十一个主干并未添加超出报告家族状态的每个主干测量结果。F.1 完整的检测器家族覆盖此处单独列出了密切相关的CNN家族检测器而主文将其报告为单一架构类。所有CNN家族行共享报告的LoRA衰减接受区间。G 详细消融研究G.1 A1. 朴素替换 vs. 契约管理替换YOLO-PEFT 中的两个后端都使用模块替换B2 的手动 Conv2d 后端B1 的 PEFT 管理包装器问题是周围的契约管理是否对部署兼容性必不可少。表S5比较了朴素基线与完整契约层。ONNX/TRT/Ckpt 表示训练后的模型是否可以保存、重新加载、合并和导出而无需手动图手术。G.2 A2. 规划器组件消融表S6在YOLO12s上对规划器的每个约束进行了消融。该序列依次分离了算子有效性、检测头语义过滤和预算剪枝的贡献。预算匹配选择器诊断。作为一项独立的工程检查我们在相同的秩-4适配器预算31,104个参数下比较了四种目标选择规则。每次运行在相同的 2% VOC0712 子集上使用一个周期以及固定的160张图像验证子集种子为0、28和42。表12报告了三次运行的总均值和标准差。此协议检查预算核算和可执行目标选择但其短周期并非核心训练协议不得解释为性能排名。表11. 消融A2YOLO12s上的规划器约束VOCLoRA r16α32RS-LoRA启用核心600周期上限/640分辨率协议。表12. 预算匹配的YOLO12s选择器MPS诊断。所有行使用31,104个适配器参数由于模块形状不同目标数量可能不同。数值为三个种子的均值 ± 总体标准差。表13. 消融A3YOLO12s上的秩敏感性VOC核心600周期上限/640分辨率协议。基准Full-SFT0.6662 mAP50:959.26M总参数。参数量列包括冻结的基础模型推理GFLOPs在合并后测量。表14. 消融A4规划器选择放置下的变体扫描r16α32RS-LoRA启用官方VOC2007测试集核心600周期上限/640分辨率协议。四个 mAP50:95 均值相差在0.0034以内而其标准差在0.0093-0.0267之间。此外梯度 top-k 在种子0时领先而 backbone-only 在种子28和42时领先。因此该诊断未提供在此周期内宣布普遍更优选择器的证据主协议比较需要更长的训练并应保留相同的预算和多种子控制。G.3 A3. 秩敏感性此消融测试规划器的默认秩是否是一个脆弱的选定值。扫描显示随秩增加呈单调增益同时确认 r16 是一个实用的总参数权衡点。G.4 A4. 固定放置下的变体扫描此消融固定规划器放置仅改变局部的PEFT更新规则。在YOLO11s和YOLO12s上的排名变化支持了架构条件变体选择的主张。G.5 A5. RS-LoRA 和 DoRA 交互作用此双因素消融检查训练崩溃是由变体标签本身引起的还是由交互的训练侧先验引起的。只有无RS-LoRA的DoRA角落越过了灾难阈值。表15. 消融A5YOLO12s上的RS-LoRA × DoRA 2×2 因子设计VOCLoRA r16α32核心600周期上限/640分辨率协议。G.6 A7. LM继承排名 vs. 结构感知放置此消融直接测试从语言模型继承的PEFT排名是否迁移到异构检测器。结构感知计划使用相同的主干和训练预算但从检测器计算图中选择变体和目标。表16. 消融A7LM继承排名与结构感知计划。数字来自WB在官方VOC2007测试集上的导出r16α32核心600周期上限/640分辨率协议。增益是相同主干上结构感知计划与LM继承计划之间的差异。崩溃计数来自独立的300周期/320分辨率诊断矩阵并激发了范围内的保护措施它不是一个独立的未见过架构结果。H 复现说明实验使用官方的 Ultralytics VOC 映射训练 YAML 键包含images/train2007、images/val2007、images/train2012和images/val2012而两个评估键均解析为images/test2007。因此历史记录中的 WB 字段val2007是 VOC2007 测试集评估的别名而非训练中包含的 VOC2007 验证目录。报告的核心结果中未使用随机或少样本划分。核心 WB 运行将图像调整为 640扩展诊断矩阵使用 320核心 WB 运行使用 600 周期上限而诊断矩阵使用 300 周期除非另有说明。对于核心 WB 运行optimizer-auto解析为 SGD初始学习率 0.01动量 0.9权重衰减为 5×10−4启用余弦调度Mosaic 在最后十个周期关闭早停耐心值为 100。每种方法均以相同的节奏进行评估且相同的最佳检查点规则提供报告的分数。因此早停不会带来方法特定的选择优势它是共享的官方训练协议的一部分。由于 VOC2007 测试集参与此通用的检查点选择协议我们使用它来支持受控的相对比较并不将绝对分数呈现为一次性的盲测估计。此模型选择问题与训练数据泄漏不同表17验证了训练/评估图像ID交集为零。除非明确扫描适配器使用秩16、α32、丢弃率0.05、启用RS-LoRA缩放并禁用DoRA的幅度分支。运行使用一致的加速器启用训练环境和固定软件栈导出的WB表格包括主干、变体、秩、alpha、缩放模式、可训练参数、mAP、内存和适配器大小字段。Full-SFT、标准LoRA、Planner-LoRA、最佳PEFT和朴素放置除了种子0外还有种子28和42的重跑。主文保留种子0以紧凑地呈现完整矩阵每次运行的日志保留相应的三种子记录。所有上述s-scale规划器、秩、变体和训练先验消融均使用核心600周期上限/640分辨率协议。秩8是未校准的YOLO12请求的保守回退而显式的 r∈{8,16,32} 扫描则在已识别的YOLO12配置文件上评估预算批准的秩。表17. VOC划分审计。ID直接从官方的ImageSets/Main/*.txt文件中获取并在每个ID前加上其来源年份后进行比对。表18. 选定核心比较的三种子稳健性审计。统计量在种子 {0,28,42} 上的每个配置内计算它是稳健性摘要非显著性测试。MPS部署审计存储在artifacts/deployment_mps_v2/下的JSON文件中它记录了合并和未合并的参数计数、GFLOPs、同步延迟、吞吐量、分配器遥测、ONNX opset/形状/误差检查以及加速器-主机TensorRT引擎验证记录。效率核算范围。本文仅报告受控的YOLO11审计LoRA相对于Full-SFT峰值VRAM降低了 43.9%43.9%16.03 GB 对比 28.57 GB但训练时间长了 1.72×203.8秒 对比 118.2秒。外部存储、分发和外部来源的内存估计被排除在声明之外。