
核心問題從語言模型遷移而來的通用PEFT方法如LoRA在異構的實時目標檢測器上可能靜默失效因為檢測器中包含卷積、注意力、文本融合、MoE路由等多種異構算子而現有PEFT接口僅通過模塊名稱匹配來放置適配器缺乏對算子契約、檢測語義和部署兼容性的預訓練檢查。主要貢獻YOLO-PEFT提出了一個結構感知框架將適配器放置形式化為可審計的約束規劃問題在訓練前返回經過驗證的放置計劃或明確的拒絕并統一了訓練-保存-合并-導出流程。方法論框架四大步驟角色感知圖解析將檢測器解析為有向無環圖為每個模塊分配獨立的算子角色如密集卷積、分組卷積、深度可分離卷積和語義角色如主干、頸部、分類頭、回歸頭、DFL投影使規劃器能理解每個Conv2d的上下文含義。約束解決規劃按固定順序應用六類硬約束算子有效性、語義安全、圖接口兼容性、架構策略、預算可行性、部署兼容性和可靠性校準。不滿足約束的模塊被排除并記錄原因代碼最終返回ACCEPT附計劃或REFUSE附日志。例如固定的DFL投影、MoE路由器和深度可分離卷積會被自動排除。統一運行時契約確保四個不變量——基礎檢查點加載不變、適配器僅存張量與元數據、合并恢復普通YOLO模塊、ONNX/TensorRT導出兼容。支持HuggingFace PEFT后端和手動Conv2d回退后端。可選訓練策略層級學習率衰減、Alpha預熱、正交正則化、動態丟棄用于穩定優化。核心實驗結果檢測器Full-SFT (mAP50-95)規劃器選擇的最優PEFT提升YOLO11s0.64280.7138 (LoRA/HRA)0.0710/0.0848YOLO12s0.66620.7453 (HRA)0.0791RT-DETR-L0.6833REFUSE→Full-SFT避免災難關鍵發現PEFT可靠性強烈依賴于架構災難率隨注意力占比?attn?上升YOLO11n為0/10YOLO12n為6/7RT-DETR-L為7/7。結構感知放置相比語言模型繼承的排名在YOLO11s和YOLO12s上分別額外提升0.0659和0.1195 mAP50-95。受控審計LoRA降低峰值VRAM 43.9%28.57GB→16.03GB但訓練時間增加1.72倍118.2s→203.8s。主要局限性作者明確聲明架構覆蓋有限拒絕決策僅在校準覆蓋范圍內有效未見的檢測器架構上的拒絕仍是開放驗證問題。非通用安全保證RT-DETR-L的拒絕規則基于7個觀察到的崩潰校準不能外推至所有Transformer檢測器。診斷矩陣非多種子聚合320分辨率的熱圖診斷為種子0單次掃描僅核心基線有種子{0,28,42}重跑。MoE壓力測試未驗證專家感知規劃僅測試PEFT與MoE檢測器共存BOFT/OFT在產生指標前失敗。YOLO-PEFT是一個結構感知、約束驅動、可審計的檢測器PEFT框架通過圖解析與硬約束過濾取代手動試錯在識別架構上顯著超越Full-SFT在風險架構上明確拒絕但跨架構的泛化能力仍是未來工作。這里是自己的論文閱讀記錄感興趣的話可以參考一下如果需要閱讀原文的話可以看這里如下所示項目地址在這里如下所示從語言模型遷移而來的通用參數高效微調PEFT方法在實時檢測器上可能無聲地失效因為這些檢測器的異構算子和檢測特有組件帶來了傳統Transformer堆棧中不存在的放置約束。我們提出YOLO-PEFT一個結構感知框架將適配器放置形式化為一個可審計的約束規劃問題。給定一個檢測器計算圖、一個PEFT請求和一個資源預算YOLO-PEFT會分配算子和語義角色評估顯式的算子有效性、檢測器語義、圖接口和部署謂詞為每個被排除的模塊記錄一個原因代碼并要么輸出一個符合預算的目標模塊計劃要么在訓練之前返回“拒絕”。在官方的VOC0712 trainval 到 VOC07 test 協議下規劃器選擇的RS-LoRA在YOLO11s和YOLO12s上分別達到0.7138和0.7307 mAP50-95而全量微調Full-SFT分別為0.6428和0.6662。在RT-DETR-L上所有七個評估的LoRA系列配置都越過了預定義的災難性閾值支持在所評估的覆蓋范圍內做出校準后的“拒絕-轉-全量微調”決策。一項受控的YOLO11審計進一步顯示LoRA將峰值訓練內存減少了43.9%盡管訓練時間增加了1.72倍。在所評估的檢測器家族、放置策略和校準覆蓋范圍內YOLO-PEFT用顯式、可檢查的規劃取代了手動選擇目標模塊的試錯過程同時保留了經過驗證的訓練-保存-合并-導出路徑在未見過的檢測器架構上的拒絕仍然是一個開放的驗證問題。1 引言大規模部署實時檢測器需要針對新的類別詞匯表、領域、傳感器、延遲目標和硬件后端進行反復適配。本研究涵蓋了更廣泛YOLO生態系統中的代表性成員以及RT-DETR、YOLO-World和一個混合專家MoE檢測器[4, 17, 25, 33]。全量微調為每個部署變體復制訓練狀態和完整的檢查點這使得參數高效微調PEFT成為降低適配和分發成本的一種有吸引力的方法[9, 11, 13]。面臨的挑戰是為基本同構的Transformer堆棧開發的PEFT方法無法安全地遷移到異構的檢測器計算圖現代檢測器交錯使用密集卷積、分組卷積和深度可分離卷積、與損失耦合的分布焦距損失DFL投影、可變形注意力、文本-圖像融合以及MoE路由因此不加區分地插入LoRA可能導致優化失敗或嚴重的mAP下降。現有解決方案存在四個空白。首先通用的PEFT接口通過模塊名稱或類型來選擇目標[26]而沒有在訓練前檢查算子契約、檢測語義、圖接口或放置風險。其次特定于檢測器的方法如SpotPatch、LoRA-Det和YOLO-IOD展示了選擇性適配的價值但它們的放置策略與特定的檢測器、任務或組件綁定而不是一個能跨越卷積、Transformer、多模態和MoE計算圖的通用抽象[29, 41, 47]。第三僅靠放置策略并未提供一個端到端的訓練、僅適配器檢查點、合并以及ONNX/TensorRT導出的契約使得部署兼容性依賴于特定方法的集成。第四先前的接口沒有提供校準機制來識別高風險架構-適配器組合導致在可能發生靜默故障時仍然進行訓練。本文貢獻。我們提出YOLO-PEFT一個結構感知框架通過四個步驟彌合這些差距角色感知圖解析我們將檢測器解析為一個有向無環圖DAG并為每個模塊分配獨立的算子和語義角色使規劃器能夠理解一個Conv2d層是位于主干、頸部、回歸頭還是固定DFL投影中。約束解決規劃我們形式化地定義了一組約束算子有效性、檢測器語義安全、圖接口兼容性、預算可行性和部署兼容性。規劃器要么輸出一個經過驗證的、符合預算的適配器放置計劃要么返回拒絕REFUSE并附帶可審計的原因日志。統一的運行時契約我們實現了一個與YOLO兼容的運行時環境確保訓練、僅適配器檢查點、合并恢復為標準YOLO模塊以及通過ONNX/TensorRT導出的流程能夠正常工作從而消除了手動圖修補的需要。校準后的拒絕與訓練策略我們集成了一個可靠性校準模塊用于在風險過高時觸發拒絕。同時我們提供了可選的訓練策略如層級學習率衰減、Alpha預熱、正交正則化和動態丟棄來穩定優化過程。圖1. 系統概覽。該流程 (1) 將檢測器從受支持的、已評估的家族解析為角色感知的類型化計算圖(2) 過濾不安全的適配目標選擇PEFT方法并通過預算感知的秩分配 ∑ici(ri)≤B 來解決適配器放置問題 ππ或在校準覆蓋范圍內返回“拒絕”并提供全量微調Full-SFT備用方案(3) 在凍結基礎權重 (WW0ΔW(π)) 的情況下訓練側邊適配器并保存僅含適配器的檢查點及其運行時清單(4) 可選擇將適配器合并回普通的YOLO模型并將結果模型通過ONNX/TensorRT導出用于邊緣、服務器或移動端部署。2 相關工作2.1 通用參數高效微調PEFT方法最初為語言模型開發[13, 23]現已擴展到視覺領域。視覺提示調優[14]、適配器[30]、縮放與平移特征[21]以及低秩適配LoRA[13]構成了主流范式。針對視覺TransformerViT的后續工作包括AdaptFormer[2]、Pro-Tuning[28]、SCT[48]、Conv-Adapter[1]和Convolutional Bypasses[15]它們主要關注ViT主干。VFM-Adapter[3]和VMT-Adapter[38]為密集預測任務引入了適配器而E3VA[43]指出僅憑少量可訓練參數并不能保證低訓練內存或時間并為基于Swin的密集預測構建了獨立的梯度高速通道。一篇相關的預印本使用了并行的多任務適配器用于偽裝目標分割[39]。這些文獻表明適配器結構、任務和系統成本都很重要但大多假設使用選定的主干和頭部而不是驗證異構檢測器全局的目標計劃。2.2 視覺-語言與開放詞匯適配VL-Adapter為視覺-語言模型的參數高效適配提供了基準[31]為多模態適配奠定了基礎。在開放詞匯檢測中SIA-OVD學習形狀特定的區域適配器及其分配以減少CLIP圖像-區域差距[35]而模塊化PEFT研究開放詞匯檢測器中特定任務的組件調優[6]。PET-DINO[7]統一了Grounding DINO中的視覺線索以進行視覺提示檢測。這些方法表明插入和分配應反映區域或模態語義。但它們針對的是固定的視覺-語言流程而YOLO-PEFT額外考慮了卷積分組、多尺度頸部接口、與損失耦合的頭部組件、專家路由和導出時合并等因素。2.3 檢測器的參數高效適配已有若干研究直接適配目標檢測器。SpotPatch為MobileNetV2-SSD-FPNLite層學習數據集特定的門控并在十個檢測任務中存儲選定的1-bit殘差[41]。LoRA-Det分析了一個基于Swin的旋轉檢測器的秩并手動將LoRA與FPN、RPN和預測組件的全量調優相結合[29]而多點位置插入調優則將輕量級模塊放置在凍結的小目標檢測器的幾個位置[8]。DA-Ada為無監督領域自適應檢測學習領域感知適配器[18]CUoRA針對少樣本源域自由適配[40]CoPEFT則將協作適配器與代理提示結合用于低成本協作感知適配[36]。與本文最直接相關的是YOLO-IOD通過選擇任務重要的卷積核對YOLO-World進行分階段的PEFT以用于增量檢測[47]SF-YOLO則通過教師-學生源域自由方案適配YOLO[34]。因此先前的檢測器工作已經研究了層、插入點、組件和核的選擇。然而它們并未提供一個通用的、在訓練前檢查算子約束、檢測語義、圖接口以及跨異構檢測器家族的導出行為的可行性檢查。2.4 異構實時檢測器現代的實時檢測器混合了多種執行范式RT-DETR增加了Transformer解碼器[25]YOLO-World增加了文本-圖像融合[4]YOLOv12引入了以注意力為中心的計算塊[33]而YOLO-Master[22]則體現了稀疏專家路由。它們的頭部包含與損失耦合的組件例如分布式邊界框回歸[20]。這種異構性構成了YOLO-PEFT的研究范圍它并不是提出另一種適配器參數化方法而是驗證現有的適配器方法并將其納入一個共同的訓練-保存-合并-導出契約中同時保留檢測器特定的接口。3 方法所評估的檢測器家族包含異構算子和任務特定的密集頭部因此不能僅通過匹配模塊名稱來遷移語言模型的PEFT規則。YOLO-PEFT將適配器放置視為一個受限決策問題給定一個檢測器計算圖、一個PEFT請求和一個參數預算它返回一個結構有效、可訓練且可部署的計劃或者在實現規則和校準覆蓋范圍內沒有可行計劃時拒絕該請求。該流程分為四個階段解析檢測器、解決約束有效放置、將計劃落實到YOLO運行時、以及應用兼容的訓練策略。完整的偽代碼和實現細節在補充材料中提供。3.1 問題形式化與檢測器表示表1. PEFT在YOLO上的測量矩陣。WB導出基于官方VOC2007測試集遺留日志別名val2007基線是相同主干的Full-SFT運行。“rs”表示RS-LoRA縮放粗體值表示達到或超過Full-SFT。顯示的是種子0的結果在種子 {0,28,42} 上對選定的核心運行進行重跑樣本標準差 SD≤0.006mAP50:95 且排名不變。RT-DETR-L的拒絕行記錄了一個范圍內的規劃器保護措施所有七個掃描的LoRA系列配置都低于 Δ?0.05因此規劃器發出REFUSE而非適配器這不是一個未見過架構的測試。一個模塊的Python類型不足以判斷它是否是一個安全的目標同一個Conv2d可能屬于主干塊、特征金字塔融合層、回歸頭或固定的DFL投影。因此GRAPH PARSER圖解析器為每個模塊分配兩個獨立的角色。算子角色捕獲其計算契約。密集卷積允許使用普通的低秩因子分組卷積需要組內局部因子而深度可分離卷積不能接受混合通道的更新。歸一化、激活和未知算子被保守地處理。語義角色捕獲檢測器特定的含義。固定的DFL投影、幾何敏感的回歸路徑和MoE路由器被排除因為即使它們的張量形狀保持有效微小的更新也可能改變校準后的區間或專家分配。角色分配結合了圖位置和檢測器慣用結構。解析器識別YOLO12的區域注意力Area-Attention塊、RT-DETR的可變形注意力模塊、YOLO-World的文本融合以及MoE路由/專家結構。已知家族接收經過校準的角色配置文件而自定義檢測器則回退到拓撲掃描不匹配的模塊被分配一個未知角色且不會被適配。這個默認設置使得不受支持的結構變得明確而不是悄然擴大目標集合。3.2 約束解決的放置與安全性給定角色感知的計算圖PLANNER規劃器按固定順序解決放置問題過濾算子、過濾語義、應用架構策略、分配秩然后驗證可靠性。有效性優先于效率因為在結構不安全的層上優化秩分配無法產生可部署的計劃。表2. 形式化約束接口。每行指定所消耗的信息、確定性接受規則、規劃器輸出以及規則失敗時返回的原因。可靠性校準僅在硬約束之后進行評估。端到端示例YOLO12s。考慮一個在所有卷積和線性模塊上應用秩16的RS-LoRA的請求。解析器首先將模型擴展為骨干、頸部和解耦頭節點并附加算子/語義角色。基于原始名稱的請求包括普通的 3×3 卷積、深度可分離卷積、區域注意力內部組件、分類和回歸分支以及DFL投影。算子過濾移除缺乏通道保持適配器的深度可分離卷積主機E-DEPTHWISE-MIX語義過濾移除*.dfl.*和幾何敏感的回歸節點E-DFL-FIXED/E-HEAD-GEOMETRYYOLO12策略在所評估的配置文件下移除attn.{qkv,proj,pe}和內部的區域注意力MLP卷積。圖接口檢查保留形狀保持的骨干/頸部主機。然后預算求解器將 r16r16 分配給幸存的密集卷積目標直到滿足預算 BB。發出的目標列表是那些幸存的骨干/頸部卷積的完全限定名稱并附有被排除模塊的名稱/原因映射和實際參數成本。因此最終的目標集合是由圖角色和約束生成的而非隱藏的手動列表更改用戶范圍 LL 或預算 BB 只會改變最終的交集和秩分配而絕不會改變強制性的排除項。預算秩分配。過濾之后規劃器通過下式分配秩3.3 YOLO兼容的運行時與導出契約一個在數值上有前景的放置方案如果破壞了訓練或導出流程也是無用的。因此契約Contract將每個 (i,r) 實例化的同時保持四個不變量(I1) 基礎檢查點加載保持不變(I2) 適配器檢查點僅存儲適配器張量和運行時元數據(I3) 合并后恢復為普通的YOLO模塊(I4) ONNX和TensorRT導出器看到的是導出兼容的計算圖。運行時通過兩個后端家族暴露一個接口。HuggingFace PEFT 處理 LoRA, RS-LoRA, DoRA, LoHa, LoKr, AdaLoRA, IA3, OFT, BOFT 和 HRA。當 PEFT 不可用或被顯式繞過時一個更精簡的代碼庫內后端提供普通的卷積 LoRA。兩條路徑共享相同的已解析目標集合和生命周期在優化器構建前安裝在凍結基礎權重的情況下訓練保存僅適配器狀態將其加載到兼容的基礎檢測器上合并移除包裝器然后導出。在適配器未合并時禁用卷積融合因為過早融合會使其宿主模塊失效。3.4 訓練策略4 實驗4.1 實現細節我們遵循官方的Ultralytics VOC配置[5, 16]VOC2007 trainval (5,011) ∪ VOC2012 trainval (11,540) 構成16,551張圖像的訓練集官方的VOC2007測試集包含4,952張圖像。YAML鍵val解析為images/test2007WB的歷史記錄val2007字符串只是一個別名并非訓練中使用的VOC2007驗證目錄。年份前綴的ID交集為零補充表17。研究涵蓋CNN檢測器YOLOv8/YOLO11、注意力增強的YOLO12、文本融合的YOLO-World以及基于Transformer的RT-DETR-L。基于WB的核心s-scale運行使用600周期上限和 640×640 輸入更廣泛的14變體 × 5架構診斷掃描使用300周期和 320×320 輸入。所有s-scale消融均使用核心協議每次運行的日志保留實際停止周期和批量大小。對于核心運行Ultralytics的optimizerauto解析為SGD初始學習率0.01動量0.9權重衰減為 5×10?4啟用余弦調度Mosaic在最后十個周期關閉。除非另有說明PEFT使用 r16α32丟棄率0.05并啟用RS-LoRA縮放。實驗在一致的多加速器訓練環境中使用分布式數據并行訓練。Full-SFT、標準LoRA、Planner-LoRA、最佳PEFT和樸素放置方案在種子 {0,28,42} 上進行了評估。它們內部配置的最大標準差 ≤0.006mAP50:95?所有方向和排名均未改變。表1顯示了完整的種子0矩陣重跑是穩健性檢查而非配對顯著性檢驗。所有比較的核心方法共享相同的評估節奏、早停耐心值100和最佳檢查點規則因此早停不會帶來方法特定的優勢。我們將分數解釋為受控的相對比較而非一次性的盲測估計。4.2 架構條件行為分析宏觀穩定性映射。如圖3和補充表7所示PEFT的可靠性在五個評估的檢測器家族中與架構強耦合而非遵循一個共同的排名。災難率定義為mAP下降 Δ?0.05通常隨注意力比率 ?attn? 上升。具體來說在評估的純CNN YOLO11n配置上標準變體在十次運行中零崩潰而YOLO12n的崩潰率為 6/7RT-DETR-L為 7/7。補充表8中的成對Kendall-ττ 分析同樣顯示在評估的家族中等級相關性減弱或逆轉這并非針對每個YOLO家族模型的證據。機制性失敗分析。我們觀察到現有假設同質Transformer塊的PEFT接口在多個層面違反了實時檢測器的結構約束。在多模態架構如YOLO-World中圖像和文本分支的梯度范數可能相差數個數量級。4.3 與替代范式的比較與LM繼承排名的比較。在表3中我們將結構感知的計劃與樸素的語言模型PEFT放置進行對比。顯示的YOLO11s/YOLO12s值是種子0的核心快照在種子 {0,28,42} 上樣本標準差 ≤0.006mAP50:95? 且排名保持不變。在所評估的RT-DETR-L配置上校準后的規劃器回退到Full-SFT而不是返回低于災難閾值的適配器。與全量微調Full-SFT的比較。在中規模目標數據集上更新所有參數可能會過度適應預訓練表示而凍結大部分檢測器并將更新限制在低秩子空間可以充當隱式正則化器。在完整的VOC trainval劃分上最強的YOLO12s配置HRA達到 0.7453mAP50?95?而Full-SFT為 0.6662在種子0核心快照中提升了 7.9 個點。種子28和42在審計的SD范圍內≤0.006保持了這一方向因此該觀察結果不被解釋為少樣本結果。MoE壓力測試。表4報告了提供的YOLO-Master-EsMoE-S WB導出結果。所有行均使用VOC、640x640 輸入、批量128、600周期上限、相同的分布式訓練環境、種子0并禁用規劃器、注意力、頭部、路由器和專家目標選擇。因此這些運行測試的是僅限于普通合格主機的PEFT是否能與MoE檢測器共存它們并未驗證專家感知的規劃。HRA是完成的最佳配置達到 0.7454mAP50:95而記錄的Full-SFT值為 0.6891。BOFT和OFT在產生指標之前失敗而所有六個產生指標的PEFT運行均完成。這些數據擴展了評估的架構集合但并未擴展數據集或種子覆蓋范圍。它們無法支持關于COCO、領域遷移、少樣本學習或方差的主張。它們也說明了為什么規劃器需要能力檢查兩種配置消耗了設置時間但從未進入評估階段而已完成的方法在運行時間上存在顯著差異。表4. 種子0的YOLO-Master-ESMoE-S壓力測試來自提供的WB導出。規劃器和MoE/注意力/頭部目標選擇被禁用。失敗表示未報告評估指標記錄的Full-SFT運行報告了最終指標盡管其WB狀態已崩潰。運行時間是來自導出的掛鐘小時數。分解部署經濟學。在我們受控的YOLO11審計中LoRA使用16.03 GB對比28.57 GB減少43.9%但耗時203.8秒對比118.2秒1.72倍更長其他PEFT變體也更慢。此審計是本文主要的效率聲明有意排除了外部報告的存儲數據。RT-DETR-L的Full-SFT回退方案被排除在所有PEFT聚合之外詳細的核算范圍見補充部署審計。權衡的解釋。審計區分了兩個常被混淆的資源。相對于Full-SFT適配器運行減少了12.54 GB的峰值訓練內存但在相同的受控配置下增加了85.6秒的訓練時間。因此內存減少伴隨著優化時間的成本而非構成一個普遍的速度提升。部署有一個獨立的選擇未合并的適配器有助于檢查點交換而合并模型在導出前移除了適配器分支恢復了基礎模型的算子路徑補充表6。因此我們分別報告VRAM、掛鐘時間以及合并/未合并行為并將 REFUSE → Full-SFT 視為適配器風險過高時的有效結果。4.4 消融研究規劃器約束的有效性。我們在YOLO12s上分離了各個規劃器組件對性能的貢獻。如補充表11詳述無約束的樸素基線達到0.6900 mAP50-95。引入算子有效性過濾以排除深度可分離卷積和歸一化層將準確率提升至0.7094。結合檢測頭語義排除帶來了最大的穩定性提升將性能推至0.7307 mAP這支持語義保護是穩定性驅動因素而不僅僅是工程安全措施。謂詞級診斷。表5將可應用的約束與僅存在于規則集中的約束區分開來。在YOLO12s上開放注意力流規則接納了32個模塊并使平均適配器梯度范數提高了1.581倍開放類型化頭部規則接納了18個模塊提高了1.091倍。兩次短期運行均未產生非有限梯度因此證據支持的是優化壓力的改變而非必然的崩潰。相反深度可分離卷積謂詞在任一審計圖上均未接納額外的秩-4目標因此在此不能歸因于訓練效果。單個DFL投影、12個可變形采樣/注意力權重層和28個RT-DETR分數/邊界框輸出層仍然是反事實候選它們的固定區間、采樣幾何或輸出偏置語義使得直接插入成為一個不同的干預措施而非普通的留一法開關。安全放置下的下游解碼器漂移。我們將一個RT-DETR-L VOC檢查點與激活的安全適配器狀態和適配器參數置零的同一檢查點進行比較。通過支持的預測器路徑16張固定的VOC2007圖像產生有限的 300×6300×6 輸出。解碼器模塊中的相對 ?2?2? 漂移為 0.553±0.099MSDeformAttn 中為 0.530±0.103邊界框頭中為 0.613±0.100分數頭中為 0.127±0.033最終輸出漂移為 0.548±0.094中位數0.571P90 0.611。因此安全的上游適配會傳播到凍結的解碼器但這些16張圖像、1% 訓練量的診斷并不能驗證不安全的解碼器插入。圖4. 論文測量的受控YOLO11系統審計。相對于Full-SFTLoRA將峰值VRAM從28.57 GB降至16.03 GB43.9%但訓練時間從118.2秒增至203.8秒1.72倍所有顯示的PEFT變體都比Full-SFT慢。表6. 受控YOLO11s和YOLO12s檢查點的MPS部署審計。A 部署與導出審計以下圖表和冒煙測試表記錄了七頁主論文中省略的受控部署審計和合并/未合并導出檢查。ONNX/TensorRT 驗證協議。未合并和合并的計算圖均在 opset 18 下通過了 ONNX 檢查器驗證支持靜態形狀 [1, 3, 640, 640] 以及動態批次、高度和寬度軸ONNX Runtime CPU 執行顯示相對于 PyTorch 的最大絕對誤差低于 1.24×10?3。TensorRT 引擎在 FP32 和 FP16 下構建并執行使用動態優化配置驗證了數值一致性、內存、吞吐量和延遲。B 回退手動 Conv2d 后端的合并等價性B.1 作為 im2col 矩陣乘法的密集卷積B.2 分組卷積和每組秩分配B.3 命題1的證明B.4 數值容差與實現說明上述證明涵蓋了普通的回退 Conv2d LoRA 路徑。RS-LoRA 和 PEFT 管理的變體委托給 PEFT 運行時少樣本和自適應回退變體需要在應用相同的合并模式之前解析秩掩碼。合并和未合并路徑僅在操作順序上有所不同展開 批量矩陣乘法 對比 在合并權重上的單次卷積輸出在標準浮點容差內被視為等價。合并正確性在包裝器移除后進行驗證而非之前。等價性在部署/評估模式下成立此時適配器丟棄被禁用。C 后端路由與 PEFT 管理變體C.1 后端選擇規則PEFT 后端是 LoRA、RS-LoRA、DoRA、LoHa、LoKr、AdaLoRA、IA3、OFT、BOFT 和 HRA 的默認路由。回退手動后端有意設計得更為狹窄它僅在 PEFT 不可用、被顯式繞過或請求回退路徑時用于普通的 Conv2d LoRA 包裝。量化路徑委托給 PEFT 后端因為量化集成是后端特定的。C.2 量化與包裝必需的路徑需要包裝的訓練狀態不被視為導出兼容的產物。如果包裝器無法合并為普通的 YOLO 模塊或由 PEFT 管理的導出路徑處理契約層將拒絕導出。C.3 導出策略僅當結果模型滿足方法中聲明的運行時不變量時才允許導出基礎檢查點加載不變、僅適配器檢查點、合并后的普通 YOLO 模塊結構以及 ONNX/TensorRT 工具鏈的導出兼容模塊。PEFT 管理的適配器僅在 PEFT 合并路徑成功或契約驗證了等效的非包裝模塊結構后才被視為導出兼容。D 運行時元數據模式D.1 JSON 字段當前實現持久化運行時元數據而非完整的加密清單。PEFT 路徑將runtime_metadata.json與 PEFT 的save_pretrained產物一起寫入回退路徑寫入fallback_meta.json和回退權重文件。記錄的字段包括后端、變體、凍結BN設置、頭部包含設置、目標模塊以及后端特定的運行時元數據。D.2 兼容性檢查在加載時YOLO-PEFT 使用此元數據來選擇 PEFT 或回退加載器并驗證請求的后端和目標配置與保存的適配器一致。完整的基礎檢查點、模型YAML、類別名稱和架構哈希檢查是部署時的擴展而非當前硬性檢查要求。表S2. 圖2的數值對比。結果來自320分辨率的診斷矩陣。Full-SFT行報告基準 mAP0.5:0.95所有其他行報告 Δ。紅色條目為災難性 (Δ?0.05)。對于崩潰的RT-DETR-L運行Δ?0.600 表示用于可視化的截斷失敗值。此整個矩陣是種子0的診斷掃描它不是多種子聚合。主文中報告的種子28/42重跑是作為核心基線和選定規劃器配置的穩健性檢查。表8. ΔmAP 排名的成對 Kendalls ττ。CNN內部對YOLOv8n vs. YOLO11n是唯一 p0.05 的對所有其他對 p0.3。D.3 失敗模式元數據檢查可防止后端/路徑混淆和回退權重缺失。更強的圖、類別詞匯表和導出運行時不匹配檢查需要前文所述的完整部署時清單擴展。E PEFT 矩陣詳情完整的核心WB測量矩陣在主文表1中報告。為避免重復該表本附錄提供圖2的數值對應物和成對等級一致性診斷。E.1 圖2的數值對應物表S2報告了對應于熱圖的緊湊 ΔmAP 視圖。它將Full-SFT基準與PEFT增量分開并標記了災難性單元格。E.2 成對等級一致性表S3量化了補充縮放規律圖中可見的排名反轉模式。CNN內部比較是唯一強正相關的對跨越到注意力密集、文本融合或Transformer解碼器檢測器時變體排名會減弱或逆轉。表S4. 主文架構覆蓋討論背后的檢測器家族覆蓋范圍。CNN主干共享報告的LoRA衰減接受區間非CNN行保留主文中顯式的狀態。表10. 消融A1樸素替換與契約管理替換LoRA r16RS-LoRAYOLO11s on VOC核心600周期上限/640分辨率協議。F 完整的檢測器家族覆蓋表主文在其架構覆蓋討論中報告了聚合的檢測器家族覆蓋率。表S4列舉了支撐該聚合的十一個主干并未添加超出報告家族狀態的每個主干測量結果。F.1 完整的檢測器家族覆蓋此處單獨列出了密切相關的CNN家族檢測器而主文將其報告為單一架構類。所有CNN家族行共享報告的LoRA衰減接受區間。G 詳細消融研究G.1 A1. 樸素替換 vs. 契約管理替換YOLO-PEFT 中的兩個后端都使用模塊替換B2 的手動 Conv2d 后端B1 的 PEFT 管理包裝器問題是周圍的契約管理是否對部署兼容性必不可少。表S5比較了樸素基線與完整契約層。ONNX/TRT/Ckpt 表示訓練后的模型是否可以保存、重新加載、合并和導出而無需手動圖手術。G.2 A2. 規劃器組件消融表S6在YOLO12s上對規劃器的每個約束進行了消融。該序列依次分離了算子有效性、檢測頭語義過濾和預算剪枝的貢獻。預算匹配選擇器診斷。作為一項獨立的工程檢查我們在相同的秩-4適配器預算31,104個參數下比較了四種目標選擇規則。每次運行在相同的 2% VOC0712 子集上使用一個周期以及固定的160張圖像驗證子集種子為0、28和42。表12報告了三次運行的總均值和標準差。此協議檢查預算核算和可執行目標選擇但其短周期并非核心訓練協議不得解釋為性能排名。表11. 消融A2YOLO12s上的規劃器約束VOCLoRA r16α32RS-LoRA啟用核心600周期上限/640分辨率協議。表12. 預算匹配的YOLO12s選擇器MPS診斷。所有行使用31,104個適配器參數由于模塊形狀不同目標數量可能不同。數值為三個種子的均值 ± 總體標準差。表13. 消融A3YOLO12s上的秩敏感性VOC核心600周期上限/640分辨率協議。基準Full-SFT0.6662 mAP50:959.26M總參數。參數量列包括凍結的基礎模型推理GFLOPs在合并后測量。表14. 消融A4規劃器選擇放置下的變體掃描r16α32RS-LoRA啟用官方VOC2007測試集核心600周期上限/640分辨率協議。四個 mAP50:95 均值相差在0.0034以內而其標準差在0.0093-0.0267之間。此外梯度 top-k 在種子0時領先而 backbone-only 在種子28和42時領先。因此該診斷未提供在此周期內宣布普遍更優選擇器的證據主協議比較需要更長的訓練并應保留相同的預算和多種子控制。G.3 A3. 秩敏感性此消融測試規劃器的默認秩是否是一個脆弱的選定值。掃描顯示隨秩增加呈單調增益同時確認 r16 是一個實用的總參數權衡點。G.4 A4. 固定放置下的變體掃描此消融固定規劃器放置僅改變局部的PEFT更新規則。在YOLO11s和YOLO12s上的排名變化支持了架構條件變體選擇的主張。G.5 A5. RS-LoRA 和 DoRA 交互作用此雙因素消融檢查訓練崩潰是由變體標簽本身引起的還是由交互的訓練側先驗引起的。只有無RS-LoRA的DoRA角落越過了災難閾值。表15. 消融A5YOLO12s上的RS-LoRA × DoRA 2×2 因子設計VOCLoRA r16α32核心600周期上限/640分辨率協議。G.6 A7. LM繼承排名 vs. 結構感知放置此消融直接測試從語言模型繼承的PEFT排名是否遷移到異構檢測器。結構感知計劃使用相同的主干和訓練預算但從檢測器計算圖中選擇變體和目標。表16. 消融A7LM繼承排名與結構感知計劃。數字來自WB在官方VOC2007測試集上的導出r16α32核心600周期上限/640分辨率協議。增益是相同主干上結構感知計劃與LM繼承計劃之間的差異。崩潰計數來自獨立的300周期/320分辨率診斷矩陣并激發了范圍內的保護措施它不是一個獨立的未見過架構結果。H 復現說明實驗使用官方的 Ultralytics VOC 映射訓練 YAML 鍵包含images/train2007、images/val2007、images/train2012和images/val2012而兩個評估鍵均解析為images/test2007。因此歷史記錄中的 WB 字段val2007是 VOC2007 測試集評估的別名而非訓練中包含的 VOC2007 驗證目錄。報告的核心結果中未使用隨機或少樣本劃分。核心 WB 運行將圖像調整為 640擴展診斷矩陣使用 320核心 WB 運行使用 600 周期上限而診斷矩陣使用 300 周期除非另有說明。對于核心 WB 運行optimizer-auto解析為 SGD初始學習率 0.01動量 0.9權重衰減為 5×10?4啟用余弦調度Mosaic 在最后十個周期關閉早停耐心值為 100。每種方法均以相同的節奏進行評估且相同的最佳檢查點規則提供報告的分數。因此早停不會帶來方法特定的選擇優勢它是共享的官方訓練協議的一部分。由于 VOC2007 測試集參與此通用的檢查點選擇協議我們使用它來支持受控的相對比較并不將絕對分數呈現為一次性的盲測估計。此模型選擇問題與訓練數據泄漏不同表17驗證了訓練/評估圖像ID交集為零。除非明確掃描適配器使用秩16、α32、丟棄率0.05、啟用RS-LoRA縮放并禁用DoRA的幅度分支。運行使用一致的加速器啟用訓練環境和固定軟件棧導出的WB表格包括主干、變體、秩、alpha、縮放模式、可訓練參數、mAP、內存和適配器大小字段。Full-SFT、標準LoRA、Planner-LoRA、最佳PEFT和樸素放置除了種子0外還有種子28和42的重跑。主文保留種子0以緊湊地呈現完整矩陣每次運行的日志保留相應的三種子記錄。所有上述s-scale規劃器、秩、變體和訓練先驗消融均使用核心600周期上限/640分辨率協議。秩8是未校準的YOLO12請求的保守回退而顯式的 r∈{8,16,32} 掃描則在已識別的YOLO12配置文件上評估預算批準的秩。表17. VOC劃分審計。ID直接從官方的ImageSets/Main/*.txt文件中獲取并在每個ID前加上其來源年份后進行比對。表18. 選定核心比較的三種子穩健性審計。統計量在種子 {0,28,42} 上的每個配置內計算它是穩健性摘要非顯著性測試。MPS部署審計存儲在artifacts/deployment_mps_v2/下的JSON文件中它記錄了合并和未合并的參數計數、GFLOPs、同步延遲、吞吐量、分配器遙測、ONNX opset/形狀/誤差檢查以及加速器-主機TensorRT引擎驗證記錄。效率核算范圍。本文僅報告受控的YOLO11審計LoRA相對于Full-SFT峰值VRAM降低了 43.9%43.9%16.03 GB 對比 28.57 GB但訓練時間長了 1.72×203.8秒 對比 118.2秒。外部存儲、分發和外部來源的內存估計被排除在聲明之外。