
针对检测、分割、姿态估计、分类和定向检测的特定任务头。在五个检测尺度上YOLO26 在 COCO 上达到了 40.9-57.5 mAP且 T4 TensorRT 延迟仅为 1.7-11.8 毫秒。与 YOLO11n 相比YOLO26n 在 Intel Xeon CPU 2.00 GHz 上的 CPU ONNX 推理速度提升了高达 43%。imageYOLO26 模型系列围绕四个设计领域构建原生端到端推理 默认的一对一检测头无需非极大值抑制NMS即可生成预测简化了部署并减少了后处理工作。更轻量的框回归 YOLO26 移除了分布焦点损失DFL在保持无约束回归范围的同时降低了检测头的复杂度。训练配方更新 训练流水线结合了 MuSGD、Progressive Loss 和 STAL旨在改进优化将监督重点转向推理时的头部并保持对小目标的正面标签覆盖。特定任务的头部和损失函数 YOLO26 增加了针对实例分割、语义分割变体、姿态估计和定向检测的专项设计同时在不同任务间保持统一的模型流水线。总而言之这些更新优化了各模型尺度和部署目标在准确率与延迟之间的权衡。yolo26 的创新点架构简化移除分布焦点损失DFL简化边界框回归提升导出兼容性。端到端推理采用无NMS设计直接输出检测结果降低延迟与部署复杂度。训练增强引入渐进损失平衡ProgLoss与小目标感知标签分配STAL提升小目标检测稳定性。优化器创新使用MuSGD优化器结合SGD与Muon优势加速模型收敛。多任务支持统一框架支持检测、实例分割、姿态估计、定向检测与分类。边缘优化支持FP16/INT8量化在Jetson等设备上实现低延迟实时推理。性能表现在COCO等基准上达到高精度CPU推理速度较前代提升最高43%imageyolo26 的网络结构简化可以表示为imageyolo26 在保证yolo系列标准框架下做出了一些列创新优化。yolo系列的网格划分三个预测分支每个网格一个预测结果等这些基础逻辑都没有变化。和之前版本的网络结构有所不同的是yolo26中head存在两个用于无NMS的实现。两者的功能会在后续详细介绍。imageBackbone 主干特征提取与YOLOv11近似输入图像 → 多层CBS卷积 C3k2残差块 SPPF C2PSA自注意力输出3个多尺度特征图P3stride880×80小目标浅层特征P4stride1640×40中等目标P5stride3220×20大目标深层语义2. Neck 颈部FPNPAN多尺度融合自上而下上采样融合高层语义自下而上下采样融合底层定位最终输出融合后的P3/P4/P5送入检测头主干、neck在O2M/O2O间完全共享权重。Detect Head核心创新双分支并行输出三层特征图分别送入两组独立解耦头One2Many一对多分支传统稠密预测头仅训练使用网络结构上类似于yolov8包括输入输出One2One一对一分支端到端无NMS头训练推理默认主分支两者卷积结构一致但权重不共享且O2O分支梯度会做detach避免稀疏监督破坏主干特征学习。4. 关键结构改动彻底移除DFLBox分支直接输出x/y/w/h4维坐标无分布Softmax计算轻量化、量化友好。一、前向传播图像 — Backbone Neck得到共享P3/P4/P5多尺度特征O2M一对多分支直接用原始特征做预测imageO2O一对一分支对输入特征先执行截断梯度影响反向传播再做预测image二、损失计算Loss计算两者都参与ProgLoss动态加权求和O2M LossTAL一对多匹配损失O2O LossSTAL一对一匹配损失 重复框一致性惩罚损失总的损失:::infoLoss w_o2m * Loss_o2m w_o2o * Loss_o2o:::其中 w_o2m 和 w_o2o 是权重调节参数训练前期w_o2m0.8后期逐步降到0.1w_o2o同步从0.2升到0.9。三、反向传播O2M梯度完整回传 Backbone / Neck / O2M 全部网络结构O2M无detach截断它的损失梯度一路向前传播全部主干、颈部网络权重由O2M梯度主导更新保证充足稠密监督避免稀疏梯度震荡。O2O梯度仅更新O2O自身卷积头不会回传到Backbone/Neck因为输入特征做了detach()梯度到此截断O2O分支只能更新自己专属的分类/框卷积完全不参与主干网络参数更新。总结训练梯度imageBackbone、Neck 只靠 O2M 的梯度更新O2M头、O2O头各自用自身分支梯度独立更新。O2O 相较于O2M最大的特点是再反向传播时做了阻隔O2O 分支前面加了 detach()imagedetach() 相当于在这里砌了一堵墙O2O Head 自己的权重可以改但 O2O 的误差传不过去 Backbone 和 NeckBackbone、Neck 完全不受 O2O 分支影响。这就叫截断 O2O 分支对主干网络的梯度传播。目的是让O2O 只改自己的头不改前面的特征提取部分。为什么要这么做核心原因O2O 是一对一稀疏监督一张图只有几十个正样本梯度很少、很不稳定。如果让它去改主干Backbone 会学偏、学震荡、收敛很差O2M 是一对多稠密监督正样本多梯度稳适合训练主干。O2M前期负责稳定特征的学习O2O后期负责无NMS的特征学习。推理流程在输入尺寸为 640 * 640 时3个检测头输出特征图为20 * 2040 * 4080 * 80每一个网格输出一个预测结果总计 8400 个结果全图8400个网格预测全部候选全局按置信度 TopK 筛选前300个最高分网格max_det300人为上限平衡速度与稠密场景承载输出固定张量[B,300,nc4]不存在同物体重复预测框仅需置信度阈值过滤低分占位框全程无IoU计算、无NMS。导出训练完成后、推理/导出阶段行为模型导出ONNX/TensorRT等部署文件、执行model.fuse()推理优化时自动裁剪、永久移除O2M整个分支只保留O2O一对一推理头推理前向仅走BackboneNeck → O2O头 → 全局TopK取前300 → 输出[B,300,nc4]仅需置信度过滤全程无NMS若手动设置end2endFalse推理才启用O2M分支需要NMS后处理。训推完整流程训练阶段O2M、O2O双分支同时前向两者损失加权求和参与反向传播仅O2M梯度回传更新Backbone与NeckO2O梯度仅更新自身检测头训练导出模型时自动移除O2M分支推理全程只使用O2O一对一检测头。STAL 全称Small-Target-Aware Label Assignment 小目标感知标签分配训练阶段核心无推理逻辑传统TAL固定IoU阈值匹配极小物体易丢失正样本8像素以内小GT锚点很难落在框内、IoU极低直接被划为背景全程无监督导致严重漏检。动态自适应IoU阈值物体尺寸越小匹配IoU门槛自动降低大目标维持高IoU保证匹配精准度。强制小目标候选扩容极小GT强制分配至少4个候选锚点仅允许在浅层P38倍下采样匹配锁定小目标最优特征层临时扩张GT搜索范围避免锚点完全脱离目标。可参考https://blog.csdn.net/qq_39697468/article/details/161798744双层TopK一对一冲突消解支撑无NMS的关键○ 第一层每个GT选出代价最低7个候选网格○ 第二层全局匈牙利二分图冲突消解保证1个GT仅分配1个最优网格作为正样本1个网格最多归属1个GT无NMS的关键○ 所有重叠候选网格全部标记为背景训练持续压低其置信度从根源杜绝“同一物体多个高分框image小目标损失加权微小物体分类损失权重放大强制模型重点学习微小特征。作用定位● 只为One-to-One一对一检测头提供合规训练标签● 兼顾无NMS所需的一对一匹配约束 小目标防漏检双重目标● 推理阶段不参与计算仅影响模型收敛权重。采用One-to-Many一对多头8400网格每个GT匹配多个锚点输出大量重叠重复框必须依赖NMS后处理存在延迟波动、IoU阈值调参、嵌入式部署需额外后处理代码、DFL算子量化报错等问题。双头协同训练推理仅启用One-to-One分支One2Many兼容分支多匹配提供充足监督保障主干特征精度One2One推理主分支配合STAL一对一标签分配训练时叠加重复框一致性损失惩罚重叠双高分预测让模型自发只保留单个高分框推理丢弃O2M分支仅使用O2O输出。彻底移除DFL分布回归直接xywh坐标回归消除大量Softmax计算降低算力解决嵌入式量化、导出算子不兼容问题。推理流程无NMS核心逻辑全图8400个网格预测全部候选全局按置信度TopK筛选前300个最高分网格max_det300人为上限平衡速度与稠密场景承载输出固定张量[B,300,nc4]不存在同物体重复预测框仅需置信度阈值过滤低分占位框全程无IoU计算、无NMS。核心优势推理延迟恒定无波动CPU速度最高提升43%ONNX/TensorRT/CoreML导出纯网络图无自定义后处理算子无需调优NMS IoU阈值工业部署门槛大幅降低输出稀疏唯一框稠密计数、机器人实时控制场景更稳定。STAL 与 无NMS检测头 协同关系关键联动逻辑STAL是无NMS成立的底层训练基础若无STAL一对一分配规则训练会出现一个GT对应多个正样本模型推理必然输出大量重叠高分框仅靠推理TopK无法消除重复必须加NMS。无NMS检测头为STAL提供专属输出通道O2O头网络结构适配STAL一对一标签配套一致性损失辅助STAL约束重叠网格置信度。分工边界STAL训练阶段标签匹配规则负责“一个物体只给一个网格监督”解决小目标匹配失效无NMS检测头网络结构推理管线负责训练双分支协同、推理截断输出、移除DFL、全程不用NMS。极简一句话总结STAL是面向小目标优化的一对一动态标签分配算法训练时强制一GT一网格、压低重叠网格置信原生端到端无NMS检测头是重构后的检测头结构与推理管线配合STAL训练出无重复预测的模型推理仅做全局TopK置信度过滤彻底抛弃NMS后处理同时移除DFL轻量化回归。Backbone 主干特征提取与YOLOv11近似输入图像 → 多层CBS卷积 C3k2残差块 SPPF C2PSA自注意力输出3个多尺度特征图P3stride880×80小目标浅层特征P4stride1640×40中等目标P5stride3220×20大目标深层语义2. Neck 颈部FPNPAN多尺度融合自上而下上采样融合高层语义自下而上下采样融合底层定位最终输出融合后的P3/P4/P5送入检测头主干、neck在O2M/O2O间完全共享权重。Detect Head核心创新双分支并行输出三层特征图分别送入两组独立解耦头One2Many一对多分支传统稠密预测头仅训练使用One2One一对一分支端到端无NMS头训练推理默认主分支两者卷积结构一致但权重不共享且O2O分支梯度会做detach避免稀疏监督破坏主干特征学习。4. 关键结构改动彻底移除DFLBox分支直接输出x/y/w/h4维坐标无分布Softmax计算轻量化、量化友好。输出张量形态三层网格总数80×80 40×40 20×20 8400个网格点输出shape[B, nc4, 8400]每个网格均可预测物体。匹配规则TAL宽松多匹配每个GT目标可匹配多个网格作为正样本tal_topk10一个物体对应数十个重叠预测框。作用定位仅训练辅助稠密监督大量正样本提供充足梯度保证主干、neck特征提取稳定避免O2O稀疏监督训练震荡ProgLoss动态权重训练前期O2M损失权重高0.8主导模型学习基础特征后期权重线性衰减至0.1推理时若手动开启end2endFalse需搭配NMS后处理去除大量重复重叠框延迟高、嵌入式部署复杂。优缺点✅ 训练收敛稳、基础特征质量高❌ 输出海量重复框必须NMS推理延迟波动大导出易存在DFL量化bug。损失计算对于单个检测分支YOLO26 并不是只剩下“一个 Box Loss 一个分类损失”。更准确的结构是CIoU Box Loss BCE Classification Loss L1 Direct Regression Loss可以写为其中CIoU Loss关注整体框重叠、中心距离、宽高比例BCE Classification Loss分类损失L1 Loss直接约束 Anchor Point 到四条边的回归误差训练配套STAL标签分配无NMS成立的底层基础双层TopK一对一冲突消解每层GT先筛选代价最小7个候选网格全局二分匹配强制1个GT仅分配1个最优网格、1个网格最多归属1个GT其余重叠网格全部标记背景训练持续压低其置信度叠加重复框一致性损失惩罚同一物体多高分预测。推理流水线端到端无NMS原始8400网格全部预测boxcls分数全局TopK筛选按类别置信度排序只保留分数最高前300个网格max_det300人为硬上限输出固定张量[B, 300, nc4]仅需置信度阈值过滤低分占位框全程不计算IoU、无NMS。输出与约束张量固定300条条目绝大多数是置信度接近0的背景占位框训练约束保证有效高分框无重叠、不重复对应同一物体单帧画面物体超过300个会出现截断漏检ONNX/TensorRT导出纯网络图无自定义后处理算子CPU/嵌入式速度提升30%~43%。优缺点✅ 无需NMS、推理延迟恒定、部署极简、小目标精度经STAL优化大幅提升❌ 纯O2O单独训练易震荡必须搭配O2M双分支联合训练。维度 One2Many一对多 One2One一对一使用阶段 仅训练辅助推理默认关闭 训练推理主分支end2end默认开启标签分配 TAL1GT匹配多个网格 STAL1GT仅匹配1个最优网格原始输出 8400个稠密网格预测 8400网格→全局TopK截断至300条输出shape [B, nc4, 8400] [B, 300, nc4]后处理要求 必须NMS去重 仅conf阈值过滤无NMSDFL 早期兼容DFLYOLO26全部移除 无DFL直接xywh回归训练权重 前期主导权重线性衰减 后期主导收敛精准匹配部署优势 传统YOLO兼容精度略高 速度更快、量化稳定、工业实时友好图像输入→BackboneNeck提取共享多尺度特征特征同时送入O2M、O2O两组独立检测头并行预测损失融合ProgLoss前期大权重O2M稳定特征学习后期大权重O2O拟合一对一无NMS预测逻辑训练完成后导出模型会裁剪移除O2M分支推理仅保留O2O端到端管线若需传统NMS推理可代码手动启用O2M分支验证。YOLO26在共用主干与特征融合网络的基础上设计O2M稠密监督O2O一对一精准预测双检测头O2M负责提供充足梯度保证训练稳定O2O配合STAL一对一标签分配实现推理无NMS、轻量化部署二者联合训练兼顾收敛速度与端侧推理性能。ProgLoss Progressive Loss Balancing 渐进式损失平衡专门配套 YOLO26 O2MO2O 双分支训练随训练轮次线性动态调整 O2M、O2O 两支损失的权重占比总权重恒等于1遵循「先粗后精」学习逻辑解决固定权重带来的训练震荡、梯度冲突问题。训练初始epoch0wo2m0.8wo2o0.2总损失Losstotal0.8⋅LossO2M0.2⋅LossO2O全程线性渐变随训练进度均匀衰减直到训练结束训练末尾最后epochwo2m0.1wo2o0.9总损失Losstotal0.1⋅LossO2M0.9⋅LossO2O约束wo2mwo2o1总损失量级稳定不会剧烈跳变阶段1训练前期O2M权重高占80%网络刚初始化特征完全随机框预测乱飞、分类不准O2M是一对多稠密监督一张图数千个正样本梯度充足、稳定主干Backbone/Neck仅靠O2M梯度更新高权重O2M主导训练快速学会“图里哪里存在物体”召回率快速提升搭建基础多尺度特征提取能力O2O权重仅20%且O2O梯度被detach()截断不干扰主干学习仅微调自身一对一检测头。阶段2训练中期权重平滑过渡物体大致位置已经能检出逐步降低O2M话语权、抬高O2O权重模型开始学习STAL一对一匹配规则同一个物体只输出单个高分框抑制重叠重复预测。阶段3训练后期O2O权重高达90%主干特征已经收敛、物体定位基本准确权重重心完全转向O2O分支强制模型贴合 推理时真实使用的一对一无NMS逻辑重点优化STAL一对一匹配精度重复框一致性损失压低重叠网格置信小目标精准分类与定位O2M仅保留10%权重做轻微约束防止模型完全遗忘基础稠密匹配能力。固定权重双分支梯度冲突若全程各50%权重前期O2O稀疏梯度噪声大会拖累主干收敛后期O2M一对多重复框监督干扰无NMS一对一预测效果。O2O单独训练极易震荡O2O一对一匹配每张图只有几十个正样本梯度稀疏不稳定ProgLoss前期靠O2M稠密梯度兜底保证训练平稳。训练与推理行为不一致推理只使用O2O若全程权重均衡模型没有足够动力学习“单物体单预测框”推理容易出现大量重叠高分框必须依赖NMS。ProgLoss后期加大O2O权重让训练逻辑和推理逻辑完全对齐。ProgLoss 控制两支损失对总loss的贡献大小权重调度detach() 控制梯度能否回传主干O2M梯度完整回传BackboneProgLoss前期高权重主导主干更新O2O梯度被截断只能更新自身检测头仅靠ProgLoss后期高权重精调一对一预测能力二者组合实现完美分工O2M负责训练主干特征O2O负责训练推理输出规则ProgLoss动态分配两者的训练优先级。ProgLoss 是YOLO26双分支训练的动态权重调度器前期加重O2M稠密监督稳定主干特征后期加重O2O一对一监督对齐无NMS推理行为配合detach梯度截断兼顾训练收敛稳定性与端到端推理精度。MuSGD Muon SGD 分层混合优化器是YOLO26专门为O2M/O2O双分支、多尺度、小目标检测设计的训练优化器借鉴LLM大模型Muon正交更新思路分层区分参数做差异化更新同时保留传统SGD优秀泛化能力解决SGD收敛慢、AdamW显存高、易过拟合、多尺度梯度震荡等痛点。:::infoMuonMomentUm Orthogonalized by Newton-Schulz优化器的核心在于它引入了一个全新的正交更新思路在每次更新时它不直接使用梯度或动量方向而是先将其掰正为一个近似的正交矩阵再用这个处理过的方向来更新权重。对深度学习而言直接对动量大矩阵进行SVD分解求极分解在计算上不可行。因此Muon采用了牛顿-舒尔茨Newton-SchulzNS迭代来高效地近似求解这个正交矩阵。这是一种仅包含矩阵-矩阵乘法的迭代方法非常适合在GPU上运行:::传统SGD(momentum)泛化能力强、显存占用低但收敛速度慢多尺度特征、稀疏O2O监督场景梯度波动大、损失震荡严重小数据集极易陷入局部最优。AdamW自适应学习率、收敛快但需要维护一阶二阶动量显存占用翻倍容易过拟合量化部署后精度衰减明显检测任务分类/框回归梯度尺度差异大时更新失衡。双分支训练特殊矛盾YOLO26同时存在稠密O2M、稀疏O2O两套损失梯度尺度差异巨大单一优化器很难同时稳定主干与一对一检测头训练。MuSGD对模型不同维度参数分开处理一套网络同时使用两套更新逻辑二维矩阵参数Conv/Linear权重ndim≥2→** Muon正交更新**卷积层、全连接层权重是二维矩阵采用Muon算法更新先计算动量累积梯度同SGD动量使用牛顿-舒尔茨(Newton-Schulz)快速近似正交化动量更新矩阵无需昂贵SVD分解计算开销仅1%左右正交化作用抹平梯度奇异值差异让各个特征方向更新速度均等避免单一梯度方向主导训练最终用正交后的矩阵执行参数更新。一维向量参数Bias、BN、O2O/O2O头偏置ndim1→ 原生SGD动量更新偏置、归一化层等一维参数不做正交化直接使用标准带动量SGD更新保证轻量化、稳定基础偏移学习。梯度归一化稳定机制Muon底层保障对梯度做范数归一gnormg||g||ε统一不同层、分类/回归损失的梯度更新尺度抑制梯度爆炸/消失大幅降低多尺度、双分支训练的损失波动。收敛速度大幅提升正交化梯度消除更新方向失衡同等精度所需训练轮次减少约40%配合ProgLoss渐进权重调度前期O2M稠密监督快速拟合主干特征后期O2O稀疏监督平稳收敛一对一无NMS逻辑。显存开销远低于AdamWMuon仅维护一阶动量不需要存储二阶平方梯度整体显存占用接近普通SGD比AdamW节省近50%显存多卡、大batch训练更友好。兼顾收敛速度与泛化能力Muon正交更新解决SGD收敛慢、震荡问题底层更新基底是SGD无AdamW自适应学习率带来的过拟合倾向训练完成后模型量化INT8/FP16精度损失更小完美适配YOLO26端侧部署定位。完美适配YOLO26双分支训练O2M稠密梯度Muon正交化平滑海量网格梯度稳定Backbone/Neck主干更新O2O稀疏梯度detach截断、仅更新检测头梯度归一化避免稀疏梯度剧烈抖动一对一匹配训练更平稳搭配STAL小目标标签分配小目标梯度权重失衡问题显著缓解微小物体mAP提升明显。对比维度 SGD-Momentum AdamW MuSGDYOLO26梯度处理 原始动量梯度无归一化/正交 一阶二阶动量自适应缩放 二维权重Muon正交化一维参数SGD全局梯度归一显存占用 低仅一阶动量 高一阶二阶 低仅一阶动量≈SGD收敛速度 慢多尺度易震荡 快易过拟合 极快损失波动极小泛化能力 优秀 较差小数据集易过拟合 接近SGD泛化鲁棒量化后精度衰减 小 大 极小适配YOLO26双分支 梯度波动剧烈收敛不稳 显存压力大O2O稀疏梯度失衡 原生适配O2MO2O联合训练搭配ProgLoss渐进损失ProgLoss动态切换O2M/O2O损失权重MuSGD分层梯度归一化抵消两支梯度量级差避免权重切换时loss剧烈跳变。搭配STAL一对一标签分配O2O分支单图仅几十个正样本梯度极度稀疏MuSGD梯度归一化抑制稀疏梯度噪声保证一对一匹配稳定学习不会出现训练震荡。搭配detach梯度截断机制Backbone仅由O2M梯度更新Muon正交化平滑海量8400网格稠密梯度O2O梯度被截断MuSGD稳定检测头独立训练互不干扰。MuSGD是分层混合优化器卷积/全连接权重采用Muon矩阵正交化加速收敛偏置等一维参数使用标准SGD依靠梯度归一化抹平多尺度、双分支梯度差异兼具SGD低显存、强泛化与Muon快速收敛的优势专门适配YOLO26 O2M/O2O双分支、STAL一对一匹配的端到端无NMS训练流程。对yolo26的训练过程稍微总结一下前向传播图片输入经过backbone Neck分别进入 O2M 和 O2O 的Head中。O2M输出[B, nc4, 8400]O2O输出[B, 300, nc4]。标签匹配O2M 匹配标签可实现多对多匹配O2O 匹配标签实现一对一匹配