22号直播丨优化模型训推算子性能:昇腾 AutoFuse 算子自动融合技术直播来袭 优化模型训推算子性能昇腾 AutoFuse 算子自动融合技术直播来袭直播预约链接预约链接当下生成式大模型、推荐模型和多模态模型等各类AI模型迭代速度持续加快在线下训练、线上推理全场景中普遍存在共通的性能短板主要分为三点1.算子数量庞大计算图中分布着大量算子单次开销不一定很大累积起来却不容忽视2.算子组合多变同一模型不同版本的数据流链路、算子排布持续变化依靠固化规则的传统融合方案难以全覆盖3.适配场景广泛各类网络结构、动态张量尺寸、多精度计算场景均存在融合优化需求。面对以上行业痛点人工手写算子、固定规则融合等传统优化方式既无法从根源消除性能损耗也跟不上模型快速迭代的节奏行业亟需一套有效的自动化优化方案。昇腾 CANN AutoFuse 自动融合技术应运而生精准解决这一核心难题算力浪费的底层根源拆解模型训推链路中Add、Mul、Relu和Cast 等大量计算算子紧密串联。若每个算子单独调度、独立完成数据搬运会衍生出两类显著性能损耗1.内存搬运开销巨大每个算子都要经历「全局内存加载→片上运算→结果 写回 GM」的完整流程2.调度开销持续累积NPU 在频繁的算子切换中浪费了大量硬件周期。想象一条生产线产品经过第一道工序后如果每次都要先入库再从仓库取出交给下一道工序工序之间就会增加大量不必要的搬运。更高效的方式是让产品沿生产线直接流转在相邻工序之间连续加工。这就是算子融合的核心思想——让多个算子在一次计算流程中连续执行减少中间结果反复写回和读取全局内存的搬运。融合前后对比 AutoFuse让 NPU 减少不必要的调度和内存搬运如上图所示融合前每个算子独立调度中间结果需要反复写回并重新读取全局内存融合后多个算子合并为一个融合算子中间结果在片上流转仅在首尾进行数据搬运从而减少调度与访存开销。以单输入和单输出算子为例展现优化数据优化维度融合前融合后算子数量N 个1 个MTE 搬运次数2N次每个算子有一次[搬入搬出]2 次一次[搬入搬出]调度开销N 次1 次中间数据N-1 处中间结果写回并重读 GM片上直传 现在就开始·仓库地址graph-autofusion:基于昇腾芯片的自动融合加速组件项目 - AtomGit·官方文档CANN AutoFuse 官方文档来直播间一起解锁 AutoFuse 的全部潜力graph-autofusion:基于昇腾芯片的自动融合加速组件项目 - AtomGit来直播间一起解锁 AutoFuse 的全部潜力直播预约链接预约链接