
很多大语言模型剪枝工作只证明了一件事但这还不能说明模型真的变快。因为在普通的密集矩阵乘法中即使权重为零硬件仍可能照常读取这些权重并执行计算。要让稀疏模型产生实际速度收益还需要稀疏存储格式、专用计算内核和对应的推理框架。《Sparse Fine-tuning for Inference Acceleration of Large Language Models》同时研究了两个问题第一如何在高稀疏率下恢复模型精度第二如何让这些零权重真正转化为CPU和GPU上的推理加速。论文给出的解决方案是先用SparseGPT产生稀疏模型再通过一种名为SquareHead的中间特征蒸馏方法进行稀疏微调最后使用支持稀疏计算的推理运行时部署模型。一、论文基本信息项目内容论文题目Sparse Fine-tuning for Inference Acceleration of Large Language Models作者Eldar Kurtic、Denis Kuznedelev、Elias Frantar、Michael Goin、Dan Alistarh首次公开2023年10月公开版本arXiv:2310.06927 v2主要方法SparseGPT剪枝、SquareHead蒸馏、稀疏微调主要模型T5-Small、Whisper-Small、MPT-7B论文链接arXiv论文页面 (arXiv)MPT官方代码IST-DASLab/SparseFinetuning (GitHub)T5和Whisper代码IST-DASLab/TACO4NLP (GitHub)该工作后来以扩展章节的形式收录在Springer 2025年出版的《Enhancing LLM Performance》中扩展版本增加了作者并提到Llama-2实验。下面的解读主要依据公开、可完整访问的2023年arXiv版本因为本文的原始实验、公式和代码都对应这一版本。(施普林格)二、论文要解决什么问题2.1 一次性剪枝在高稀疏率下容易损失精度SparseGPT已经证明可以利用少量校准数据一次性将大语言模型剪到较高稀疏率并通过局部二阶信息调整剩余权重。但随着稀疏率继续提高模型性能仍会下降。例如一个模型从稠密状态直接变成75%稀疏意味着每四个权重中只有一个保留下来。即使SparseGPT能够降低局部重构误差也很难保证模型已经适应如此剧烈的参数变化。一种自然的解决方案是剪枝后继续微调但论文发现普通任务损失并不足以稳定恢复高稀疏模型。高稀疏率下可能出现损失突然升高、训练发散、恢复不足以及对少量下游数据过拟合等问题。2.2 普通知识蒸馏也不一定足够标准知识蒸馏通常要求稀疏学生模型模仿稠密教师模型的最终输出分布。例如教师认为某个Token的概率为0.8学生模型也应尽量给出接近0.8的结果。这种输出层蒸馏能够约束最终预测但没有直接限制模型内部各层的表示。当高比例权重被删除后学生模型中间层可能已经严重偏离教师模型只在最后一层匹配输出未必能够恢复完整计算过程。因此作者进一步提出高稀疏模型不仅应该模仿教师的最终答案还应该模仿教师在每个Transformer层产生的中间表示。2.3 稀疏率不等于推理加速率假设一个模型有70%的权重为零这并不表示推理速度一定提高约3倍。真实速度还受到以下因素影响零权重是否以压缩格式存储稀疏索引本身是否带来额外开销推理内核是否能够跳过无效计算CPU或GPU是否支持目标稀疏模式模型处于计算受限还是内存带宽受限状态注意力、归一化、激活函数等非线性部分能否加速。论文因此没有止步于报告稀疏率和准确率而是进一步使用DeepSparse和自定义CUDA内核测量实际推理速度。(arXiv)三、核心思想整套方法可以概括为三个步骤稠密模型完成任务微调 → 使用SparseGPT产生稀疏模型 → 使用SquareHead蒸馏恢复稀疏模型其中稠密模型既是剪枝起点也是知识蒸馏教师SparseGPT负责选择需要删除的权重SquareHead负责让稀疏学生重新接近稠密教师的内部表示稀疏掩码在微调过程中保持固定被删除权重不会重新生长最终模型交给支持稀疏计算的CPU或GPU运行时执行。论文的重点并不在于重新设计剪枝准则而在于找到一种能够稳定恢复高稀疏模型的微调目标并证明稀疏性能够在真实推理运行时中转化为速度收益。四、完整方法流程4.1 先获得任务微调后的稠密教师论文处理的不是通用预训练模型精度保持问题而是面向特定下游任务的稀疏微调。例如T5针对英德机器翻译任务进行微调Whisper针对印地语语音识别任务进行微调MPT-7B针对GSM8K数学推理任务进行监督微调。稠密模型完成任务微调后被作为高精度教师模型。随后从这个模型出发进行剪枝。这一点非常重要。论文的目标不是让稀疏模型保持全部通用能力而是让它在一个指定任务上接近已经微调好的稠密模型。4.2 使用SparseGPT产生稀疏学生论文使用SparseGPT删除单独权重。SparseGPT不会改变线性层的输入和输出维度而是将部分权重设置为零同时根据局部二阶信息调整剩余权重尽量降低当前层输出误差。对于T5和Whisper作者按照逐渐增加的目标稀疏率多次执行剪枝和微调。论文测试的压缩率包括2倍、3倍、4倍一直到10倍对应的稀疏率大致为压缩率对应稀疏率2倍50%3倍约67%4倍75%5倍80%6倍约83%8倍87.5%10倍90%对于MPT-7B实验流程有所不同。作者直接使用SparseGPT一次性剪到40%、50%、60%、70%或80%然后再执行SquareHead微调而不是逐级剪到目标稀疏率。(arXiv)因此不能简单地将论文方法概括为统一的“迭代剪枝”。更准确地说论文研究的是SparseGPT剪枝后的稀疏微调其中T5和Whisper采用逐步增加稀疏率的流程MPT-7B采用一次剪到目标稀疏率后再恢复。4.3 固定稀疏掩码剪枝完成后如果正常训练全部参数已经被置零的权重可能因梯度更新重新变成非零值。论文的稀疏微调会固定剪枝掩码保留权重可以继续更新被删除权重始终保持为零微调过程不会改变目标稀疏率。官方MPT代码的训练入口专门支持固定稀疏掩码并实现了标准KL蒸馏和逐层SquareHead蒸馏。(GitHub)因此这里的稀疏微调本质上是在一个固定的稀疏子网络中重新优化仍然存活的权重。五、论文比较了哪些训练损失作者比较了三种恢复方式。方法训练目标普通微调只使用下游任务损失标准知识蒸馏任务损失加教师与学生输出分布差异SquareHead任务损失加教师与学生各层中间特征差异5.1 只使用任务损失最简单的方法是继续使用原任务训练目标。例如翻译模型继续优化目标翻译文本Whisper继续优化语音转录结果MPT继续优化GSM8K答案生成。但高稀疏率下模型已经受到较大参数扰动而下游数据通常较少。仅依赖任务标签可能产生两种问题训练数据无法提供足够监督模型不能恢复模型快速记住训练集训练误差下降但验证性能变差。作者在T5实验中观察到普通交叉熵训练在高稀疏率下会突然发散在Whisper实验中只使用任务损失的模型容易形成低熵、过度自信的预测。5.2 标准输出蒸馏标准蒸馏除了使用任务标签还要求学生模型模仿教师模型最终输出的概率分布。与只学习正确答案相比教师的完整输出分布还包含不同候选Token之间的相对关系因此可以提供更多监督。但是它只约束最终输出层。当前面多个Transformer层已经因剪枝发生较大偏移时单独匹配最终Logits并不一定足够稳定。论文实验显示标准蒸馏通常优于普通任务损失但在高稀疏率下仍可能出现明显性能下降或训练不稳定。六、SquareHead到底是什么6.1 不只匹配最终输出还匹配每一层特征SquareHead要求稀疏学生模型在每一个Transformer层都接近稠密教师模型。对于同一个输入教师和学生分别进行前向传播。程序取出它们对应层的隐藏特征然后计算均方误差。可以用纯文本表示为某层SquareHead损失 学生层特征与教师层特征的均方误差 ÷ 教师层特征自身的平均能量最后将所有层的特征损失相加并与原始任务损失共同优化总损失 任务损失 所有层的SquareHead特征损失论文默认将任务损失与SquareHead损失等权组合。6.2 为什么需要归一化不同Transformer层的激活尺度可能相差很大。假设某一层特征数值普遍在10左右另一层只有0.1左右。即使两层的相对误差相同第一层产生的普通均方误差也可能大得多。如果直接累加各层均方误差优化过程会被激活数值较大的层主导数值较小的层几乎得不到关注。SquareHead使用教师特征自身的能量进行归一化。这样比较的不是绝对误差而更接近于学生相对于教师偏离了多少比例。作者发现不进行这一归一化时部分模型会出现训练不稳定归一化后各层能够在更接近的尺度上共同参与优化。6.3 为什么叫SquareHead论文中的“Square”来自平方误差也就是L2或均方误差“Head”可以理解为在模型多个中间表示位置增加特征匹配监督。不过它并不是专门针对注意力头进行剪枝也不会删除完整Attention Head。它仍然是逐权重稀疏化只是在微调时对各层隐藏表示进行平方误差蒸馏。七、SquareHead为什么比普通微调稳定7.1 提供更密集的监督普通任务损失只在模型最终输出端提供反馈。SquareHead则在多个中间层同时约束学生模型。即使最终任务数据较少每个Token、每个隐藏维度和每一层都能产生特征匹配信号。因此稀疏模型得到的有效监督远多于只使用最终标签。7.2 限制剪枝误差逐层累积剪枝造成的误差会从前层传递到后层。如果不约束中间表示前面一层的小偏差经过多层传播后可能逐渐放大。SquareHead要求每一层重新靠近教师特征相当于在网络的多个位置设置“校准点”。这样可以减少学生模型在前几层偏离后一路累积到输出端的问题。7.3 降低对少量数据的过拟合作者对Whisper预测分布进行了熵分析。只使用交叉熵微调时稀疏模型的预测熵非常低说明模型变得过度自信。这通常意味着模型可能记住了有限训练样本但泛化能力较差。SquareHead蒸馏后的模型保持了更高的预测熵作者据此认为中间特征蒸馏具有一定正则化作用可以缓解高稀疏率和小数据共同导致的过拟合。八、为什么稀疏模型能够真正加速8.1 第一条路径跳过零权重计算最直观的稀疏加速方式是权重已经为零就不再执行对应的乘法。但对GPU而言细粒度非结构化稀疏会带来不规则内存访问和索引开销。若稀疏率不够高跳过乘法节省的时间可能不足以抵消稀疏管理成本。因此普通CUDA密集矩阵乘法不会因为权重中出现大量零而自动加速。8.2 第二条路径减少内存带宽论文强调了大语言模型推理中的另一个特点自回归生成经常受内存带宽限制。生成每个Token时模型都需要从内存中读取大量权重。尤其在小Batch解码阶段计算单元可能还没有被充分利用时间主要消耗在权重搬运上。如果只存储非零权重和稀疏索引就能减少从内存中读取的数据量。即使计算内核内部仍需要进行部分与零有关的操作只要避免从较慢的主存中加载完整密集权重仍可能获得速度收益。(arXiv)这意味着稀疏性对LLM推理的价值不只是减少乘法次数还包括减少权重存储量和内存传输量。8.3 CPU使用DeepSparse论文在CPU上使用DeepSparse推理引擎。DeepSparse针对稀疏神经网络实现了稀疏权重存储和稀疏计算内核可以在计算受限和内存带宽受限场景下利用零权重。T5、Whisper和MPT-7B的CPU端到端速度结果都在DeepSparse中测量。(arXiv)需要注意的是相关DeepSparse GitHub仓库已经在2025年6月被归档并设置为只读。因此论文代码仍然可查但现在复现实验时可能面临旧版依赖、安装方式和硬件兼容性问题。(GitHub)8.4 GPU使用规则N:M稀疏非结构化稀疏位置过于随机不利于GPU高并行执行。因此论文在GPU实验中使用规则分组稀疏例如2:4每连续4个权重中保留2个16:32每32个权重中保留16个16:64每64个权重中保留16个16:128每128个权重中保留16个。作者设计了自定义CUDA矩阵向量乘法内核用位掩码记录哪些权重需要参与计算。内核在共享内存中解压稀疏块并只处理有效位置。(arXiv)在NVIDIA A6000上的MPT-7B QKV投影矩阵实验中论文报告了稀疏内核相对于密集FP16内核的加速潜力。需要注意这部分主要是单层矩阵内核测试而不是完整MPT-7B在GPU上的端到端生成速度。九、实验设置应用模型任务数据集评价指标机器翻译T5-Small英语到德语翻译WMT14BLEU越高越好语音识别Whisper-Small印地语语音转文字Common Voice 11.0WER越低越好文本生成MPT-7B小学数学推理GSM8K测试准确率越高越好T5和Whisper实验使用SparseGPT逐级增加稀疏率并比较任务损失、标准知识蒸馏和SquareHead。CPU速度在AWS m7i.4xlarge的8核Intel Sapphire Rapids处理器上测量。MPT-7B则先完成GSM8K监督微调再一次性剪到目标稀疏率最后执行2个或4个Epoch的稀疏微调。MPT-7B实验使用批大小32学习率从3e-5、5e-5、8e-5和1e-4中搜索40%至60%稀疏模型训练2个Epoch70%和80%稀疏模型训练4个Epoch。十、T5机器翻译实验T5-Small在WMT14英德翻译任务上的结果如下。稀疏率BLEUCPU端到端加速0%25.911.00倍50%25.441.89倍67%25.042.12倍75%24.672.14倍80%24.572.16倍83%24.312.22倍86%24.112.25倍88%23.472.38倍90%23.102.42倍10.1 结果如何理解50%稀疏时BLEU只从25.91下降到25.44性能损失较小但端到端速度已经提高1.89倍。达到75%稀疏时BLEU为24.67比稠密模型低1.24但加速只有2.14倍而不是理论上的4倍。这说明模型中并不是所有计算都来自被剪枝的线性层。编码器和解码器中还包括注意力中的非矩阵操作SoftmaxLayerNorm激活函数数据调度和内存管理无法被稀疏内核加速的其他模块。稀疏率从75%继续增加到90%后速度从2.14倍提高到2.42倍收益开始趋于饱和但翻译质量继续下降。(arXiv)因此对T5而言约50%至75%稀疏是更合理的精度与速度折中区间。十一、Whisper语音识别实验Whisper-Small在印地语Common Voice数据集上的结果如下。WER越低越好。稀疏率WERCPU端到端加速0%32.571.00倍50%30.871.58倍67%31.852.15倍75%33.142.23倍80%34.692.35倍83%35.772.49倍86%37.332.52倍88%38.642.58倍90%40.602.67倍11.1 低稀疏率为什么反而优于稠密模型50%稀疏模型的WER为30.87优于稠密模型的32.57。这并不意味着删除一半权重天然会提升语音识别能力。更可能的原因是稠密基线未必已经达到最优SquareHead知识蒸馏提供了额外训练监督适度稀疏具有正则化作用教师和学生训练流程本身带来了收益。论文在MPT实验中也观察到低稀疏模型超过稠密基线并将其归因于蒸馏以及可能存在的稀疏正则化效应。(arXiv)11.2 高稀疏率下SquareHead仍然最稳定从论文曲线可以看出普通交叉熵和标准知识蒸馏在较高压缩率下迅速恶化而SquareHead的WER上升更加平缓。但SquareHead并不能完全消除精度损失。达到90%稀疏后WER仍从32.57上升到40.60。所以它解决的是高稀疏率下的稳定恢复问题不是让任意稀疏率都无损。十二、MPT-7B数学推理实验12.1 为什么需要先做监督微调原始MPT-7B在GSM8K零样本设置下准确率为0%8-shot上下文学习也只有6.8%。因此作者先对MPT-7B进行GSM8K监督微调得到28.2%的稠密基线然后将其作为教师模型进行剪枝与蒸馏。(arXiv)12.2 FP32稀疏模型结果稀疏率GSM8K准确率相对FP32稠密模型的CPU加速0%28.21.00倍40%32.91.54倍50%30.61.78倍60%28.82.07倍70%28.02.62倍80%23.13.35倍结果表明60%稀疏模型准确率为28.8略高于原始稠密基线28.2同时获得2.07倍CPU端到端加速。70%稀疏模型为28.0与稠密基线几乎相同加速达到2.62倍。80%稀疏时准确率下降到23.1但速度进一步提高到3.35倍。因此MPT-7B最有价值的结果是通过SquareHead蒸馏一次性剪枝后的MPT-7B可以在约70%稀疏率下基本保持GSM8K准确率并在特定CPU稀疏运行时上获得超过2.5倍的端到端加速。十三、稀疏与INT8量化能否同时使用论文进一步对稀疏MPT-7B进行INT8后训练量化。权重和激活均被量化到8位并通过DeepSparse进行CPU推理。稀疏率INT8准确率相对FP32稠密基线的CPU加速0%27.83.98倍40%30.35.31倍50%30.75.72倍60%28.46.70倍70%27.17.49倍80%21.19.08倍13.1 为什么两种方法可以叠加量化减少每个权重占用的位数稀疏化减少需要存储的权重数量。二者解决的是不同维度的问题量化每个非零权重存得更小稀疏需要存储和读取的权重更少。因此在内存带宽受限的自回归生成中两者收益可以部分叠加。60%稀疏INT8模型准确率为28.4与FP32稠密模型的28.2基本相当但CPU加速达到6.70倍。70%稀疏INT8模型速度达到7.49倍不过准确率下降到27.1。80%模型达到9.08倍时准确率进一步降至21.1。(arXiv)13.2 “7.49倍无损”需要谨慎理解论文将部分结果描述为接近无损但应注意比较基准。70%稀疏INT8模型的27.1低于FP32稠密模型的28.2存在约1.1个百分点下降。若与经过SquareHead训练后可能更强的稠密模型比较差距还可能更大。同时7.49倍速度是相对于FP32稠密DeepSparse基线并不是相对于高度优化的GPU推理框架也不是相对于INT8稠密模型。从表中看单独INT8量化已经获得3.98倍加速。因此70%稀疏INT8相对于INT8稠密模型的额外收益约为7.49 ÷ 3.98约为1.88倍。这仍然是有意义的提升但比直接看到“7.49倍”时容易产生的印象更加客观。十四、CPU吞吐量结果论文还在Intel Xeon Gold 6430和AMD Ryzen 9 7950X上测量MPT-7B吞吐量。以AMD Ryzen 9 7950X四核为例模型吞吐量稠密FP322.5 Tokens/s60%稀疏FP325.4 Tokens/s70%稀疏FP326.3 Tokens/s80%稀疏FP327.6 Tokens/s60%稀疏INT817.4 Tokens/s70%稀疏INT820.9 Tokens/s80%稀疏INT826.7 Tokens/s这组数据说明稀疏和量化不仅降低模型理论计算量也确实能够在专用CPU运行时中提高Token生成速度。不过吞吐量测试只使用1核或4核并且依赖特定DeepSparse版本和处理器指令集。它不能直接代表其他CPU、其他推理框架或GPU环境下的性能。十五、GPU规则稀疏实验论文在MPT-7B上比较了几种N:M格式。稀疏格式稀疏率GSM8K准确率稠密0%28.22:450%31.416:3250%31.416:6475%28.675%的16:64规则稀疏模型仍获得28.6%的准确率略高于原始稠密基线28.2。这说明SquareHead不只适用于完全自由的非结构化稀疏也能帮助恢复规则分组稀疏模型。但是GPU部分主要展示了单个MPT-7B矩阵上的自定义CUDA内核性能没有像CPU实验那样完整报告端到端解码延迟。因此论文对CPU真实加速的证据更完整对GPU则更多是稀疏内核可行性验证。(arXiv)十六、这篇论文真正证明了什么论文证明的不是任何大语言模型都可以剪到75%然后在所有任务和硬件上无损加速。它真正证明的是对于任务微调后的T5、Whisper和MPT模型使用SparseGPT产生固定稀疏结构再通过逐层归一化特征蒸馏进行恢复可以比普通任务微调和标准输出蒸馏更稳定地支持高稀疏率在配套稀疏运行时中这种稀疏性能够转化为实际CPU速度收益。其最有说服力的结果来自MPT-7B约60%至70%稀疏时GSM8K准确率基本保持FP32 CPU推理获得约2至2.6倍加速与INT8结合后相对FP32稠密基线达到约6.7至7.5倍加速。(arXiv)十七、与上一篇Prune and Tune的区别两篇论文都研究“剪枝后继续微调”但重点不同。对比维度Prune and TuneSparse Fine-tuning基础剪枝方法SparseGPTSparseGPT核心问题如何通过分阶段剪枝减缓高稀疏率崩溃如何通过蒸馏稳定恢复并获得真实加速主要训练方式每一轮剪枝后进行普通任务微调使用SquareHead中间特征蒸馏是否强调迭代路径是T5和Whisper是MPT不是教师模型没有突出稠密教师蒸馏使用任务微调后的稠密教师主要模型OPT-125M、OPT-1.3BT5、Whisper、MPT-7B主要指标WikiText-2困惑度BLEU、WER、GSM8K准确率是否测真实速度否是是否结合量化否是INT8是否提供稀疏运行时结果否CPU端到端与GPU内核Prune and Tune主要说明到达目标稀疏率的路径很重要。Sparse Fine-tuning进一步说明恢复稀疏模型时使用什么监督信号同样重要而且稀疏模型必须与运行时共同设计才能真正加速。十八、与GBLM-Pruner的区别对比维度GBLM-PrunerSparse Fine-tuning梯度用途估计权重重要性更新稀疏模型参数是否进行微调否是剪枝准则权重、激活和梯度联合评分SparseGPT二阶剪枝是否使用教师否是是否蒸馏中间特征否是是否报告真实加速基本没有有主要贡献改进权重排序改进精度恢复和部署流程GBLM-Pruner关注“应该删除哪些权重”而本文关注“权重删除后如何恢复以及怎样把零权重变成运行速度”。十九、方法优点19.1 不只报告理论压缩率还报告真实速度这是论文最突出的优点。很多剪枝论文只报告参数量、FLOPs或稀疏率而本文在CPU上测量端到端延迟和Token吞吐量并进一步分析编码器、解码器及完整模型的速度差异。19.2 SquareHead适用于多种模型结构论文测试了T5编码器—解码器Whisper语音编码器—文本解码器MPT纯解码器生成模型。在三类任务中SquareHead都比普通任务损失和标准输出蒸馏更加稳定。19.3 能够支持较高稀疏率MPT-7B在70%非结构化稀疏和75%规则16:64稀疏下GSM8K准确率仍接近稠密基线。这说明中间特征蒸馏能够显著提高高稀疏模型的可恢复性。19.4 稀疏和量化可以联合使用论文证明稀疏与INT8并不是互斥的。两者共同减少模型内存流量可以在CPU上获得明显的叠加收益。19.5 官方代码覆盖多个任务作者分别发布了MPT稀疏微调代码以及T5和Whisper实验代码。MPT仓库包含固定掩码、KL蒸馏和逐层SquareHead实现。(GitHub)二十、方法局限20.1 “大语言模型”实验规模仍然有限论文中的T5-Small和Whisper-Small属于相对较小的模型真正达到数十亿参数规模的主要是MPT-7B。因此SquareHead在30B、65B或更大模型上的训练成本、显存占用和稳定性没有在原始版本中得到充分验证。论文自己也将该工作称为初步研究。20.2 需要完整稠密教师SquareHead训练时教师和学生都需要前向传播并保存多个层的中间特征。这会带来明显额外成本需要存储稠密教师教师和学生都需要运行中间特征占用额外显存多层特征匹配增加计算和通信训练成本高于普通任务微调。论文重点报告推理速度没有系统比较不同蒸馏方法的训练时间和峰值显存。20.3 主要保持的是特定任务能力MPT-7B只在GSM8K上进行微调和评估。SquareHead让学生模仿的是一个GSM8K教师因此最终稀疏模型可能更擅长这个特定任务但论文没有验证其通用语言能力是否保持。没有系统测试常识推理阅读理解开放问答代码生成通用困惑度多任务平均性能指令跟随能力。所以不能根据GSM8K单任务结果断言70%稀疏模型完整保留了MPT-7B的通用能力。20.4 稠密基线本身受到蒸馏训练影响论文提到SquareHead训练甚至能将稠密MPT模型的准确率从28.2提高到33.0。这意味着部分稀疏模型超过原始基线不一定说明剪枝本身带来正则化优势也可能只是因为稀疏模型获得了更多或不同形式的训练。更严格的比较应该将稀疏模型与经过完全相同蒸馏流程训练的稠密模型比较而不是只与最初的监督微调基线比较。20.5 CPU速度依赖专用运行时普通PyTorch不会自动获得论文中的2倍至9倍加速。这些结果依赖DeepSparse稀疏推理引擎特定CPU架构稀疏权重格式对应算子实现指定线程数和序列长度。而DeepSparse开源仓库现在已经归档。复现者需要注意旧版运行时、处理器指令和模型格式兼容性。(GitHub)20.6 GPU证据不如CPU完整论文展示了规则N:M稀疏模型的准确率和单层CUDA矩阵内核速度但没有完整报告MPT-7B在GPU上的端到端Token生成吞吐量。因此不能直接将单矩阵内核加速等同于完整模型GPU加速。20.7 端到端加速远低于理论压缩率T5达到75%稀疏对应4倍权重压缩但端到端只加速约2.14倍。这说明并非所有模块都被剪枝稀疏索引和解压有额外成本非矩阵操作无法同步加速编码器与解码器的瓶颈不同稀疏率增加后速度收益会逐渐饱和。因此参数压缩率、理论计算减少率和实际加速率是三个不同概念。20.8 SquareHead依赖层级一一对应教师和学生网络结构相同只是学生部分权重为零因此可以直接比较相同层的特征。如果学生进行了结构化剪枝删除了神经元、注意力头或完整层教师和学生的中间特征维度可能不再一致SquareHead就不能直接使用需要额外的投影层或特征对齐机制。二十一、这篇论文最重要的启示这篇论文真正重要的地方不只是提出SquareHead而是将模型剪枝拆成了三个必须同时考虑的层次第一层模型精度使用SparseGPT选择权重并通过中间特征蒸馏恢复任务能力。第二层模型表示高稀疏学生不能只匹配最终输出还要尽量保持教师各层内部表示。第三层实际部署只有稀疏存储格式、稀疏计算内核和运行时共同支持零权重才能转化为真实速度。因此论文传递出的核心观点是高质量剪枝掩码只是起点。要获得可部署的稀疏大模型还需要稳定的稀疏训练方法和真正支持稀疏性的推理系统。二十二、一句话总结Sparse Fine-tuning先使用SparseGPT将任务微调后的模型变成固定稀疏网络再通过SquareHead逐层匹配稠密教师与稀疏学生的中间表示从而缓解普通任务微调在高稀疏率下的发散和过拟合在DeepSparse及规则N:M内核支持下MPT-7B可在约60%至70%稀疏率下基本保持GSM8K准确率并获得约2至2.6倍FP32 CPU加速与INT8结合后相对FP32稠密基线达到约6.7至7.5倍加速但这些收益依赖特定任务、教师蒸馏和专用稀疏运行时。