大模型怎样从用户反馈中持续自我改进?SLIFT 双适配器选择性自学习框架解析
【技术解读】本文深度解析清华大学与腾讯联合提出的 SLIFTSelective Self-Learning from User InteractionsarXiv:2608.09109它把用户反馈从整条消息的粗粒度下沉到原子组件的细粒度并用一个任务相对task-relative的视角给每个组件定性。三步流程——① 原子分解与三元判定把每条反馈拆成最小可操作原子组件相对原始任务判为 Fix构成任务做对的刚性前提应沉淀为默认行为、Spec与当前任务兼容但仅在特定条件下适用的补充要求不该污染默认行为、Null模糊矛盾或无法可靠归因正向改进的内容直接不产生更新统计显示真实 WildFB 反馈中 Null 高达 37.7%Fix 19.4% / Spec 42.9%意味着近四成真实反馈本不该触发任何参数更新② 双 LoRA 适配器分治Generalist通才通过反馈条件自蒸馏把 Fix 类要求固化成默认行为Specialist专才只观察原始任务Generalist 回答针对 Spec 细化提供残差引导不碰全局默认③ 整个框架建立在 LoRA 之上不依赖全参数微调可直接叠加到现有 PEFT 流程代码已开源。评测侧Qwen3-8B 在 MemoryBench 样本加权 Norm-Score 达 55.85显著超过 SDPO49.56/SFT48.63/DPO47.81较 Base49.17绝对提升 6.68 分Ministral3-14B 上 SLIFT 53.22较 Base 3.41WildFB 真实反馈下 IFEval 严格指令遵循与 AlpacaEval 2.0 长度控制均优于各参数基线MMLU-Pro 知识推理基本持平无显著退化消融实验显示双通路分工让 Generalist 在 MMLU-Pro 上 ΔG-0.11、Specialist ΔS0.00知识守恒。用户反馈是金矿但也是雷区做过企业级大模型落地的人都知道模型上线只是开始。真正的持续改进来自用户每天与它交互时产生的反馈——“这里答错了“这个格式不对“这个回答应该用术语而不是大白话”。这些信号天然就是监督信号但把它们直接灌进模型却是个技术雷区。2026 年 8 月 10 日清华大学计算机系与腾讯联合团队在 arXiv 提交了论文 Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language ModelsarXiv:2608.09109。核心洞察很朴素但此前没人系统解决一条用户反馈消息往往同时要求多种不同的行为改变而这些改变该泛化的范围根本不一样。比如用户说以后回答都要用中文术语、并且这条具体问题的单位要换算成毫米”——前半句是全局规则对所有任务生效后半句只是这条任务的条件细化仅在此情境下生效。如果一刀切地全量更新要么全局规则没固化要么一次性条件被错误泛化、污染了默认行为。核心方法把反馈拆成原子再分两条管线训练SLIFT 的做法是把用户反馈这件事从整条消息的粗粒度下沉到原子组件的细粒度并用一个任务相对task-relative的视角给每个组件定性。第一步原子分解与三元判定。系统把每条反馈拆解成最小可操作的原子组件再相对原始任务把每个组件判为 Fix、Spec 或 Null 三类Fix任务合法性要求构成任务做对的刚性前提应当沉淀为模型的默认行为对所有同类输入生效Spec条件性细化与当前任务兼容、但只在特定条件下适用的补充要求不该污染默认行为Null无可靠正向更新方向模糊、矛盾或无法可靠归因到正向改进的内容直接不产生任何更新。论文给出的统计很说明问题在 Qwen3-8B 的 MemoryBench 反馈上Fix/Spec/Null 的占比是 23.6% / 50.8% / 25.6%而更真实的 WildFB 用户反馈里 Null 高达 37.7%Fix 19.4% / Spec 42.9%。也就是说接近四成的真实反馈其实不该触发任何参数更新——这正是朴素自学习容易被一条随手反馈带偏的根源。第二步双 LoRA 适配器分而治之。SLIFT 在共享的冻结基座上训练两个互补的 LoRA 适配器把不同范围的改变落到不同参数空间Generalist通才通过反馈条件自蒸馏”feedback-conditioned self-distillation把 Fix 类要求固化成默认行为。它看到的是带反馈标注的训练数据学习的是这类任务默认就该这么答。Specialist专才只观察原始任务 Generalist 的回答针对那些适用但 Generalist 尚未满足的 Spec 细化提供残差引导。它不碰全局默认只在满足条件时叠加修正。这一点设计直击持续学习的老问题把全局规则和一次性条件塞进同一组参数必然互相干扰、引发灾难性遗忘。SLIFT 用通才守默认、专才补特例的分工让两类信号各得其所。整个框架不依赖全参数微调两个适配器都建立在 LoRA 之上工程上可以直接叠加到现有 PEFT 流程里代码已开源。实验数据记忆与真实反馈双场景领先知识能力零退化论文在 Qwen3-8B 与 Ministral3-14B-Instruct 两个基座上用 MemoryBench模拟反馈和 WildFB1.5 万条真实用户反馈两套基准做了验证对比了检索式、外部记忆式与参数训练式多条基线。MemoryBench样本加权 Norm-Score越高越好Qwen3-8BSLIFT 达55.85显著超过最强参数基线 SDPO49.56与 SFT48.63、DPO47.81相比未适配的 Base49.17绝对提升6.68 分仅用 Generalist 的 SLIFT-Gen 也有 51.88说明 Specialist 额外贡献约 1.8–2.4 分。分长度区间看SLIFT 在 Short-Short / Short-Long / Long-Short / Long-Long 四个分区分别拿到 70.49 / 58.00 / 45.22 / 49.68全部高于所有基线长文本场景的优势尤其明显。Ministral3-14BSLIFT 53.22相比 Base 49.813.41、相比 SDPO 48.694.53。WildFB真实反馈由 WildReward-8B 与标准指令遵循基准评测在 Qwen3-8B 与 Ministral3-14B 上SLIFT 的 IFEval 严格指令遵循准确率与 AlpacaEval 2.0 长度控制胜率均优于 Base 及 SFT/DPO/SDPO 等参数基线WildReward 胜率有微弱正向增益MMLU-Pro 知识推理精度基本持平无显著退化。消融实验Ministral3-14B进一步坐实了每个组件的必要性变体MemoryBenchIFEvalAlpacaEval 2.0SLIFT完整53.2269.7166.35w/o 原子分解51.3067.8965.22w/o 任务上下文50.7467.3463.98w/o 双通路分工51.0567.6264.61w/o Specialist仅 Generalist51.4267.2864.27w/o KEEP 监督50.8657.6364.06去掉原子分解或去掉角色分配时的任务上下文掉点最猛而 Specialist 把 IFEval 从 67.28 拉到 69.71、AlpacaEval 从 64.27 拉到 66.35。更关键的是知识守恒Generalist 在 MMLU-Pro 上的变化仅 ΔG -0.11Specialist 更是 ΔS 0.00——双适配器分工让模型在吸收用户反馈的同时没有牺牲已有的通用知识推理能力。需要说明边界WildFB 中完全可用的反馈率只有 50.4%标准化后 96.7%意味着真实反馈里近一半信号质量不足这也是真实反馈增益相对 MemoryBench 偏小的原因论文未包含全参数微调与标准独立 LoRA的直接对比因此 SLIFT 的优势是针对自学习/自蒸馏这一类持续学习基线而言的。商业启示把用户反馈闭环做成可交付的工程能力对思陌大模型微调的客户项目这篇论文指向一个常被忽略但越来越重要的交付环节——上线后的自我进化能力。指令对齐指令微调/SFT/DPO需要引入反馈分级机制。我们给客户做对齐时训练数据大多来自一次性标注缺少用户上线后持续纠错这条活水。SLIFT 的 Fix/Spec/Null 三元判定可以直接变成我们的数据工程流水线把客户运营团队每天的人工纠错自动分级Fix 类沉淀进通用 SFT 集、Spec 类走条件化适配、Null 类直接过滤。这能显著降低一句话反馈把模型带偏的线上事故概率。数据工程环节可借双适配器实现热更新不回退。企业客户最怕的是为修一个 bug 重新全量微调结果把上周刚对齐好的能力冲掉。SLIFT 的 Generalist 守默认、Specialist 补特例的分工本质上就是一套增量热补丁范式——可以用 LoRA 叠加实现零回退的能力追加这与我们给客户做持续交付而非每次推倒重来的诉求高度契合。评估优化环节要把知识守恒设为回归门禁。论文里 MMLU-Pro 零退化的结果提示我们任何一次基于反馈的再训练都必须跑一遍通用能力回归测试防止局部优化悄悄侵蚀全局能力。这应成为我们交付流程里的一道固定质检项。推理部署层面SLIFT 不增加推理架构复杂度仍是 LoRA 叠加无常驻双模型意味着我们现有的推理服务栈无需为支持持续自学习做额外改造——这是一个对交付友好、成本可控的方案。参考文献Li, X., Li, H., Zhou, Y., Pan, Q., Wang, H., Liu, Y., Zhang, M., Ai, Q. (2026). Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models. arXiv: 2608.09109 | DOI: 10.48550/arXiv.2608.09109论文开源代码仓库SLIFT (4open.science)本文为思陌大模型微调团队对公开论文的独立解读数据与结论均以原文为准不代表原作者观点。论文原文信息链接大模型怎样从用户反馈中持续自我改进SLIFT 双适配器选择性自学习框架解析注本文由 AI 辅助生成仅对论文做独立解读不代表原文作者观点。