模型后训练技术学习(1)
小唠叨是前言各位晚上好我是滑某某好久不见。最近这段时间正好在参与公司内部相关AI项目的研发所以也想借这个机会写一写自己对模型后训练的一些理解。现在的大模型越来越强API也越来越便宜很多人可能会好奇既然直接调用通用大模型就能解决不少问题为什么还要本地部署甚至还要专门去微调小模型当然微调只是后训练中的一个环节这里先拿它举个例子其实很多政企、院校项目里的数据不能出网像标书、人员信息、业务资料等都不可能直接传到云端API。数据不能出网通常就需要优先考虑本地化部署但不同单位的算力和预算又不一样尤其现在不少项目经费都比较紧大伙都没钱了悲所以怎么用最少的钱把事情做好就很重要。这个时候0.6B、1.5B、4B这类小模型就很合适。当然小模型不是拿来和大模型硬干的。它更适合做一些明确的小任务比如意图识别、信息抽取、格式转换、简单问答或者放在系统前面先做一层分流简单问题直接秒回复杂问题再交给更大的模型处理。这样做其实就是大小模型混用既能提高响应速度也能节省算力和成本。如果预算适中也可以部署Qwen3.6-27B这类模型作为主力再配合小模型完成分流在模型能力、并发数量和部署成本之间取得一个相对合适的平衡。好了不多说了直接进入正题吧带你们了解后训练其实是考察一下自己有没有掌握后训练是啥这个先给各位用人话讲一讲各位可以把模型想象成自己幼儿园时期的大脑那时候咱们不都刚刚学完拼音嘛后面要步入小学了开始猛猛学英语、数学、古诗。那其实步入小学后继续学习的过程就有点像模型的后训练。当然这个比喻不是特别严谨主要是为了方便大家理解。其实很多AI技术都可以通过人类学习和自然界规律去理解这样学习起来会快很多。好人话讲完了现在来点额也是人话。现在很多大厂开源模型时通常会提供Base和Instruct等版本。Base就是基座模型它在预训练阶段读了大量数据学会了语言规律、知识关系和基本的推理能力。但它更像是“什么都知道一些具体怎么回答却不一定稳定”。你让它聊聊第一性原理可能没问题但让它完成某类企业内部业务判断输出结果可能还不如直接问豆包姐姐。而Instruct模型则是在基座模型上继续进行过指令微调让它更懂用户的问题也更愿意按照要求回答。一般来说咱们用这种模型更多一些所以后训练不是让模型从0开始学习而是在它已经具备基础能力的前提下继续教它如何理解指令、完成任务以及适应某一类具体场景。常见的后训练阶段包括SFT、DPO和RLHF等而在具体训练时又可以选择全参数微调、LoRA或QLoRA等参数更新方式。前者更偏向“教模型学什么”后者更偏向“用什么资源和方式去训练”。它们的目标虽然不完全相同但本质上都是在预训练模型的基础上继续调整模型。可以看到现在出现了一堆专业术语如果是新手同胞看这啥看都看不懂那么接下来我将祭出超级super plus人话和人话的表格不好意思我已经沉浸在自己的艺术中了SFT、LoRA、DPO到底有什么区别类别人话严谨的人话SFT老师拿着标准答案一道题一道题教你使用输入与标准输出数据对模型进行监督微调LoRA你妈妈想让你学奥数但又不想把你从幼儿园重新培养一遍于是给你额外安排了一套“奥数专项训练”。你原来学过的语文、数学基础基本不动只重点训练一小部分与奥数有关的新能力。以后做题时原有能力和这部分专项能力会一起发挥作用。冻结大部分基座模型参数在部分线性层旁增加低秩适配矩阵并只训练这些新增参数。QLoRA额这个有点难比喻简单理解吧就是先用更省显存的方式加载基座模型再训练额外增加的LoRA模块。将冻结的基座模型权重量化为低比特形式并在量化模型上训练LoRA适配器以降低训练时的显存需求。DPO就像针对“晚上玩什么游戏”这个问题同时给出“玩无畏契约”和“玩CS2”两个答案再由裁判告诉模型更偏好哪一个。当然这个专家如果是瓦学弟那就会选择瓦如果是go学长那会选择cs2(*^_^*)使用同一输入下的偏好回答与非偏好回答数据直接优化模型对两类回答的相对概率。RLHF人类当裁判给答案打分模型根据评分不断调整自己的回答方式根据人类反馈训练奖励模型再通过强化学习进行对齐昂其实通过这样人话的学习还是比较容易理解的。不过这里需要提前说明一下SFT、DPO和RLHF主要是在讲“用什么方式训练模型”而LoRA和QLoRA更像是在讲“怎么用更少的显存和算力完成训练”。它们并不是互相排斥的比如咱们完全可以使用LoRA的方式完成一次SFT。那一次后训练到底是怎么进行的昂其实后训练听起来很高大上但大概流程并没有想象中那么玄学。首先咱们得明确模型要解决什么问题不能今天想让它写标书明天又让它修交换机后天再让它分析恋爱问题这样模型自己都得蒙蔽。确定场景后就需要准备对应的训练数据然后选择一个合适的基座模型确定采用SFT、DPO等训练方式再根据算力和显存情况选择全参数微调、LoRA或QLoRA等实现方案。训练结束后还要使用模型没见过的数据进行测试看看它是真学会了还是只会背答案。测试结果只是上线依据之一实际发布前还要结合人工检查、业务指标进行验收。写不动了手搓还是挺爽的今天就简单分享到这里吧希望可以帮到大家今天的内容更多是概念吧明天给各位写工具以及内部的几个微调方法的详细介绍。