《Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models》总结与翻译一、文章主要内容总结本文聚焦大型语言模型(LLMs)有监督微调(SFT)阶段的数据混合优化问题,旨在解决SFT中领域权重难以高效确定的核心挑战,具体内容如下:研究背景与问题:数据混合(不同领域数据比例分配)对LLMs性能影响显著,但SFT阶段的数据混合研究远少于预训练阶段。现有预训练数据混合方法(如使用小型代理模型优化权重、忽略领域间相互作用等)无法直接应用于SFT,且穷尽所有领域权重组合(如网格搜索)计算成本极高。核心方法:数据混合优化(Data Mixing Optimization)问题建模:将SFT数据混合转化为优化问题,目标是在固定计算预算(token总量)下,确定各领域权重,最小化验证损失。定义领域权重向量需满足概率单纯形约束(权重非负且总和为1)。关键参数化设计:结合“迁移有效数据”和“微调缩放定律”对验证损失进行参数化。前者量化不同领域数据的迁移贡献(如领域i的有效数据=自身数据+其他领域迁移数据),后者用幂律关系描述数据量与损失的关联(损失随数据量增加先快速下降后趋于平缓),最终构建各领域验证损