什么是大模型后训练Post-training从 POLARIS 出发的零基础入门指南【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS在人工智能领域大模型后训练Post-training正在成为比预训练更受关注的话题如何让一个已经会说话的模型变得更会思考。本文以开源项目POLARIS为例用零基础也能听懂的方式讲清楚后训练是什么、为什么要做后训练、以及强化学习RL如何把普通模型训练成推理高手。一、先建立直觉预训练 vs 后训练如果把大模型比作一名学生那么预训练Pre-training相当于博览群书——模型在海量文本上学习语言规律学会造句、接话但只是知道而未必精通。后训练Post-training则相当于专项训练 模拟考试——在预训练模型的基础上用带答案的数据或自动评分机制进一步微调让它学会分步推理、自我纠错最终在数学、代码等难题上稳定输出正确答案。POLARIS 这个名字本身就是POst-training recipe for scalingRL onAdvancedReasonIng modelS的缩写翻译过来就是在先进推理模型上扩展强化学习的后训练配方它的全部代码、数据和训练细节都已开源。二、为什么要做后训练三个关键原因预训练广而不深模型会写通顺的话但不一定能把一道竞赛数学题一步步算对。推理能力可以练出来通过强化学习让模型像刷题一样不断试错从会答进化到会想。小模型也能逆袭POLARIS 最惊艳的一点是只靠一个 4B 参数的小模型后训练后居然能在 AIME 2025 上超过许多超大模型和商业闭源系统。上图是 POLARIS 官方给出的 AIME 2025 成绩对比基线Qwen3-4B得分 65.6而经过后训练强化学习的POLARIS-4B-Preview直接跃升到79.4超过了 Claude-4-Opus75.5和 Grok-3-Beta77.3差距肉眼可见。三、POLARIS 的后训练是怎么做的一套三阶段配方POLARIS 的后训练流程并不神秘核心是三阶段强化学习RL训练代码都放在scripts/train/目录下例如第一阶段脚本scripts/train/qwen3-4b/stage1.sh第二阶段脚本scripts/train/qwen3-4b/stage2.sh第三阶段脚本scripts/train/qwen3-4b/stage3.sh三个阶段的思路大致是Stage 1 打基础让模型在高质量数学题上做 GRPO 强化学习学会用长思考long CoT逐步推理。Stage 2 提难度把上一阶段已经会做的简单题删掉只留更有挑战性的题目继续训练。Stage 3 冲上限进一步筛选数据、调整采样温度把推理能力推向极限。这种难度递进 数据清洗的思路就是 POLARIS 称之为配方recipe的原因——像做菜一样食材数据、火候温度、工序阶段都有讲究。四、后训练的三个关键技术细节4.1 强化学习算法GRPOPOLARIS 使用 GRPOGroup Relative Policy Optimization作为强化学习算法在 verl/trainer/ppo/ 中实现。简单理解让模型对同一道题生成多个答案再根据这批答案里哪个对来调整策略对的答案获得正奖励、错的获得负奖励模型就这样一点点学会蒙对变成算对。4.2 奖励函数怎么判断答对了后训练的关键在于自动判分。POLARIS 的奖励函数在 deepscaler/rewards/math_reward.py 中先提取模型输出中\boxed{}里的答案再用符号计算SymPy等方式与标准答案比对必要时还会用大模型ORM判断两个数学表达式是否等价。4.3 温度与长思考训练时采样温度设为1.4~1.45比常规解码温度更高鼓励模型探索多样化解法。最大响应长度开到4 万~4.8 万 token给足模型想很久的空间——这正是推理模型与普通模型的本质区别允许慢思考。五、数据从哪里来先训练、再筛选POLARIS 的训练数据来自公开数学数据集如 DeepScaleR 与 AReaL经过筛选后约 5.3 万条存放在parquet/目录下parquet/stage1/第一阶段训练数据parquet/stage2/剔除简单题后的进阶数据parquet/stage3/进一步筛选后的冲刺数据其中删除简单题的逻辑在 drop_easy_data.py 中统计模型对每道题的正确率平均正确率超过 0.9 的题目就会被淘汰让模型把算力花在真正难啃的骨头上。此外还可以用 search_optimal_temperature.py 自动搜索最优解码温度为每个训练阶段定制采样参数。六、如何评测后训练效果训练完成后POLARIS 用 AIME 24、AIME 25、Minerva Math、Olympiad Bench、AMC23 等数学竞赛基准进行评测。评测脚本在 scripts/eval/ 下例如 eval_vllm_aime24.py 会为每道题做 32 次采样取平均分再用 evaluation/grade.py 统一判分整个过程公开可复现。七、新手怎么上手如果你想亲手跑一遍 POLARIS 的后训练流程思路如下准备环境安装项目依赖详见仓库 README.md需要 GPU 环境官方使用 H800。准备数据将数据转为 Parquet 格式参考 scripts/data/jsonl2parquet.py。启动训练运行对应模型的 stage1/stage2/stage3 脚本例如./scripts/train/qwen3-4b/stage1.sh。验证效果用评测脚本对比训练前后在 AIME 上的得分提升。如果想获取仓库代码可以执行git clone https://gitcode.com/gh_mirrors/polaris34/POLARIS。八、总结后训练为什么值得关注一句话总结大模型后训练Post-training就是用强化学习等技术在预训练模型之上继续打磨让模型从会说话升级到会推理。POLARIS 证明了这条路对小模型尤其友好——4B 参数的模型经过三阶段 RL 后训练推理成绩足以比肩商业巨无霸而且数据集、代码、训练细节全部开源。对于想入门的大模型爱好者来说POLARIS 就是一套极佳的后训练学习标本读它的训练脚本理解 GRPO、看它的奖励函数理解自动判分、跑它的评测脚本理解效果验证。从看懂 POLARIS 开始你就迈出了理解大模型后训练的第一步。【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考