目录模型评估微调监测的工具--swanLab粗略的模型评估细致的模型部署与评估模型评估微调监测的工具--swanLab网址信息如下SwanLab - AGI时代先进模型训练研发工具在二的「brainTeaser.yaml」文件的基础上新增如下信息use_swanlab: trueswanlab_mode: cloudswanlab_project: report-0817swanlab_run_name: BTtestswanlab_api_key: 自己去官网复制do_train记得修改成正的下载好swanlab库然后开始模型训练uv pip install swanlab llamafactory-cli train myYaml/brainTeaser.yaml可以在控制台看见模型跑起来了并且在swanlab控制台也有显示模型已经训练完毕了粗略的模型评估模型部署在Cherry上我们把模型部署在cherry下载地址如下Cherry Studio 官方网站 - 全能 AI 工作站adapter_name_or_path--大模型微调和推理中用于加载已训练好的 LoRA 适配器权重Adapter Weights的参数。加载 LoRA 权重在微调结束后模型保存的通常只是低秩矩阵的权重而不是整个庞大的模型。当你需要进行推理、评估或者在已有 LoRA 基础上继续训练二次微调时通过这个参数指定你的 LoRA 权重文件夹路径系统就会将其与底座模型Base Model动态合并加载。如果是从头开始全新训练该参数通常留空或设为 null。infer_backend--指定大模型在推理Inference或预测阶段所使用的后端引擎的参数。huggingface或 transformers默认的原生后端。使用 Hugging Face transformers 库进行推理兼容性最好适合常规调试、验证和小规模推理。vllm高性能推理后端。如果指定使用 vllm它会利用 PagedAttention 等底层优化技术大幅提升推理速度和显存利用率非常适合高并发或大规模批量生成文本的场景。vllm_maxlen--当使用vllm作为推理后端时用来设置模型支持的最大上下文长度Max Model Length的参数。控制 KV Cache 显存分配vLLM 在启动时会根据这个长度预先分配用于保存键值对KV Cache的显存空间。突破或限制长度如果模型原生支持很长的上下文如 32k、128k 甚至更长但你显存有限可以通过调小vllm_maxlen来节省显存反之如果需要处理超长文本推理则需要将该值调大但不能超过模型本身架构支持的上限。vllm_gpu_util--当使用vllm作为推理后端时用来控制GPU 显存占用比例的核心参数显存预分配控制vLLM 在启动时默认会尝试占用绝大部分通常是 90% 左右即0.9的 GPU 显存用来缓存模型权重和高效的 KV Cache。避免显存溢出OOM如果你的显卡上还运行着其他服务、Jupyter Notebook 或者显存较小你可以通过调低这个参数例如设为0.7或0.8限制 vLLM 最多只能使用指定比例的显存从而防止与其他进程冲突导致报错。enable_thinking--LLaMA-Factory 中专门针对具备推理能力模型如带有思维链 CoT 的大模型例如 Qwen3 等引入的控制参数。enable_thinking: true默认/慢思考模式适用于带有思维链Chain-of-Thought的标准推理数据集。系统会将思维链内容放入模型的回复标签中并正常参与损失Loss计算。enable_thinking: false快思考模式适用于不包含思维链的常规数据集。此时框架会为推理模型自动处理并添加空的思考标签常用于在没有 CoT 的数据集上进行微调避免模型输出冗余的思考过程。enable_thinking: null混合模式。如果你的数据集中一部分包含思维链、一部分不包含可以设为 null 让框架自动适配。在配置文件继续增加如下「字段」有的可以不加主要是后面四个### modelmodel_name_or_path: Qwen/Qwen3.5-2Badapter_name_or_path: /home/xing/study/finetune/LLaMA-Factory/saves/Qwen3.5-2B/brainTeaser/lora/sfttrust_remote_code: truetemplate: default### infer backendinfer_backend: huggingfacevllm_gpu_util: 0.5vllm_maxlen: 2048接下来准备好环境uv pip install vllm -i https://pypi.tuna.tsinghua.edu.cn/simple ##如果报错说vllm版本不适配执行如下命令 uv pip install vllm0.4.3,0.11.0 -i https://pypi.tuna.tsinghua.edu.cn/simple llamafactory-cli train myYaml/brainTeaser.yaml接下来执行命令启动api服务API_MODEL_NAMEreport-2.5B-0818 llamafactory-cli api LLaMA-Factory/myYaml/brainTeaserCherry.yaml这样子就是启动起来了配置到Cherry中在Cherry点击「添加服务商」然后讲服务开启变成可视的。「API密钥」是自定义的。在聊天助手就可以使用它了细致的模型评估