环境搭建与启动 从零开始搭建环境、下载模型到最后微调成功AI 工程实践一、使用 nvidia-smi 查看显卡情况首先使用nvidia-smi查看显卡情况。本服务器显存为16 GB。微调 Qwen2.5 7B70 亿参数模型通常需要 20 GB 以上显存。解决方案是使用4-bit 量化QLoRA技术。为什么使用 4-bit 量化如果不量化模型加载后大约占用 14 GB 显存几乎没有空间进行训练。使用 4-bit 量化后模型大约占用 56 GB 显存剩余显存可以用于微调训练。同一台服务器可以由多个账号登录。显卡和存储空间是共享的但每个账号拥有独立目录因此文件互不影响。二、安装 MinicondaMiniconda 是环境管理工具可以创建相互隔离的 Python 虚拟环境。wgethttps://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh三、创建并使用 Conda 环境服务器上公用的 Conda 版本为25.11.1。分别创建个人环境qwen_luda //自己起的名字conda create-nqwen_ludapython3.11-yLLaMA-Factory 代码目录中包含训练所需的依赖包例如 PyTorch、Transformers 等。将代码下载到个人项目目录~/luda_project/LLaMA-Factory。退回项目主目录cd~/项目主目录创建模型目录用于存放 Qwen2.5-7B 模型mkdirmodels四、启动 LLaMA-Factory WebUI第一步激活 Conda 环境每次启动前先进入qwen_luda环境conda activate qwen_luda第二步进入代码目录进入 LLaMA-Factory 项目目录cd~/luda_project/LLaMA-Factory第三步启动 WebUI执行下面的命令仅使用编号为1的显卡CUDA_VISIBLE_DEVICES1llamafactory-cli webui启动成功后可以看到如下输出在浏览器中打开 http://localhost:7860。五、配置 Xshell 隧道只需配置一次请按照下面的步骤操作非常简单只有 4 步第一步暂停程序在黑窗口里按键盘上的Ctrl C按住 Ctrl 不放点一下 C。你会看到程序停止变回 (qwen_luda)…$ 的样子。为什么要停因为我们要修改 Xshell 的连接设置修改完需要重新连接才生效第二步设置 Xshell 隧道在 Xshell 左侧的会话列表里右键点击你正在用的这个服务器连接选择“属性” (Properties)。在弹出的窗口左侧菜单里找到连接 (Connection)-SSH-隧道 (Tunneling)。点击右边的“添加” (Add)按钮。在弹出的新窗口里填入以下信息其他不动源主机Source Hostlocalhost侦听端口Listening Port7860目标主机Destination Hostlocalhost目标端口Destination Port7860点击确定 (OK)再点击确定 (OK)保存。第三步重新连接关掉当前的 Xshell 窗口或者断开连接。重新双击登录服务器。重新启动 LLaMA-Factoryconda activate qwen_ludacd~/luda_project/LLaMA-Factory llamafactory-cli webui第四步打开 WebUI当黑窗口再次出现 Running on local URL: … 后打开 Windows 电脑上的 Chrome 或 Edge在地址栏输入http://localhost:7860看到 LLaMA-Factory 界面后先确认关键参数再开始训练避免显存不足。至此基础环境配置完成。六、在 WebUI 中微调模型第一步切换为中文界面看左上角的Language选项。把它从 en 改成zh。瞬间界面就会变成熟悉的中文第二步填写模型信息这是最关键的一步告诉机器去哪里找你辛苦下载的那 15GB 模型。模型名称Model name选择Qwen2.5-7B-Instruct。模型路径Model path必须填写模型的绝对路径。/home/luda403/luda_project/models/qwen/Qwen2.5-7B-Instruct第三步开启省显存模式训练 7B 模型还是有点吃力。我们要开启4-bit 量化技术就是我之前说的压缩技术让它乖乖在显存里跑。微调方法Finetuning method保持默认的lora。量化等级Quantization bit选择4。(选了 4 之后原本需要 16GB 显存现在只要 6GB 就能跑起来非常神奇)第四步选择练习数据集虽然我们还没准备自己的数据但 LLaMA-Factory 自带了一些测试数据。我们先用它跑通流程。找到数据集Dataset选项。在下拉菜单中选择identity自我认知或alpaca_zh_demo。选好后右侧框中会显示数据集名称。第五步开始训练找到页面底部的橙色开始Start按钮。点击按钮开始训练。七、训练完成后加载并测试模型第一步加载微调结果刷新网页按浏览器左上角的刷新按钮或者 F5让网页重新加载一下这样它才能扫描到刚生成的文件。选择检查点路径Checkpoint path重新填写 Qwen2.5-7B 的模型名称和路径。找到检查点路径Checkpoint path下拉框。选择类似train_2026-01-21-03-13-40的训练结果。第二步进入聊天模式点击网页中间的一排标签页找到并点击“Chat (聊天)”。点击右边的红色按钮“加载模型 (Load model)”。(这一步需要等几十秒看 Xshell 黑窗口里显示 “Model loaded” 就是好了)第三步开始对话在聊天框里输入你在 alpaca 数据集里见过的问题或者随便聊聊看看它的回答是不是更有“味道”了推理参数Temperature 与 Top-p这两个参数主要用于控制模型回答的创造性和发散程度。Temperature 较高例如 0.95回答更有创意但更容易出现不准确内容适合小说创作和聊天。Temperature 较低例如 0.1回答更加严谨和稳定适合数学与代码任务。Top-p作用与 Temperature 类似也用于控制回答的发散程度。当前的Temperature 0.95、Top-p 0.7属于常见聊天配置可以暂时保持不变。设置系统提示词System Prompt系统提示词用于设定 AI 的角色和回答规则。例如你是一个严厉的 Java 老师只回答代码问题不要废话。第四步导出模型打开网页顶部的Export导出标签页。最大分块大小Max shard size填写2GB。导出路径Export dir例如/home/luda403/luda_project/models/my_first_finetuned_model。点击开始导出Export。导出完成后就拥有了一个属于自己的 Qwen2.5-7B 微调模型。