AMD ROCm环境搭建指南:为Instella-MoE-16B-A3B-Midtrain铺平第一条路
AMD ROCm环境搭建指南为Instella-MoE-16B-A3B-Midtrain铺平第一条路【免费下载链接】Instella-MoE-16B-A3B-Midtrain项目地址: https://ai.gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-MidtrainAMD ROCm环境搭建是运行 Instella-MoE-16B-A3B-Midtrain 模型的第一步也是许多新手最容易卡住的地方。本文是一份面向初学者的完整 AMD ROCm 环境搭建指南从硬件要求、驱动安装、依赖配置到模型加载推理一步步带你走通全程让你在 AMD 显卡上顺利跑起这个由 AMD 官方开源的 MoE 大语言模型。Instella-MoE-16B-A3B-Midtrain 是 AMD 官方发布的 Instella-MoE 系列模型的中段训练Mid-training检查点总参数 160 亿、每 token 仅激活 28 亿参数属于稀疏激活的 Mixture-of-ExpertsMoE架构内含 64 个路由专家和 2 个共享专家并引入了 Gated MLA 注意力与 FarSkip-Collective 通信优化。它从预训练到 RL 全流程都在 AMD Instinct™ MI300X / MI325X 上使用 AMD ROCm™ 软件栈训练而成堪称为 AMD 而生的模型。一、为什么需要搭好 ROCm 环境很多新手习惯把 CUDA 那套思路直接套到 AMD 卡上结果一运行就报错。原因很简单Instella-MoE 系列模型从训练到推理都深度依赖 AMD ROCm™ 生态模型代码中大量用到 ROCm 专属的算子与加速库。ROCm 环境搭建不到位后面无论是AutoModelForCausalLM.from_pretrained加载模型还是 FlashAttention 加速都会寸步难行。可以说一套干净、版本匹配的 AMD ROCm 环境决定了你后续所有步骤的成败。二、动手前的硬件与系统要求在开始 AMD ROCm 环境搭建之前先对照检查你的设备是否满足最低要求项目推荐要求GPUAMD Instinct MI300X / MI325X 等 CDNA 架构加速卡Radeon RX 系列ROCm 5.7 逐步支持显存建议 48GB 以上16B 参数 bf16 权重约 32GB还需额外显存存放激活与 KV Cache系统Ubuntu 22.04 / 24.04 LTSROCm 官方支持度最高的发行版内核官方支持列表内的 Linux 内核版本 提示若显存不足可先尝试load_in_4bit或load_in_8bit量化加载但需要额外安装 bitsandbytes 并确认其 ROCm 版本支持。三、AMD ROCm 环境搭建详细步骤第 1 步确认显卡与内核兼容性打开终端先确认你的显卡能否被系统识别lspci | grep -i amd uname -a如果能看到 AMD 显卡设备信息且内核版本在官方支持列表内就可以继续下一步了。第 2 步安装 AMD ROCm 驱动最快配置方法推荐使用 AMD 官方仓库安装这是最简单可靠的方式wget https://repo.radeon.com/amdgpu-install/latest/ubuntu/jammy/amdgpu-install_6.x.x_all.deb sudo apt install ./amdgpu-install_*.deb sudo amdgpu-install --usecaserocm安装完成后务必重启系统然后验证安装rocm-smi如果能看到 GPU 的温度、利用率等信息说明 ROCm 环境搭建的核心部分已经成功。✨第 2 步补充安装 ROCm 核心软件栈sudo apt install rocm安装完成后将当前用户加入render与video组避免权限问题sudo usermod -a -G render,video $USER重新登录后运行rocm-smi再验证一次即可。第 3 步创建 Python 虚拟环境为了避免依赖冲突强烈建议用虚拟环境隔离python3 -m venv instella-env source instella-env/bin/activate第 4 步安装 PyTorch for ROCm 与依赖库注意不要装普通的 CUDA 版 PyTorch请从 PyTorch 官方 ROCm 通道安装pip install torch torchvision --index-url https://download.pytorch.org/whl/rocm6.2 pip install transformers accelerate safetensors⚠️ 关键点本项目要求transformers4.57.1并且加载时需要开启trust_remote_codeTrue因为模型使用了仓库内的自定义代码modeling_instella_moe.py与configuration_instella_moe.py。四、获取 Instella-MoE-16B-A3B-Midtrain 模型模型权重较大13 个 safetensors 分片合计约 30GB建议直接克隆仓库到本地git clone https://gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-Midtrain cd Instella-MoE-16B-A3B-Midtrain仓库结构一目了然模型权重model-00001-of-00013.safetensors至model-00013-of-00013.safetensors、索引文件model.safetensors.index.json、以及自定义模型代码modeling_instella_moe.py、configuration_instella_moe.py。五、快速推理验证让模型开口说话环境就绪后用下面这段精简代码验证 AMD ROCm 环境是否真正打通from transformers import AutoModelForCausalLM, AutoTokenizer checkpoint amd/Instella-MoE-16B-A3B-Midtrain tokenizer AutoTokenizer.from_pretrained(checkpoint, trust_remote_codeTrue) model AutoModelForCausalLM.from_pretrained( checkpoint, device_mapauto, torch_dtypebfloat16, trust_remote_codeTrue, ) prompt [{role: user, content: What is Mixture-of-Experts?}] inputs tokenizer.apply_chat_template( prompt, add_generation_promptTrue, return_tensorspt ) tokens model.generate( inputs.to(model.device), max_new_tokens256, temperature0.6, top_p0.95, do_sampleTrue, ) print(tokenizer.decode(tokens[0], skip_special_tokensFalse))如果能在终端看到完整输出恭喜你AMD ROCm 环境搭建彻底成功模型已在你的 AMD 显卡上跑起来了六、常见问题排查速查表报错现象原因与解决办法rocm-smi: command not foundROCm 安装不完整重新执行amdgpu-install --usecaserocmCUDA 相关报错装错了 PyTorch 版本改用--index-urlROCm 通道重新安装KeyError: instellamoe忘记加trust_remote_codeTrue或 transformers 版本过低显存不足OOM降低max_new_tokens、开启量化加载或升级更大显存的显卡推理速度慢安装支持 ROCm 的 FlashAttention并确认注意力实现正确启用七、总结从零开始做 AMD ROCm 环境搭建并不复杂关键就是三步装对驱动、装对 PyTorch、开对开关。对照本文的步骤走一遍Instella-MoE-16B-A3B-Midtrain 就能在 AMD 显卡上流畅运行。这也是你在 AMD 生态里体验 MoE 大模型的第一步——后续你还可以继续探索同系列的 Pretrain、Base、SFT、DPO、Think 等各个训练阶段检查点详见 README.md 中的模型表格一步一步玩转 AMD 大模型生态。祝你在 ROCm 的世界里玩得开心【免费下载链接】Instella-MoE-16B-A3B-Midtrain项目地址: https://ai.gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-Midtrain创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考