news 2026/8/19 17:49:31

AMD ROCm环境搭建指南:为Instella-MoE-16B-A3B-Midtrain铺平第一条路

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AMD ROCm环境搭建指南:为Instella-MoE-16B-A3B-Midtrain铺平第一条路

AMD ROCm环境搭建指南:为Instella-MoE-16B-A3B-Midtrain铺平第一条路

【免费下载链接】Instella-MoE-16B-A3B-Midtrain项目地址: https://ai.gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-Midtrain

AMD ROCm环境搭建是运行 Instella-MoE-16B-A3B-Midtrain 模型的第一步,也是许多新手最容易卡住的地方。本文是一份面向初学者的完整 AMD ROCm 环境搭建指南,从硬件要求、驱动安装、依赖配置到模型加载推理,一步步带你走通全程,让你在 AMD 显卡上顺利跑起这个由 AMD 官方开源的 MoE 大语言模型。

Instella-MoE-16B-A3B-Midtrain 是 AMD 官方发布的 Instella-MoE 系列模型的"中段训练"(Mid-training)检查点,总参数 160 亿、每 token 仅激活 28 亿参数,属于稀疏激活的 Mixture-of-Experts(MoE)架构,内含 64 个路由专家和 2 个共享专家,并引入了 Gated MLA 注意力与 FarSkip-Collective 通信优化。它从预训练到 RL 全流程都在 AMD Instinct™ MI300X / MI325X 上使用 AMD ROCm™ 软件栈训练而成,堪称"为 AMD 而生"的模型。

一、为什么需要搭好 ROCm 环境?

很多新手习惯把 CUDA 那套思路直接套到 AMD 卡上,结果一运行就报错。原因很简单:Instella-MoE 系列模型从训练到推理都深度依赖 AMD ROCm™ 生态,模型代码中大量用到 ROCm 专属的算子与加速库。ROCm 环境搭建不到位,后面无论是AutoModelForCausalLM.from_pretrained加载模型,还是 FlashAttention 加速,都会寸步难行。

可以说,一套干净、版本匹配的 AMD ROCm 环境,决定了你后续所有步骤的成败。

二、动手前的硬件与系统要求

在开始 AMD ROCm 环境搭建之前,先对照检查你的设备是否满足最低要求:

项目推荐要求
GPUAMD Instinct MI300X / MI325X 等 CDNA 架构加速卡;Radeon RX 系列(ROCm 5.7+ 逐步支持)
显存建议 48GB 以上(16B 参数 bf16 权重约 32GB,还需额外显存存放激活与 KV Cache)
系统Ubuntu 22.04 / 24.04 LTS(ROCm 官方支持度最高的发行版)
内核官方支持列表内的 Linux 内核版本

💡 提示:若显存不足,可先尝试load_in_4bitload_in_8bit量化加载,但需要额外安装 bitsandbytes 并确认其 ROCm 版本支持。

三、AMD ROCm 环境搭建详细步骤

第 1 步:确认显卡与内核兼容性

打开终端,先确认你的显卡能否被系统识别:

lspci | grep -i amd uname -a

如果能看到 AMD 显卡设备信息,且内核版本在官方支持列表内,就可以继续下一步了。

第 2 步:安装 AMD ROCm 驱动(最快配置方法)

推荐使用 AMD 官方仓库安装,这是最简单可靠的方式:

wget https://repo.radeon.com/amdgpu-install/latest/ubuntu/jammy/amdgpu-install_6.x.x_all.deb sudo apt install ./amdgpu-install_*.deb sudo amdgpu-install --usecase=rocm

安装完成后务必重启系统,然后验证安装:

rocm-smi

如果能看到 GPU 的温度、利用率等信息,说明 ROCm 环境搭建的核心部分已经成功。✨

第 2 步补充:安装 ROCm 核心软件栈

sudo apt install rocm

安装完成后,将当前用户加入rendervideo组,避免权限问题:

sudo usermod -a -G render,video $USER

重新登录后,运行rocm-smi再验证一次即可。

第 3 步:创建 Python 虚拟环境

为了避免依赖冲突,强烈建议用虚拟环境隔离:

python3 -m venv instella-env source instella-env/bin/activate

第 4 步:安装 PyTorch for ROCm 与依赖库

注意不要装普通的 CUDA 版 PyTorch!请从 PyTorch 官方 ROCm 通道安装:

pip install torch torchvision --index-url https://download.pytorch.org/whl/rocm6.2 pip install transformers accelerate safetensors

⚠️ 关键点:本项目要求transformers>=4.57.1,并且加载时需要开启trust_remote_code=True,因为模型使用了仓库内的自定义代码(modeling_instella_moe.pyconfiguration_instella_moe.py)。

四、获取 Instella-MoE-16B-A3B-Midtrain 模型

模型权重较大(13 个 safetensors 分片,合计约 30GB+),建议直接克隆仓库到本地:

git clone https://gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-Midtrain cd Instella-MoE-16B-A3B-Midtrain

仓库结构一目了然:模型权重model-00001-of-00013.safetensorsmodel-00013-of-00013.safetensors、索引文件model.safetensors.index.json、以及自定义模型代码modeling_instella_moe.pyconfiguration_instella_moe.py

五、快速推理验证:让模型开口说话

环境就绪后,用下面这段精简代码验证 AMD ROCm 环境是否真正打通:

from transformers import AutoModelForCausalLM, AutoTokenizer checkpoint = "amd/Instella-MoE-16B-A3B-Midtrain" tokenizer = AutoTokenizer.from_pretrained(checkpoint, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( checkpoint, device_map="auto", torch_dtype="bfloat16", trust_remote_code=True, ) prompt = [{"role": "user", "content": "What is Mixture-of-Experts?"}] inputs = tokenizer.apply_chat_template( prompt, add_generation_prompt=True, return_tensors="pt" ) tokens = model.generate( inputs.to(model.device), max_new_tokens=256, temperature=0.6, top_p=0.95, do_sample=True, ) print(tokenizer.decode(tokens[0], skip_special_tokens=False))

如果能在终端看到完整输出,恭喜你,AMD ROCm 环境搭建彻底成功,模型已在你的 AMD 显卡上跑起来了!🎉

六、常见问题排查速查表

报错现象原因与解决办法
rocm-smi: command not foundROCm 安装不完整,重新执行amdgpu-install --usecase=rocm
CUDA 相关报错装错了 PyTorch 版本,改用--index-urlROCm 通道重新安装
KeyError: instellamoe忘记加trust_remote_code=True,或 transformers 版本过低
显存不足(OOM)降低max_new_tokens、开启量化加载,或升级更大显存的显卡
推理速度慢安装支持 ROCm 的 FlashAttention,并确认注意力实现正确启用

七、总结

从零开始做 AMD ROCm 环境搭建并不复杂,关键就是三步:装对驱动、装对 PyTorch、开对开关。对照本文的步骤走一遍,Instella-MoE-16B-A3B-Midtrain 就能在 AMD 显卡上流畅运行。这也是你在 AMD 生态里体验 MoE 大模型的第一步——后续你还可以继续探索同系列的 Pretrain、Base、SFT、DPO、Think 等各个训练阶段检查点(详见 README.md 中的模型表格),一步一步玩转 AMD 大模型生态。祝你在 ROCm 的世界里玩得开心!🚀

【免费下载链接】Instella-MoE-16B-A3B-Midtrain项目地址: https://ai.gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-Midtrain

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/19 17:49:01

Gridism 是什么?一个简单到极致的响应式 CSS 网格框架完整指南

Gridism 是什么?一个简单到极致的响应式 CSS 网格框架完整指南 【免费下载链接】gridism A simple responsive CSS grid. 项目地址: https://gitcode.com/gh_mirrors/gr/gridism Gridism 是一个简单到极致的响应式 CSS 网格框架,整个框架仅有一份…

作者头像 李华
网站建设 2026/8/19 17:45:22

8月19日AI格局日报:OpenAI暂停RL训练+世界机器人大会开幕+港股双雄暴跌+Groq转型Neocloud+Cursor Origin上线+俄亥俄核废墟变8GW AI工厂

摘要 2026 年 8 月 19 日,AI 行业六大事件同时引爆:OpenAI 暂停 Astra 前沿模型 RL 训练并全面升级安全防护体系(Activation Classifiers 每 Token 监控 30 分钟警报 20% 推理算力开销);2026 世界机器人大会在北京开…

作者头像 李华
网站建设 2026/8/19 17:43:26

ppfuzz 实战技巧:如何高效批量扫描 1000+ URL 的 7 个方法

ppfuzz 实战技巧:如何高效批量扫描 1000 URL 的 7 个方法 【免费下载链接】ppfuzz A fast tool to scan client-side prototype pollution vulnerability written in Rust. 🦀 项目地址: https://gitcode.com/gh_mirrors/pp/ppfuzz ppfuzz 是一款…

作者头像 李华
网站建设 2026/8/19 17:36:58

文件解包工具终极指南:一款万能解压工具搞定500+格式

文件解包工具终极指南:一款万能解压工具搞定500格式 【免费下载链接】UniExtract2 Universal Extractor 2 is a tool to extract files from any type of archive or installer. 项目地址: https://gitcode.com/gh_mirrors/un/UniExtract2 你有没有遇到过这种…

作者头像 李华