self-llm 实战:Ubuntu 24.04 + ROCm 7.13(TheRock)部署 Qwen3.5 推理环境准备全指南
发布时间:2026/9/20 13:39:52 锦皓数字建站
部署 Qwen3.5 推理环境准备全指南`)
大模型人工智能教程本地部署微调【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址https://gitcode.com/datawhalechina/self-llm点击查看免费下载本文是 Datawhale《开源大模型食用指南》self-llmAMD 专题目录 的环境准备篇基于 1-env-prepare-ubuntu24-rocm7.md 展开并融合仓库内 vLLM / LM Studio / Ollama / llama.cpp 四篇部署文档2-lm-studio-rocm7-deploy.md、3-vllm-rocm7-deploy.md、4-ollama-rocm7-deploy.md、5-llamacpp-rocm7-deploy.md的验证细节。本文讲解如何在 Ubuntu 24.04以及 Windows 11上以 AMD Ryzen AI Max / Maxgfx1151为参考硬件完整搭建ROCm 7.13TheRock / Core SDK 体系 PyTorch 2.11.0 vLLM的 Qwen3.5 推理环境。读完本文你将掌握 TheRock 新体系的路径与包名变化、旧 ROCm 的清理方法、OEM Kernel 6.14 安装、GPU 权限配置、PyTorch 的 pip 安装与验证以及 vLLM Docker 镜像的拉取与容器内验证为后续 vLLM、LM Studio、Ollama、llama.cpp 四种部署路线打下可复现的环境基础。一、为什么先讲 ROCm 7.13 / TheRockQwen3.5 环境的新变量Qwen3.5 采用较新的混合架构Gated Delta Network 线性注意力与全注意力交错堆叠模型类型为qwen3_5。架构新意味着两个直接后果推理框架必须够新vLLM、transformers需要支持qwen3_5模型类型旧版本会出现模型类型不识别的加载失败详见 vLLM 部署文档的常见问题底层运行时必须是新体系ROCm 7.13 进入 TheRock / Core SDK 体系后核心路径和包名都发生了结构性变化如果沿用旧版 ROCm 的习惯很容易在安装与链接阶段踩坑。ROCm 7.13 与旧版 ROCm 的关键差异如下表项目旧版 ROCmROCm 7.13核心路径/opt/rocm//opt/rocm/core为核心路径包名前缀rocm-*、hip*、roc*amdrocm-*兼容性legacy ROCmCore SDK 保持 ABI / API 兼容并通过 symlink 兼容常用路径从源码结构看本专题所有部署文档vLLM / LM Studio / Ollama / llama.cpp都以已完成本环境准备为前置条件例如 vLLM 部署文档 明确写出前置条件已完成 Ubuntu 24.04 ROCm 7 环境准备。因此这一篇是整个models_amd/qwen3.5专题的地基。二、清理已有的 ROCm / AMD 相关软件避免新旧冲突如果系统里已经装过旧版 ROCm、旧 HIP SDK 或旧amdgpu-dkms建议先清理避免与 ROCm 7.13 / TheRock 组件冲突。TheRock 体系下新旧包名并存混装极易导致链接器找到错误的库。sudo apt remove rocm* amdrocm* amdgpu-dkms* -y sudo apt autoremove -y此外如果此前配置过旧的 ROCm 环境变量建议检查以下位置是否残留旧路径~/.bashrc~/.zshrc/etc/profile.d/残留的export PATH/opt/rocm/bin:$PATH、LD_LIBRARY_PATH等旧路径会与/opt/rocm/core的新核心路径产生遮蔽建议统一改为指向新体系路径。提示若后续使用 Docker 路线如 llama.cpp 的 Docker 编译方式宿主机还需要安装amdgpu-dkms请按需保留或单独安装不要与本文的清理动作混淆。三、Ubuntu 24.04 gfx1151 准备步骤三个小节3.1 安装 OEM kernel 6.14AMD Ryzen AI Max 系列需要较新的内核才能完整暴露 KFD / DRM 设备安装 OEM 内核并重启sudo apt update sudo apt install -y linux-image-6.14.0-1018-oem sudo reboot3.2 安装基础依赖系统需要 Python 3.13PyTorch 2.11.0 ROCm 路线要求以及编译与工具类依赖sudo apt update sudo apt install -y \ python3.13 python3.13-venv \ libatomic1 libquadmath0 \ build-essential git curl wget jq pciutils各依赖的作用说明python3.13/python3.13-venv提供 Python 3.13 解释器与标准库虚拟环境备用路线libatomic1/libquadmath0ROCm 编译产物运行时所需的底层数学与原子操作库缺失会导致加载.so时报undefined symbolbuild-essential git curl wget jq pciutils编译工具链、代码获取、HTTP 下载、JSON 解析与 PCI 设备枚举jq在后续所有测速脚本中都会用到。3.3 配置 GPU 权限将当前用户加入render与video组使非 root 用户也能访问/dev/kfd与/dev/dri/renderD*sudo usermod -a -G render,video $LOGNAME sudo reboot或使用 udev 规则统一放开权限sudo tee /etc/udev/rules.d/70-amdgpu.rules EOF KERNELkfd, GROUPrender, MODE0666 SUBSYSTEMdrm, KERNELrenderD*, GROUPrender, MODE0666 EOF sudo udevadm control --reload-rules sudo udevadm trigger sudo reboot权限配置后可用amd-smi验证 GPU 可见性。本专题 llama.cpp 部署文档 同样使用amd-smi确认 GPU 型号、驱动与 ROCm 版本环境是否就绪一眼可辨效果如上文插图。四、安装 PyTorch 2.11.0ROCm 7.13 / gfx1151pip 路线本小节对应 vLLM 部署文档 中PyTorch 2.11.0 属于 ROCm 7.13 pip 安装路线的说法Docker 镜像内置 PyTorch 2.10.0pip 路线安装 PyTorch 2.11.0两条路线的版本不要混写。4.1 安装 uv 并创建虚拟环境# 安装 uv如已安装可跳过 curl -LsSf https://astral.sh/uv/install.sh | sh # 安装 Python 3.13 uv python install 3.13 # 创建并激活虚拟环境 uv venv --python 3.13 source .venv/bin/activate备用使用 Python 标准库 venv不依赖 uv# python3.13 -m venv .venv # source .venv/bin/activate # python -m pip install --upgrade pip4.2 安装 ROCm 版 torch 全家桶从 AMD 官方 wheel 源gfx1151架构安装uv pip install --index-url https://repo.amd.com/rocm/whl/gfx1151/ \ torch2.11.0rocm7.13.0 \ torchvision0.26.0rocm7.13.0 \ torchaudio2.11.0rocm7.13.0版本对应关系torch2.11.0rocm7.13.0PyTorch 主版本 2.11.0ROCm 构建版本 7.13.0torchvision0.26.0rocm7.13.0、torchaudio2.11.0rocm7.13.0与 torch 2.11 配套的生态包wheel 源路径中的gfx1151与硬件架构严格对应务必与你的 GPU 架构一致。4.3 验证安装python - PY import torch print(torch:, torch.__version__) print(HIP available:, torch.cuda.is_available()) if torch.cuda.is_available(): print(device:, torch.cuda.get_device_name(0)) PY预期输出中HIP available: True且能打印出设备名如 Ryzen AI Max 395说明 PyTorch 已正确链接 ROCm 运行时。注意ROCm 体系下 PyTorch 复用torch.cudaAPI 作为 HIP 的统一入口torch.cuda.is_available()返回True表示 HIP 后端可用。五、Windows 11 pip 路线ROCm 7.13Windows 11 上 ROCm 7.13 采用 pip / TheRock 路线。开始前需要卸载已有的 HIP SDK关闭 WDAGWindows Defender Application Guard/ SAC安装 AMD Software: Adrenalin Edition 26.5.1 或更新版本。然后执行PowerShell# 安装 uv如已安装可跳过 irm https://astral.sh/uv/install.ps1 | iex # 安装 Python 3.13 uv python install 3.13 # 创建并激活虚拟环境 uv venv --python 3.13 .venv\Scripts\activate # 备用使用 Python 标准库 venv # py -3.13 -m venv .venv # .venv\Scripts\activate uv pip install --index-url https://repo.amd.com/rocm/whl/gfx1151/ torch2.11.0rocm7.13.0 torchvision0.26.0rocm7.13.0 torchaudio2.11.0rocm7.13.0 python -c import torch; print(torch.cuda.is_available())两条路线的差异在于包管理命令Linux 的curl | sh对应 Windows 的irm | iexwheel 源与版本号完全一致便于在双系统之间复用同一套部署经验。六、vLLM 环境验证Docker 方式6.1 拉取官方验证镜像ROCm 7.13 官方 vLLM Docker 镜像以gfx1151为例docker pull rocm/vllm:rocm7.13.0_gfx1151_ubuntu24.04_py3.13_pytorch_2.10.0_vllm_0.19.1注意vLLM 0.19.1 Docker 镜像内置 PyTorch 2.10.0PyTorch 2.11.0 是 pip 安装路线。镜像标签本身已经把架构、系统、Python、PyTorch、vLLM 版本全部编码在内切勿混写。6.2 启动容器docker run -it --rm \ --device /dev/kfd \ --device /dev/dri \ --networkhost \ --ipchost \ --group-addvideo \ --cap-addSYS_PTRACE \ --security-opt seccompunconfined \ -v ~/models:/app/models \ -e HF_HOME/app/models \ rocm/vllm:rocm7.13.0_gfx1151_ubuntu24.04_py3.13_pytorch_2.10.0_vllm_0.19.1 \ bash启动参数逐项说明这些参数同样出现在 vLLM 部署文档 的服务启动命令中是 AMD GPU 容器的标准模板参数作用--device /dev/kfd暴露 AMD GPU 计算设备节点KFD--device /dev/dri暴露 DRM 渲染节点--networkhost --ipchost与宿主机共享网络与进程间通信命名空间--group-addvideo让容器内的进程具备 video 组权限--cap-addSYS_PTRACE允许调试/剖析 GPU 栈所需的能力--security-opt seccompunconfined解除 seccomp 限制避免 GPU 系统调用被拦截-v ~/models:/app/models、-e HF_HOME/app/models将宿主模型目录挂载为 Hugging Face 缓存目录6.3 容器内验证python -c import vllm; print(vLLM:, vllm.__version__) python -c import torch; print(PyTorch:, torch.__version__, HIP:, torch.cuda.is_available())七、Qwen3.5 部署前检查清单如果后续 vLLM 部署 时出现模型加载失败优先按以下顺序排查vLLM 版本是否为 ROCm 7.13 对应版本或官方镜像。Qwen3.5 架构较新旧版本可能无法识别qwen3_5模型类型建议使用vllm/vllm-openai-rocm:latest官方镜像或较新版本transformers 版本是否满足 Qwen3.5 所需版本对照 NVIDIA 路线的 Qwen3.5 vLLM 部署文档Qwen3.5 需要transformers4.57级别的新版本上下文长度--max-model-len是否过大导致显存/统一内存不足可先从 4096 降到 2048 验证thinking 模式API 请求中是否按需设置enable_thinkingQwen3.5 默认开启思维链角色扮演/简短问答场景建议显式关闭详见 vLLM 部署文档的 thinking mode 说明。八、环境就绪后的四条部署路线环境准备完成后可继续本专题的任意一条部署路线路线文档适用场景vLLM推荐3-vllm-rocm7-deploy.mdOpenAI-compatible API、高吞吐服务、thinking mode 控制LM Studio2-lm-studio-rocm7-deploy.md零基础图形界面、ROCm 版 llama.cpp 后端、GGUF 模型Ollama4-ollama-rocm7-deploy.md一键安装系统服务、ollama pull/run命令行体验llama.cpp5-llamacpp-rocm7-deploy.md轻量级单机推理、预构建 ROCm 可执行文件或源码编译四条路线共用的环境前提本篇文章包括OEM Kernel 6.14、render/video组权限、ROCm 7.13 运行时、PyTorch 2.11.0pip 路线或 vLLM 0.19.1 Docker 镜像容器路线以及通过amd-smi确认的 GPU 架构gfx1151。此外仓库 AMD 云平台指南 还提供了 AMD Ryzen AI MAX 395约 64 GB 统一内存的云端验证途径可作为本地环境未就绪时的替代入口。九、延伸学习本专题的 LM Studio、vLLM、Ollama、llama.cpp 部署文档与本文构成完整的部署闭环更完整的 ROCm 部署、微调与基础设施教程可参考 Datawhale 的 hello-rocm 项目的01-deploy专区本文内容正是按其适配 self-llm 目录结构而来仓库 models_amd/gemma4 目录提供了 Ubuntu 24.04 ROCm 7 体系下的完整环境准备1-env-prepare-ubuntu24-rocm7.md与多引擎部署文档可作为同类环境的对照参考NVIDIA 路线下 Qwen3.5 的部署细节vLLM 0.23.0、CUDA 13、transformers4.57见 models/Qwen3.5 专题可用于对比理解 ROCm 路线的差异。赞分享大模型人工智能教程本地部署微调【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址https://gitcode.com/datawhalechina/self-llm点击查看免费下载相关推荐Datawhale self-llm 实战Ubuntu 24.04 ROCm 7 下用 LM Studio 零基础部署 Qwen3.5 系列模型Datawhale self llm 实战Ubuntu 24.04 ROCm 7 下用 LM Studio 零基础部署 Qwen3.5 系列模型 本文是《大模型人工智能教程本地部署微调Ollama 部署 Qwen3.5 模型实战Ubuntu 24.04 ROCm 7 环境下的安装、GGUF 导入与推理测速Ollama 部署 Qwen3.5 模型实战Ubuntu 24.04 ROCm 7 环境下的安装、GGUF 导入与推理测速 本指南面向 AMD GPUR大模型人工智能教程本地部署微调爱享素材下载器使用教程启动一次代理三步拿到视频号、抖音、快手等平台的视频图片爱享素材下载器使用教程启动一次代理三步拿到视频号、抖音、快手等平台的视频图片 爱享素材下载器是一款跨平台开源的资源下载工具核心功能是自动识别并抓取视频号、大模型人工智能教程本地部署微调上一篇【亲测免费】 PySyft 项目教程下一篇深度演讲者Deep Speaker项目指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。