TokenSpeed在AMD GPU上跑起来:ROCm部署LLM推理的完整路径
发布时间:2026/10/8 13:06:58 锦皓数字建站

TokenSpeed在AMD GPU上跑起来ROCm部署LLM推理的完整路径【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeedTokenSpeed 是一款光速级 LLM 推理引擎不仅支持 NVIDIA GPU也完整支持 AMD GPU 的 ROCm 部署。本文带你从零开始在 AMD Instinct 系列MI350X/MI355Xgfx950及 RDNA4 显卡上完成 TokenSpeed 的安装、验证与推理服务启动掌握 ROCm 环境部署 LLM 推理的完整路径。一、先了解 TokenSpeed 的 AMD 支持能力TokenSpeed 采用内核插件化架构核心引擎与硬件无关真正的加速由tokenspeed-kernel内核注册表按 GPU 架构自动选择实现。针对 AMD项目内置了独立的 tokenspeed-kernel-amd 内核包用 Gluon 编写的高性能内核覆盖算子族gfx950CDNA4gfx1250 / gfx1201AttentionMHA、MLA、DSA、KDAMHA、MLA、KDAgfx1201 走通用 Triton 路径MoEBF16、MXFP4 权重—GEMM / Sampling专用调优内核—在 MI355X 上实测Gluon Attention 内核比 Triton 基线快 1.4–2.3 倍小 batch 下 MoE 比 Triton 快 1.7–2.1 倍。性能细节见 tokenspeed-kernel-amd/README.md。二、环境准备ROCm 7.2 PyTorchAMD 路径的官方验证环境是ROCm 7.2要求 Linux x86_64 主机、Python 3.10–3.13。关键点必须先安装 ROCm 版 PyTorch再安装 TokenSpeed否则 pip 会选到 CUDA 依赖。python -m pip install torch2.14.0 torchvision0.29.0 \ --index-url https://download.pytorch.org/whl/rocm7.2安装完成后一行断言即可确认 PyTorch 是 HIP 后端python -c import torch; assert torch.version.hip三、安装 TokenSpeedNightly 一行命令在上面的环境基础上直接使用 ROCm 专用 nightly 索引python -m pip install --upgrade tokenspeed \ --extra-index-url https://lightseek.org/whl/nightly/rocm7.2 python -m pip check这里有三个新手容易踩的坑不要同时配置 CUDA 与 ROCm 两个索引——内核 wheel 版本号相同但后端依赖不同混用会装坏想固定版本可指定tokenspeed0.1.0.postYYYYMMDD该日期需同时存在于两个索引升级旧版本时用--no-cache-dir --force-reinstall。完整说明见 docs/guides/getting-started.md。四、验证与首次启动安装完成后用两条命令做冒烟验证tokenspeed env tokenspeed serve --help然后启动第一个推理服务。对于 RDNA4gfx1201如 Radeon AI PRO R9700这类消费级/工作站显卡初始支持 Dense BF16 路径推荐从 Triton 注意力 eager 执行开始tokenspeed serve Qwen/Qwen3-0.6B \ --host 127.0.0.1 \ --dtype bfloat16 \ --world-size 1 \ --attention-backend triton \ --enforce-eager \ --disable-prefill-graph服务起来后标准 OpenAI 兼容 API 即可在http://127.0.0.1:8000上使用。五、大模型实战8 卡 gfx950 部署旗舰模型如果你有 8 张 MI350X/MI355XAMD 的标准部署路径已经过完整调优。以 Kimi K3 为例docs/recipes/models.md 中有全部模型的启动配方tokenspeed serve moonshotai/Kimi-K3 \ --served-model-name kimi-k3 \ --trust-remote-code \ --max-model-len 8192 \ --kv-cache-dtype fp8 \ --tensor-parallel-size 8 \ --enable-expert-parallel \ --attention-backend mla \ --moe-backend auto \ --max-num-seqs 32 \ --disable-kvstore \ --host 0.0.0.0 \ --port 8000这条命令的精髓在于两个auto/自动选择--attention-backend mla自动选用 gfx950 上的 MLA 内核如需强制 Gluon 内核含投机解码 drafter换成--attention-backend gluon --drafter-attention-backend gluon注册表找不到对应内核时会快速失败而非静默降级--moe-backend auto在 TP8/EP8 下自动选用专用 Gluon SiTU 内核单 token 解码还会自动融合路由 MXFP4 专家与共享专家。追求极限吞吐时还有一键开启 Gluon Petit MegaMoE 的 DP8/EP8 组合配方同样在 docs/recipes/models.md 中。六、进阶Docker 容器与源码安装容器方式项目提供了现成的 AMD 镜像构建文件 docker/Dockerfile.amd基于rocm7.2.4-pytorch-2.13.0-gfx950基础镜像按顺序安装 tokenspeed-kernel-amd、tokenspeed-kernelTOKENSPEED_KERNEL_BACKENDrocm、tokenspeed-scheduler 和主运行时适合团队统一环境。源码方式在仓库根目录依次安装即可内核包的 Python 元数据会自动带上 ROCm 后端依赖pip install --force-reinstall --no-deps ./tokenspeed-kernel-amd --no-build-isolation TOKENSPEED_KERNEL_BACKENDrocm pip install tokenspeed-kernel/python/ --no-build-isolation pip install tokenspeed-scheduler/ pip install ./python --no-build-isolation⚠️ 顺序很重要tokenspeed-kernel-amd必须先于tokenspeed-kernel就位后者才能解析出 ROCm 需求。七、常见架构速查GPU架构代号推荐路径MI350X / MI355Xgfx950CDNA4Gluon 专用内核MLA/DSA/KDA MoE GEMM旗舰性能Radeon AI PRO R9700gfx1201RDNA4通用 Triton 内核 ROCm 库实现Dense BF16gfx1250—Attention/MoE 专用内核已就位TokenSpeed 会自动检测架构gfx1201与 CDNA4/CDNA5 分开识别CDNA 专属的矩阵与异步拷贝能力在 RDNA4 上保持关闭避免误用。八、小结与延伸阅读回顾一下完整路径ROCm 7.2 主机 → 先装 ROCm PyTorch → nightly 索引装 TokenSpeed → tokenspeed env 验证 → tokenspeed serve 启动。整个过程无需编译任何 CUDA/HIP 代码wheel 即装即用。更多资料环境搭建总入口docs/guides/getting-started.md全模型启动配方含 Kimi K3 / GLM / Qwen 的 AMD 章节docs/recipes/models.mdAMD 内核包说明与性能数据tokenspeed-kernel-amd/README.md服务器参数参考docs/configuration/server.mdAMD 的 ROCm 生态正在快速成熟而 TokenSpeed 通过内核注册表机制让同一套引擎在 NVIDIA 与 AMD 平台上都能拿到接近硬件极限的推理性能——这正是光速推理的含义所在。【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。