资讯详情

资讯详情

没有NVLink怎么办?club-3090纯PCIe多卡P2P通信配置实战

没有NVLink怎么办club-3090纯PCIe多卡P2P通信配置实战【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090club-3090是一个面向 RTX 3090/4090/5090 消费级显卡的开源项目提供 vLLM、llama.cpp、SGLang 等多引擎的 LLM 多卡推理配置。很多用户以为双卡跑大模型必须上 NVLink 桥实际上 club-3090 的默认路径在纯 PCIe 上就能稳定运行——而如果你愿意多做一步开启 PCIe P2P 通信还能在预填充prefill阶段额外榨出 12%59% 的吞吐。这篇实战指南就讲清楚没有 NVLink 时GPU 之间到底怎么通信、P2P 是否值得开、以及如何一步步配置和验证。为什么PHB不是死胡同纯PCIe双卡怎么通信先纠正一个最常见的误解。运行nvidia-smi topo -m后看到 GPU 之间是PHB经过 CPU 主桥而不是PIXPCIe 交换机不代表配置有问题——绝大多数消费级主板根本没有 PCIe 交换芯片两张卡都直接挂在 CPU 的 IO die 上PHB就是正确且预期的结果。关键结论在 docs/HARDWARE.md 中写得很明确NVLink 不是必需的。club-3090 的双卡 compose 会在启动时自动检测 NVLink没检测到 NVLink纯 PCIe自动给 vLLM 传--disable-custom-all-reduce并设置NCCL_P2P_DISABLE1NCCL 通过主机内存中转 GPU↔GPU 流量——稳健、免调优、开箱即用检测到 NVLink自动启用 custom all-reduceNCCL 走 NVLink 路径。也就是说纯 PCIe 机器的默认路径是牺牲一点带宽换绝对稳定。而 P2P 的价值在于让 NCCL 直接走 PCIe 总线点对点传输主要收益在 prefill长上下文、大批 promptdecode 收益很小。三步自检你的P2P到底开没开P2P 开着吗其实是三个独立的问题混在一起排查是最常见的错误来源完整剖析见 docs/PCIE_P2P.md层次问题怎么查1. 驱动层GPU↔GPU 直接访问是否被驱动授权nvidia-smi topo -p2p rw显示OK2. NCCL 层授权的通道是否被真正使用看启动日志里的NCCL_P2P_LEVEL解析结果3. vLLM 自定义 all-reducevLLM 额外的 kernel 是否启用vLLM 日志中Custom allreduce is disabled…表示没启用第 3 层有个容易被忽略的设定超过 2 张 PCIe 卡时vLLM 会主动禁用 custom all-reduce它要求全 NVLink 网格。所以 3 卡及以上的 PCIe 机器看到这句日志属于设计如此不是配置错误P2P 依然通过第 2 层的 NCCL 通道生效。快速配置清单BIOS、插槽与NUMA如果你决定要开 P2P消费级 GeForce 卡的 P2P 需要打过补丁的驱动模块stock 驱动会拒绝先过一遍硬件清单docs/PCIE_P2P.md 按顺序列了六道关卡拓扑两卡必须在同一 CPU 插槽域出现SYS跨 NUMA/跨插槽直接放弃BIOS开启Above 4G DecodingRe-Size BARReBAR裸机 P2P 建议 IOMMU 设为 passthroughiommupt并关闭 ACS——ACS 强制 peer 流量绕行根复合体是排名第一的隐形杀手NUMAEPYC 平台在 BIOS 里设NPS1保证两卡同属一个 NUMA 域插槽间距两张三槽卡之间至少隔 3 个槽位注意 M.2/NVMe 可能与某条 x16 槽共享通道装卡后用nvidia-smi查实际训练出的链路宽度优先选 CPU 直连通道同为PHB挂在 CPU 直连通道的卡带宽可达 13 GB/s挂芯片组的只有约 6.5 GB/s——topo -m分辨不出这个差异只能实测ReBAR 是大 BAR1 的前提补丁驱动路径通过 BAR1 映射整块显存BAR1 只有 256MB 的卡预 ReBAR 时代 VBIOS此路径不可达。 上图底部标注 PCIe-only, 230W ——这就是没有 NVLink 的 club-3090 双 3090 在 TP2 下的真实水平dual-dflash 档代码场景跑到 125 TPS。在引擎里打开P2P每个引擎都有自己的开关驱动授权 ≠ 引擎在用这是第二常见的坑。club-3090 各引擎的开关与默认值详见 docs/PCIE_P2P.md → §0c引擎默认开启方式逃生阀关闭vLLM检测到 P2P 授权后自动开启NVLINK_MODEpcie_p2p强制NVLINK_MODEforce_off或NCCL_P2P_DISABLE1vLLM custom all-reduce≤2 卡随传输层启用2 卡自动禁用—DISABLE_CUSTOM_ALL_REDUCE1只关 kernel保留 NCCL P2P 传输层收益llama.cpp⚠️ 默认关opt-inGGML_CUDA_P2P1--split-mode row/tensor取消该环境变量SGLang有授权时自动使用无需操作无NCCL_P2P_DISABLE1club-3090 的使用体验在于保存一个设置即可全局生效bash scripts/settings.sh set NVLINK_MODEpcie_p2p启动器 scripts/detect_nvlink.sh 随后会把所有双卡/多卡 compose 切到NCCL_P2P_LEVELPHB custom all-reduce 开启的状态反过来P2P 行为异常时一句bash scripts/settings.sh set NVLINK_MODEforce_off就能回到补丁前的行为。验证P2P真正生效report.sh 与 p2p-validate.sh能力查询topo -m只能告诉你能不能证明在用。club-3090 提供两级验证bash scripts/report.shscripts/report.sh启动容器后运行读取Boot log highlights下的Interconnect verdict行自动交叉比对主机能力与运行中容器的实际启用状态——✓ engaged/⚠ WARNNVLink 桥闲置/ℹ驱动支持但容器没用上并直接给出修复建议bash scripts/p2p-validate.shscripts/p2p-validate.sh跑两次带结果校验的 all-reduce一次 P2P 开、一次关作对照校验的是数值正确性而非跑完了能同时抓住挂死和错数据两类假授权问题只读、不改任何配置。还有一条实战建议任何硬件/BIOS/驱动改动后跑一次真实生成请求并读输出内容——项目里记录过所有指标全绿、集合通信正常完成、但模型输出全是感叹号的案例只有读生成的文本才能发现。实际能快多少别被数字误导来自 docs/PCIE_P2P.md → §6 的跨机器实测摘要场景实测收益双 3090TP2仅看 NCCL 传输层prefill 10K 14.4%、90K 12.2%TTFT 降 13–15%decode 在噪声范围内双 3090custom all-reduce 开启P2P 机器的出货默认decode 叙事 12.5% / 代码 7.1%4×3090TP4prefill 7485%decode 89%虚拟机内双 3090VFIO 直通prefill 16%59%虚拟机的主机中转路径更慢可回收空间更大llama.cpp-sm layer/-sm tensor约等于 0——官方镜像未编译 NCCL且 layer 模式走普通拷贝两点提醒收益主要来自延迟而非带宽张量并行 all-reduce 是大量小的串行传输P2P 把单次延迟从 15.23 µs 打到 1.01 µs链路利用率往往不到 20%。只看 GB/s 会得出P2P 没用的错误结论如果你只跑 GGUF/llama.cpp打补丁驱动换不来可测量的收益不值得为它维护 DKMS 构建。什么时候不值得折腾P2P单卡能装下模型club-3090 的单卡配置见 docs/SINGLE_CARD.md对单用户流式生成往往是更划算的选择第二张卡主要买的是容量与并发不是速度只用--split-mode layer卡间流量只有约 7 MB/s加速空间为零追求省心纯 PCIe 默认路径NCCL 走主机内存中转稳健免调P2P 属于锦上添花的进阶项。小结没有 NVLink 的 club-3090 多卡机器完全可以用而且比很多人以为的更快默认路径开箱即用想榨出 PCIe 总线的全部潜力时按 docs/PCIE_P2P.md 的六道关卡逐项过一遍——BIOS 开 ReBAR/关 ACS → 装好补丁驱动 →settings.sh set NVLINK_MODEpcie_p2p→report.sh看 Interconnect verdict →p2p-validate.sh做数值校验 → 读真实输出。双卡 prefill 提速两位数、虚拟机里最高近 60%这就是纯 PCIe 多卡 P2P 通信的全部回报。相关延伸阅读docs/DUAL_CARD.md双卡选哪个 slug、docs/HARDWARE.mdNVLink 与 PCIe 对比。【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →