资讯详情

资讯详情

RTX4090 跑 Qwen3-32B 压测,让走 TaoToken 的 Codex 复核 vLLM 配置

双卡 RTX4090 跑 Qwen3-32B-AWQ压测数据出来了但 vLLM 参数到底调没调对在双卡 RTX4090 上用 vLLM v0.8.5 把 Qwen3-32B-AWQ 跑起来再用simple-bench-to-api.py从 1 并发一路压到 100 并发拿到三组max_tokens下的延迟、成功率和吞吐量汇总表——这件事本身不难难的是压完之后盯着那张表心里没底tensor-parallel-size2、gpu-memory-utilization0.7、max-model-len16584这几个参数到底是刚好卡在 RTX4090 24GB×2 的合理区间还是已经留了太多余量、白白浪费了吞吐这篇不重复贴压测表而是换一个视角把已经跑出来的压测结果和 vLLM 启动命令交给走 TaoToken 的 Codex 做一次配置复核。如果你也想让 Codex 帮你逐项检查 vLLM 参数是否匹配 RTX4090 的显存与并发表现可以先打开 TaoToken 官网 创建一个 Key再在 Codex 的模型配置里把 Base URL 指向https://taotoken.net/api。这样消耗的是 TaoToken 提供的调用额度而不是让本地 GPU 继续空跑压测。一、原问题与场景压测跑完了参数复核还没做先还原一下现场。模型用的是 ModelScope 上的Qwen/Qwen3-32B-AWQ量化版本vLLM 版本 v0.8.5双卡 RTX4090。启动命令大致是这样vllm serve /models/qwen/Qwen3-32B-AWQ \ --port 7869 \ --served-model-name qwen3 \ --tensor-parallel-size 2 \ --gpu-memory-utilization 0.7 \ --max-model-len 16584 \ --max-num-batched-tokens 16584 \ --dtype auto \ --enable-chunked-prefill \ --trust-remote-code \ --enable-auto-tool-choice \ --tool-call-parser hermes \ --enable-reasoning \ --reasoning-parser deepseek_r1 \ --api-key sk-xxx压测脚本是simple-bench-to-api.py并发梯度1,10,30,60,100max_tokens分别取1024,8192,16384每个组合持续 30 秒prompt 固定为 Introduce the history of China。从汇总表能读出几个关键信号成功率全程 100%说明在 100 并发以内没有出现 OOM 或请求被拒显存水位是安全的。总体吞吐量在 30 并发附近达到峰值max_tokens1024时 30 并发约 343 tokens/smax_tokens8192时约 378 tokens/smax_tokens16384时约 384 tokens/s。到 60、100 并发反而回落说明调度已经进入排队主导区间。单并发平均吞吐量随并发上升明显下降1 并发时 38~47 tokens/s100 并发时掉到 4~5 tokens/s这是典型的批处理摊薄效应。平均首字延迟在 100 并发时约 2.0~2.2s对交互式场景偏高但对离线批处理可以接受。问题就出在这里数据看着能用但gpu-memory-utilization0.7是否压得太保守max-model-len16584和max-num-batched-tokens16584设成同一个值是否合理tensor-parallel-size2在双卡 4090 上有没有更好的切分方式这些判断如果只靠肉眼看表很容易漏掉细节。让 Codex 对照命令和汇总表逐项过一遍是更省事的做法。二、TaoToken 前置把 Codex 的模型出口接过来Codex 本身是一个编码/推理助手它需要一个可用的模型后端。这里不折腾本地再起一个推理服务直接把 Codex 的 Base URL 指向 TaoToken 的 API 端点用 TaoToken 的调用额度来完成这次配置复核。需要准备的东西只有三样一个 TaoToken 的 API Key在控制台创建。Codex 的模型配置入口把 Base URL 填成https://taotoken.net/api。把 vLLM 启动命令和压测汇总表整理成一段可粘贴的文本。如果你还没创建 Key可以从 TaoToken 控制台 进入Key 的管理在 API Keys 页面。接入方式如果拿不准接入文档 里有 Base URL 和鉴权的说明。这一步的核心目的是让 Codex 的推理发生在 TaoToken 侧而不是占用本地 4090 的显存。本地 GPU 已经用来跑 Qwen3-32B 了再让它兼职做配置分析没有意义。三、可复制配置Codex 侧怎么填复核 prompt 怎么写Codex 的模型配置通常涉及 Base URL 和 API Key 两项。把 Base URL 设为https://taotoken.net/apiAPI Key 填你在 TaoToken 控制台创建的那一串示例里用YOUR_API_KEY占位。模型 ID 按你在 TaoToken 侧可用的模型来选这里不写死具体型号避免和实际可用列表不一致。配置好之后真正决定复核质量的是你贴给 Codex 的内容。建议按下面这个结构组织一次性把上下文给全我在双卡 RTX409024GB×2上用 vLLM v0.8.5 部署 Qwen3-32B-AWQ 启动命令如下 粘贴 vllm serve 完整命令 压测脚本 simple-bench-to-api.py并发 1/10/30/60/100 max_tokens 分别 1024/8192/16384每组 30 秒。 压测汇总关键数据 - max_tokens102430 并发总体吞吐约 343 tokens/s100 并发平均首字延迟约 2.07s - max_tokens819230 并发总体吞吐约 378 tokens/s100 并发平均延迟约 247s - max_tokens1638430 并发总体吞吐约 384 tokens/s100 并发平均延迟约 246s - 全程成功率 100% 请逐项检查以下参数是否匹配 RTX4090 的显存与并发表现 并指出哪些参数还有调整余量 1. tensor-parallel-size2 2. gpu-memory-utilization0.7 3. max-model-len16584 4. max-num-batched-tokens16584 5. enable-chunked-prefill 在当前并发下是否必要这样 Codex 拿到的不是一句帮我看看参数而是命令 数据 待检查项的完整上下文输出的建议才有针对性。四、验证请求与成功结果Codex 复核后应该给出什么配置完成后先发一个最小请求确认链路通。可以在 Codex 里问一句简单的话比如确认你能收到我的请求看是否有正常返回。如果这一步就报错先回到第五节排查。链路通了之后把上面那段复核 prompt 发出去。一次合格的复核输出里应该包含这几类信息对gpu-memory-utilization0.7的判断在双卡 4090 上0.7 意味着每卡预留约 30% 显存。结合压测全程 100% 成功率、100 并发无 OOM说明这个值偏保守有上调空间但上调多少要看max-model-len和 KV cache 的实际占用。对max-model-len与max-num-batched-tokens相等的判断两者设成同一个值 16584在长上下文场景下可能限制批处理灵活性Codex 应该会指出这两个参数职责不同是否要解耦。对tensor-parallel-size2的判断双卡 4090 没有 NVLink走 PCIe 通信TP2 是常见选择但要看是否出现通信瓶颈——压测里 30 并发后吞吐回落可能和调度有关也可能和卡间通信有关。对吞吐瓶颈的定位30 并发是吞吐峰值点60/100 并发回落Codex 应结合enable-chunked-prefill和批处理策略给出解释。拿到这些判断后你可以回到 vLLM 启动命令里做小步调整再跑一次压测对比。整个复核过程消耗的是 TaoToken 的调用额度本地 GPU 不用为了分析再跑一轮。五、本篇常见错排查错误 1Codex 请求返回 401 或鉴权失败。检查 API Key 是否填对Base URL 是否是https://taotoken.net/api注意不要多加路径。Key 如果刚创建确认没有多余空格。错误 2Codex 能通但复核结果很泛没有针对 RTX4090。大概率是 prompt 里没给全上下文。把 vLLM 启动命令原文、压测汇总的关键数字、待检查的参数列表都贴进去不要只写帮我看看 vLLM 参数。错误 3把压测汇总表整段贴进去Codex 反而抓不住重点。汇总表很长建议只贴关键行各max_tokens下的总体吞吐峰值、100 并发平均延迟、成功率。细节数据留在本地对照即可。错误 4误以为 Codex 会直接改你的 vLLM 配置。Codex 给的是判断和建议实际改参数、重启服务、重跑压测还是要在本地做。它不替代你的部署操作。错误 5Base URL 填成了官网首页地址。API 调用要用https://taotoken.net/api不是https://taotoken.net。这两个不是一回事。错误 6本地 GPU 还在跑压测同时让 Codex 分析结果两边都慢。压测和复核建议错开。压测阶段专注拿数据数据拿到后再用 Codex 做分析避免本地资源争抢。六、语义一致 CTA按你的下一步选入口这次的核心动作是用 Codex 复核 vLLM 配置所以最直接的入口是先把 Key 和接入方式搞定需要创建 Key、查看接入方式进 API Keys 和 接入文档。想先验证模型对话链路是否正常用 模型对话 做一次最小请求。如果你不只是这一次复核而是长期要做编码、Agent、配置分析这类任务看 Coding Plan把调用额度按长期用法规划。压测数据是你自己跑出来的参数判断让 Codex 帮你过一遍两边各司其职。本地 4090 继续服务推理配置复核走 TaoToken这条链路跑通一次后面再调 vLLM 参数就有了一套可复用的流程。
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →