资讯详情

资讯详情

提示吞吐暴涨3.4倍:Qwen3.8-Flash-Next-GSQ-RCO-GGUF中Q2_0凭什么比IQ2_XS快这么多

提示吞吐暴涨3.4倍Qwen3.8-Flash-Next-GSQ-RCO-GGUF中Q2_0凭什么比IQ2_XS快这么多【免费下载链接】Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF如果你正在为 Qwen3.8-Flash-Next 挑选 GGUF 量化版本Qwen3.8-Flash-Next-GSQ-RCO-GGUF仓库里的 Q2_0 构建值得重点关注它在提示处理prefill阶段达到367.49 tokens/s是 IQ2_XS 的3.4 倍端到端平均延迟也从 12.68 秒降到 6.70 秒——而且文件反而更小66.4 GB vs 68.0 GB。为什么同属 2.4~2.5 bpw 的量化速度差距能这么大答案藏在量化格式的解码方式里。先看数据提示吞吐暴涨 3.4 倍是怎么来的仓库用llama.cpp在 11 个场景类别编码、数学、RAG、写作、多语言等共 55 条提示上做了实测模型平均位宽总大小提示吞吐 (t/s)解码速率 (t/s)平均延迟任务均分Q2_02.40 bpw66.4 GB367.4993.796.70 s89.07IQ2_XS2.50 bpw68.0 GB108.1970.3012.68 s89.16从图中可以看出提示越长Q2_0 的优势越大——RAG 场景快9.6 倍、写作快 6.8 倍、编码快 6.2 倍而在提示较短、偏推理的类别STEM、数学、推理上Q2_0 反而略慢0.8x~0.9x因为提示太短时格式解码成本还没体现出差距。快的原因避开查找表格式是核心秘密很多人会以为速度快是因为文件小。但实测恰恰相反⚡ 两个文件只差 1.6 GB且Q2_0 是更小的一方37.6 GB vs 39.2 GB 的第一分片。差距来自量化格式本身而不是体积。IQ 系列 高压缩、高解码成本的查找表格式IQ2_XS 这个构建里大量使用了 IQ2_S68 个张量、IQ2_XXS22 个、IQ4_NL36 个、IQ4_XS181 个这类IQ 系列格式。它们能把精度塞进更少的比特里原理是用一张查找表codebook权值只存查表的索引实际数值靠查表还原。查表这件事要实打实地花时间而在 Qwen3.8-Flash-Next 这种每层 512 个专家、每 token 激活 10 个专家的 MoE 模型上专家矩阵乘占据绝大多数计算量——查找成本被成倍放大。Q2_0 直接解码速度稳定不掉链子Q2_0 构建则刻意避开了所有查找表格式张量主要分配为 Q2_0202 个、Q3_K91 个、Q4_K38 个等直接存储、直接解码的块格式。带来的直接好处是稳定性Q2_0 解码速率在各类场景间只波动2.0 t/s92.5~94.5 t/sIQ2_XS 波动高达45.1 t/s49.4~94.5 t/s——请求碰到的层越多查找开销越大速度就越飘也就是说Q2_0 的速度可预期这对生产环境很重要。 每个张量到底被分到了什么格式都可以在仓库里查到Qwen3.8-Flash-Next-GSQ-RCO-Q2_0-00001-of-00002.rco-allocation.txt 与 Qwen3.8-Flash-Next-GSQ-RCO-IQ2_XS-00001-of-00002.rco-allocation.txt 就是两个构建的完整分配清单可逐张量核对。质量代价只有 0.09 分几乎可以忽略换速度通常要牺牲精度但这次几乎没掉基准Q2_0IQ2_XSAIME2596.6796.67GPQA-Diamond89.3987.37LiveCodeBench v681.1483.43任务均分89.0789.16零样本平均相对 BF16 恢复率78.00101.4%77.16100.3%两者任务均分只差0.09 分且各有胜负Q2_0 在 GPQA-Diamond 上反超 2 分IQ2_XS 在 LiveCodeBench 上高 2.3 分。如果质量优先、显存也够可以看同仓库的更高档构建IQ3_XXS任务均分 92.5775.8 GB和 IQ3_S93.26超过 BF16 基线83.6 GB。怎么选3 种场景对应 3 种构建你的场景推荐构建理由长提示、RAG、写作、高并发服务Q2_0提示吞吐 367 t/s延迟最低均衡、想要同等质量下最小体积IQ2_XS68.0 GB质量与 Q2_0 持平显存吃紧但想要更好推理IQ3_XXS比 IQ3_S 少 7.8 GBAIME25 打平基线追求最强质量IQ3_S推荐档各任务不输 BF16下载与快速上手3 步跑起来git clone https://gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF cd Qwen3.8-Flash-Next-GSQ-RCO-GGUF llama-cli -m Q2_0/Qwen3.8-Flash-Next-GSQ-RCO-Q2_0-00001-of-00002.gguf \ -lm mmap --lazy-mode on -ngl 99⚠️ 两个使用要点必须下载两个分片第二分片是 n-gram 查找表28.8 GB固定 IQ4_NL但它按 token 稀疏读取加-lm mmap --lazy-mode on后可内存映射在磁盘上不占显存只需要第一分片Q2_0 为 37.6 GB进显存。多模态用法再下载 mmproj-Qwen3.8-Flash-Next-BF16.gguf0.91 GB视觉编码器投影器四个量化版共用配合llama-mtmd-cli即可处理图片。更多运行细节Ollama、LM Studio、Strata Engine见 README.md。仓库文件导航文件说明Q2_0/Qwen3.8-Flash-Next-GSQ-RCO-Q2_0-00001-of-00002.gguf速度档2.40 bpw最快IQ2_XS/Qwen3.8-Flash-Next-GSQ-RCO-IQ2_XS-00001-of-00002.gguf均衡档2.50 bpw同等质量最小IQ3_XXS/、IQ3_S/质量档3.00 / 3.50 bpwmmproj-Qwen3.8-Flash-Next-BF16.gguf视觉投影器多模态tensor-allocation/各构建的逐张量量化分配清单RCO 搜索结果可审计一句话总结Q2_0 快的秘诀不是更小而是选对了格式——用直接解码的块格式替换高压缩但高查找开销的 IQ 查找表格式在这台 512 专家 MoE 上换来 3.4 倍提示吞吐、1.9 倍延迟降低质量代价不到 0.1 分。追求吞吐就选 Q2_0追求均衡就选 IQ2_XS两者都是标准的 GGUF 文件llama.cpp / Ollama / LM Studio 零改动即可运行。【免费下载链接】Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →