资讯详情

资讯详情

量化到底怎么省显存?PTQ/QAT/GPTQ/AWQ全解析,Maths, CS AI Compendium推理篇

量化到底怎么省显存PTQ/QAT/GPTQ/AWQ全解析Maths, CS AI Compendium推理篇【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium如果你曾在单卡上加载大语言模型被显存不够劝退那一定听说过量化Quantisation。这篇文章基于开源教材Maths, CS AI Compendium的 AI 推理章节用最少公式讲透 LLM 量化省显存的核心方法PTQ、QAT、GPTQ、AWQ 各自怎么做、代价是什么、以及不同部署场景下如何选型。 一、量化为什么能省显存一笔简单的账一个 70B 参数模型用 FP16 存储需要140 GB 显存——超过任何单张 GPU。把权重压到 INT4 后只剩35 GB单卡 A100 可跑配合权重卸载甚至能塞进 20 GB 的消费级 RTX 4090。量化省显存的原理很简单LLM 推理是典型的访存带宽瓶颈——生成每个 token 都要把全部权重从显存搬进计算单元瓶颈在搬而不是算。权重每小 4 倍搬运的数据就少 4 倍吞吐几乎线性提升。所以量化不只是省内存而是又大又快的压缩。格式每参数字节70B 模型权重占用典型用途FP324 B280 GB训练金标准FP16 / BF162 B140 GB混合精度训练、标准推理INT81 B70 GBPTQ 推理INT40.5 B35 GB权重量化GPTQ / AWQ三值 {-1,0,1}~0.2 B~15 GB极限压缩BitNet核心权衡只有一个精度换显存。量化误差会损失模型质量所有方法的差异本质上是用多小的代价把损失压到最低。 本节内容来自教材第 17 章01. quantisation.md 二、PTQ训练后量化零成本上手量化PTQPost-Training Quantisation是成本最低的路线不重新训练只拿一个很小的校准集通常 128–512 条样本跑一遍模型统计激活值的分布再算出最优的缩放因子scale。校准方法有四档精度依次提升校准方法思路特点Min-max用最小/最大值定 scale简单但被离群值绑架Percentile用 99.99 分位数代替绝对最大值剪掉极端值主流选择MSE 最优搜索使重构误差最小的 clip 值PTQ 精度通常最好KL 散度最小化量化前后分布差异TensorRT INT8 的默认方案经验法则INT8 的 PTQ 对大多数模型精度损失 1%是性价比之王但压到 INT4 时朴素的 PTQ 质量明显下滑——这时就该请出 GPTQ 和 AWQ 了。 三、QAT量化感知训练让模型自己适应低精度当 PTQ 的质量不可接受INT4 及以下或者模型会被部署无数次一次成本可以摊薄时就轮到QATQuantisation-Aware Training。QAT 的机制是在训练图里插入假量化节点——前向传播时权重/激活真的被量化再反量化反向传播时梯度假装没有发生量化直接穿过直通估计器STE。这样模型在训练过程中就学会了对量化噪声免疫。对比项PTQQAT是否需要重训❌ 只需校准✅ 微调或重训成本几乎为零70B 模型约 $10k–$100k 算力低位宽INT4/INT2表现明显掉点通常能找回几乎全部精度适用场景快速部署、INT8边缘设备、严格时延预算、大规模复用一句话PTQ 是先住进来再装修QAT 是装修时就按低精度设计图纸。 四、GPTQ逐列量化误差当场补偿GPTQFrantar et al., 2022回答了一个关键问题压到 INT4 时怎么让整层输出几乎不变而不仅仅是权重本身变准思路是最优大脑量化OBQ的 Transformer 版本用校准集算出该层的Hessian 矩阵二阶信息告诉它哪些权重对输出影响大一列一列地量化权重每量化完一列产生的误差立刻按 Hessian 权重分摊补偿给后面的列使整个 $XW$ 乘积的输出变化最小。效果4-bit 分组量化group size 128在多数 LLM 上困惑度损失 1%单个 70B 模型量化约 1 小时单 GPU。代价是需要 Hessian流程偏重。️ 五、AWQ保护那 1–3% 的关键通道AWQActivation-Aware Weight QuantisationLin et al., 2023的发现更直观权重里有1–3% 的通道对应的激活值幅值特别大它们对输出质量贡献远超其余部分。量化时一视同仁就会在这些关键通道上损失最狠。AWQ 的对策量化前把关键通道乘以一个放大系数 $s$值变大了舍入误差的相对影响就小了对应激活除以 $1/s$保证输出完全不变$s$ 按组优化使总量化误差最小。AWQ不需要 Hessian、量化更快质量与 GPTQ 相当因此成了很多开源 LLM 量化流水线的默认选择。对比GPTQAWQ核心机制逐列误差补偿Hessian 引导通道缩放保护重要权重是否需要二阶信息✅❌量化速度较慢更快4-bit 质量1% 困惑度损失相当额外开销无需推理期特殊处理推理期需在线反量化 六、从 INT4 到 1-bit进阶量化方法一览教材里还梳理了一条极限压缩技术路线按需了解即可GGUF / llama.cppCPU 推理事实标准Q4_K_M 等 k-quants 格式给重要权重块分配更多比特4-bit 平均精度下质量损失极小消费级硬件首选。QuIP / QuIP#量化前先用随机正交矩阵旋转权重把离群值摊平再用 E8 晶格码本做到2-bit 可用。SpQR找出 0.1–1% 的离群权重保留 FP16 全精度其余压到 INT3/INT4。HQQ零校准数据直接优化出量化权重适合拿不到代表性数据、或数据敏感的场景。AQLM用多码本向量量化2-bit 下质量超越 GPTQ/AWQ。BitNet b1.58权重全部变成 {-1, 0, 1}矩阵乘法退化为纯加减法70B 模型约 15 GB 即可运行无需浮点乘法器。️ 七、别忽略 KV-Cache另一半显存巨兽权重压完长上下文场景下显存大头其实是KV-Cache注意力缓存。它的体积随序列长度线性增长KV-Cache 2 × 层数 × 头数 × 头维度 × 序列长度 × 每元素字节数一个 70B 模型跑 128K 上下文FP16 的 KV-Cache 高达330 GB远超显存。解法是把缓存的 K/V 压到 INT8/INT4按通道/按头量化配合 PagedAttention 和 GQA/MLA 这类架构级优化能同时换来更长上下文 更大 batch 更快推理——对 LLM 服务来说这是杠杆最高的优化之一。 延伸阅读02. efficient architectures.mdGQA、稀疏注意力、蒸馏与剪枝✅ 八、量化选型速查表你的场景推荐方案想快速验证、部署 INT8PTQ Percentile/MSE 校准单卡 GPU 跑 7B–70B 模型GPTQ 或 AWQ 的 4-bit 权重量化消费级硬件 / CPU 推理llama.cpp GGUF Q4_K_MPTQ 掉点明显、可接受微调成本QAT极致压缩2-bit 及以下QuIP#、AQLM、BitNet长上下文服务权重 INT4 KV-Cache INT8/INT4拿不到校准数据HQQ零样本 九、深入学习的资料入口量化完整章节含 FP8 训练、混合精度、SmoothQuant 激活量化01. quantisation.md推理服务与批处理PagedAttention、连续批处理03. serving and batching.md推理部署与成本优化投机解码、前缀缓存、成本基准05. scaling and deployment.md为什么低精度能提速硬件与 Roofline 模型背景见 04. GPU architecture and CUDA.md全书章节总览与导读README.md、llms.txt最后一句话总结量化 用缩放因子 低位整数表示权重把显存和带宽需求压到 1/2–1/16PTQ 免费但上限低GPTQ/AWQ 是 4-bit 推理的两大主力QAT 花训练成本换极限精度KV-Cache 量化则是长上下文的最后一块拼图。【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →