资讯详情

资讯详情

LLM Internals 深度解析 √dₖ 缩放因子:为什么注意力点积必须除以根号dk?

【免费下载链接】llm-internalsLearn LLM internals step by step - from tokenization to attention to inference optimization.项目地址https://gitcode.com/gh_mirrors/ll/llm-internals点击查看免费下载如果你曾盯着 Transformer 的注意力公式问点积为什么要除以 √dₖ根号 dk这篇 llm-internals 教程就是为你写的。作为一套从分词Tokenization到注意力再到推理优化的开源学习资料llm-internals用最直观的方式拆解了这个大语言模型LLM内部最容易被忽略、却最关键的一步缩放操作——√dₖ 缩放因子帮你彻底搞懂 Scaled Dot-Product Attention 的底层原理。快速回顾注意力的点积从哪里来在理解缩放之前先花 30 秒回忆一下注意力的工作流详细推导可看 README.md 中的章节索引每个词嵌入为向量后通过权重矩阵投影出Q查询、K键、V值三个向量用Q·K 点积计算相关性分数——点积越大说明两个词越相关对分数做Softmax归一化成权重再加权求和 V 得到输出一句话公式Attention(Q, K, V) softmax(QKᵀ / √dₖ) V其中dₖ是 Key 向量的维度。问题就出在那个不起眼的/ √dₖ上——不除会怎样不缩放会怎样点积会随维度失控直觉上点积只是逐位相乘再求和看起来很温和。但数学上有个关键事实当 Q 和 K 的分量近似独立、均值为 0、方差为 1 时点积 q·k 的方差恰好等于 dₖ。这意味着维度越高分数的波动幅度越大标准差为 √dₖKey 维度 dₖ点积方差分数标准差 √dₖ直观感受16164还算温顺512512≈22.6开始出现极端值4096409664分数彻底失控 ⚠️现代 LLM 的注意力维度动辄上千点积动辄是几十、上百的大数。大点积会怎样毁掉 SoftmaxSoftmax 的本质是指数化 归一化它对输入大小极其敏感当分数差值达到 10~20 以上时Softmax 输出会被赢家通吃——最大分数对应的权重趋近于1其余全部趋近于0此时注意力退化成Hard Argmax硬选择模型只能死盯一个词丧失了软加权的细腻表达更致命的是饱和区的梯度几乎为 0训练信号传不回去模型学不动梯度消失 换句话说不缩放 → 点积太大 → Softmax 饱和 → 注意力变死板 训练停滞。这不是理论推演而是真实会拖垮训练的问题。为什么偏偏是 √dₖ 这个缩放因子答案藏在上表的方差里。既然点积的方差是 dₖ那我们只要除以一个让方差重新归 1 的数就行Var(q·k / √dₖ) Var(q·k) / dₖ dₖ / dₖ 1✅除√dₖ后分数被拉回到均值 0、方差 1 的舒适区分数差值保持在个位数量级Softmax 输出平滑、有区分度落在 Softmax 的梯度活跃区训练稳定收敛且缩放与维度解耦——dₖ 变大时自动补偿公式对所有规模的模型通用为什么不是直接除以 dₖ因为那样方差会被压到 1/dₖ分数全挤在 0 附近Softmax 又变成平均主义每个权重趋近 1/n区分度同样丢失。√dₖ 恰好是不过松、不过紧的黄金分割点Scaled Dot-Product Attention 的完整流程把整条链路串起来一次注意力计算就是四步投影输入 → Q、K、V 矩阵点积QKᵀ 算出原始相关性分数缩放分数 ÷ √dₖ把方差拉回 1 ← 就是本文的主角Softmax 加权求和得到平滑的注意力权重输出 权重 × V记住这张心智地图点积负责表达相关性√dₖ 负责控制数值规模Softmax 负责把分数变成概率——三者缺一不可。想系统学习 LLM 内部原理去这里 本文对应 llm-internals 仓库中的核心章节建议结合完整学习路线一起看 项目总目录与章节索引README.md 注意力 Q/K/V 数学基础本文前置知识README.md √dₖ 缩放因子详解章节README.md 因果掩码Causal Masking下一篇README.md 开源协议Apache 2.0LICENSE掌握 √dₖ 缩放因子你就打通了理解 Transformer 注意力机制的关键一环。接下来不妨顺着 README.md 的路线继续攻克 Softmax、因果掩码、KV Cache 等主题一步步吃透 LLM 的内部世界赞分享【免费下载链接】llm-internalsLearn LLM internals step by step - from tokenization to attention to inference optimization.项目地址https://gitcode.com/gh_mirrors/ll/llm-internals点击查看免费下载相关推荐d2l 注意力评分函数深度解析从缩放点积注意力到加性注意力四框架实现指南d2l 注意力评分函数深度解析从缩放点积注意力到加性注意力四框架实现指南 注意力机制是 Transformer 架构的核心组件而决定查询query与文档教程人工智能深度学习NLP计算机视觉强化学习动手学深度学习注意力评分函数掩蔽Softmax、加性注意力与缩放点积注意力动手学深度学习注意力评分函数掩蔽Softmax、加性注意力与缩放点积注意力 导读 在《动手学深度学习》d2l zh的注意力机制章节中注意力评分函数人工智能深度学习机器学习教程PHPStan 错误标识符 impure.eval 深度解析纯函数中的 eval 调用为什么必须清除PHPStan 错误标识符 impure.eval 深度解析纯函数中的 eval 调用为什么必须清除 本篇技术指南聚焦 PHPStanPHP Static开发工具代码质量静态分析创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →