资讯详情

资讯详情

初识RedKnot:一文完整看懂基于Head感知KV复用的长上下文LLM推理加速框架

初识RedKnot一文完整看懂基于Head感知KV复用的长上下文LLM推理加速框架【免费下载链接】RedKnotEfficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention项目地址: https://gitcode.com/gh_mirrors/re/RedKnotRedKnot 是一个构建在 SGLang 之上的模型感知长上下文 LLM 推理加速框架核心是 Head 感知 KV 复用Head-Aware KV Reuse与 SegPagedAttention 两大技术在长文本 RAG 场景可实现2–5× 首 token 延迟TTFT加速、70%–90% 计算量节省同时把质量回退换算控制在 1 个百分点以内。为什么长上下文推理需要专门加速随着 RAG检索增强生成、长文档问答等场景普及LLM 的输入动辄几十 K 到几百 K token传统推理路径面临三重压力KV Cache 内存暴涨KV 缓存随上下文长度线性膨胀显存成为并发上限Prefill 计算爆炸注意力计算随序列近似二次增长首 token 延迟TTFT被大幅拉长重复劳动多RAG 中大量文档段落跨请求重复出现但只有完全相同前缀才能被传统前缀缓存命中可复用但不同的内容只能反复重算。RedKnot 的思路不是简单换缓存策略而是在Head注意力头、Token令牌、Expert专家三个层级消除冗余计算并保持一条完整的在线 Recomputed 参考路径作为精度基准。RedKnot 三大核心机制Head、Token、Expert 三层优化机制一Head 感知 KV 复用只让重要头在线计算研究表明不同注意力头对长程上下文的依赖差异巨大。RedKnot 离线为每个(layer, head)打标签Head 类型行为处理方式Global全局头对远端内容敏感保留在线读取完整上下文Local局部头只需关注 sink 近期窗口离线预计算位置无关复用Retrieval检索头定位远端关键片段按需在线检索局部头的贡献离线准备好后投影合并回模型不改变模型对外接口。同一套抽象可映射到 MLA、MHA、GQA 和原生滑窗注意力。自动化的 Head 分类由 head_profiler.py 完成策略以 JSON 形式由 head_config.py 加载。机制二SegPagedAttention按头分页存储省显存又省带宽算法层面的头稀疏要变成真实收益还需要物理布局配合。SegPagedAttention 把 KV 页面与可见性组织成per-head、per-segment结构局部头物理上只存sink recent页全局头存完整页再用无 mask 的融合变长注意力内核FA-3 varlen一次性读取避免了密集存储 mask 屏蔽的隐性开销。运行时实现segpaged.py可独立作为 SGLang 注意力后端--attention-backend segpaged数值等价性测试test/srt/redknot/test_segpaged_duo_attention.py机制三Sparse FFN 与自适应专家 Top-K令牌级重要性决定 FFN 负载在 2–8K 短上下文段FFN 反而占 TTFT 的 57–62%。RedKnot 的 sparse_ffn.py 让深层网络只对重要 token执行密集 FFN其余走残差直通MoE 侧则用自适应专家 Top-K仅在路由分布需要时分配更多专家。多卡场景下专家子组与 All2All 通信结构如下图所示实测性能2–5× TTFT 加速70%–90% 计算节省主发布路径为DeepSeek-V4-Flash 8× NVIDIA H200TP8覆盖 4 个冻结的 LongBench 派生 RAG 测试套件套件目标 token 数文档几何64K65,5364 × 16,384128K131,0724 × 32,768256K262,1448 × 32,768440K450,5608 × 56,320关键结论 热态 TTFT 相比在线 Recomputed 参考路径加速 2–5× 计算账本节省70%–90%仅计算术计算不含访存与通信开销✅ 质量回退换算≤ 1 个百分点 完整复现脚本与冻结清单在 test/srt/redknot/一条命令即可重放全部四个套件。如何快速跑起 RedKnot先克隆仓库git clone https://gitcode.com/gh_mirrors/re/RedKnot然后根据你的硬件选择入口服务端启动脚本server/start_server_redknot_mla.shDeepSeek-V4-Flash redknot_mla后端、server/start_server_redknot_pro0813.shDeepSeek-V4-Pro-0813 认证路径RAG 端到端 Demoexamples/redknot/rag_redknot_demo.py 基于 HotpotQA 对比 Dense 基线与 RedKnot 的 F1/EM、TTFT 与 FLOPs 节省SegPagedAttention 微基准examples/redknot/segpaged_redknot_demo.py 隔离对比密集 KV mask 与按头分页布局的延迟与数值等价性详细参数与输出说明见 examples/redknot/README.md。SGLang 生态内也可以直接用前端语言体验多模态请求示例素材如 examples/frontend_language/quick_start/images/cat.jpeg仓库结构与生态速览路径说明python/sglang/srt/layers/attention/redknot/RedKnot 运行时核心Head 策略、SegPaged、Sparse FFN、MLA 集成test/srt/redknot/基准脚本、发布启动器、冻结数据集与结果server/DeepSeek-V4 系列服务端一键启动脚本docs/ASCEND.md华为 Ascend NPU 适配进展docs/advanced_features/推测解码、结构化输出等 SGLang 高级特性文档RedKnot 由社区共同构建合作方包括小红书、北京大学、华为、UB 量化、诠界等并已与 vLLM 核心代码完成迁移RedKnot-vLLM 分支。总结RedKnot 给出了长上下文 LLM 推理加速的一套完整答案Head 感知 KV 复用把可复用的头离线化SegPagedAttention让稀疏性落到物理存储Sparse FFN 自适应 Top-K再压缩 token 与专家级冗余。三者可组合、可插拔且有在线 Recomputed 路径兜底精度——如果你想让长文档、长上下文的 LLM 服务更快更省这个开源框架值得完整读一读。【免费下载链接】RedKnotEfficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention项目地址: https://gitcode.com/gh_mirrors/re/RedKnot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →