129、MLIR的Schedule(调度)与Parallelism(并行性)
发布时间:2026/9/21 0:17:48 锦皓数字建站
与Parallelism(并行性)`)
MLIR的Schedule(调度)与Parallelism(并行性)从一次GPU利用率惨案说起去年调一个AI编译器后端,跑ResNet-50推理,NVIDIA Nsight Systems一抓,GPU利用率只有23%。代码逻辑看着没问题,算子都正确lower到了LLVM GPU dialect,但就是跑不满。折腾三天,最后发现是MLIR的schedule没写好——循环分块后的并行维度没正确映射到GPU线程块,导致大量线程空转。那会儿真想抽自己,明明MLIR的parallelism机制就在那儿摆着,愣是没用好。这个教训让我意识到,MLIR的Schedule不是简单的“调度顺序”,它直接决定了并行性能否被有效提取和映射到目标硬件。今天这篇笔记,就聊聊我在这块踩过的坑和总结的经验。Schedule的本质:不是“先做A后做B”很多人把MLIR的Schedule理解成“先执行这个pass,再执行那个pass”,这是典型的误解。Schedule在MLIR里,核心是对IR中循环和计算结构的重组,目的是暴露并行机会。看一个实际例子。假设我们有这样的循环嵌套:scf.for %i = 0 to 1024 { scf.for %j = 0 to 1024 { %val = load %A[%i, %j] %res = addf %val, %cst store
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。