【2025-05】Flow-GRPO:ODE到SDE转换05【结合 GRPO —— 为什么 SDE 使 Flow Matching 可以强化学习,以及 Flow-GRPO 完整训练流程】
发布时间:2026/10/9 23:22:58 锦皓数字建站

第 5 部分:结合 GRPO —— 为什么 SDE 使 Flow Matching 可以强化学习,以及 Flow-GRPO 完整训练流程本部分目标:将前面推导的 Flow-GRPO 采样公式:xt+Δt=xt+[vθ(xt,t)+σt22t(xt+(1−t)vθ(xt,t))]Δt+σtΔtϵ x_{t+\Delta t}=x_t+\left[v_\theta(x_t,t)+\frac{\sigma_t^2}{2t}(x_t+(1-t)v_\theta(x_t,t))\right]\Delta t+\sigma_t\sqrt{\Delta t}\epsilonx
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。