【2025-05】Flow-GRPO:ODE到SDE转换05【结合 GRPO —— 为什么 SDE 使 Flow Matching 可以强化学习,以及 Flow-GRPO 完整训练流程】

📅 发布时间:2026/10/9 23:22:56
【2025-05】Flow-GRPO:ODE到SDE转换05【结合 GRPO —— 为什么 SDE 使 Flow Matching 可以强化学习,以及 Flow-GRPO 完整训练流程】
第 5 部分:结合 GRPO —— 为什么 SDE 使 Flow Matching 可以强化学习,以及 Flow-GRPO 完整训练流程本部分目标:将前面推导的 Flow-GRPO 采样公式:xt+Δt=xt+[vθ(xt,t)+σt22t(xt+(1−t)vθ(xt,t))]Δt+σtΔtϵ x_{t+\Delta t}=x_t+\left[v_\theta(x_t,t)+\frac{\sigma_t^2}{2t}(x_t+(1-t)v_\theta(x_t,t))\right]\Delta t+\sigma_t\sqrt{\Delta t}\epsilonx