【2025-05】Flow-GRPO:ODE到SDE转换01【从策略梯度到 GRPO —— Flow-GRPO 所依赖的强化学习理论基础】
第 1 部分:从策略梯度到 GRPO —— Flow-GRPO 所依赖的强化学习理论基础本部分目标Flow-GRPO(Flow Matching + Group Relative Policy Optimization)的核心思想是:将原本用于图像生成的流匹配模型(Flow Matching Model)看作一个强化学习(Reinforcement Learning, RL)中的策略(Policy),然后利用组相对策略优化(Group Relative Policy Optimization, GRPO)根据生成结果的奖励(Reward)优化模型。但是,一个图像生成模型为什么可以使用强化学习?为什么 GRPO 需要:pθ(xt−1∣xt,c)p_\theta(x_{t-1}|x_t,c)p