【2025-05】Flow-GRPO:ODE到SDE转换02【Score-based SDE Diffusion(基于评分函数的随机微分方程扩散模型)—为什么扩散模型天然满足GRPO的概率策略要求】

📅 发布时间:2026/10/9 23:22:56
【2025-05】Flow-GRPO:ODE到SDE转换02【Score-based SDE Diffusion(基于评分函数的随机微分方程扩散模型)—为什么扩散模型天然满足GRPO的概率策略要求】
第 2 部分:Score-based SDE Diffusion(基于评分函数的随机微分方程扩散模型)——为什么扩散模型天然满足 GRPO 的概率策略要求本部分目标第 1 部分已经证明:强化学习(Reinforcement Learning, RL)中的策略必须是一个概率分布:πθ(at∣st)\pi_\theta(a_t|s_t)π