从PPO到GEPO:大模型强化学习中的组策略优化演进
在大语言模型的强化学习中,PPO、GRPO、DAPO、GSPO 和 GEPO 经常被画成一条不断演进的路线。这个说法大体正确,却容易掩盖一个关键事实:它们并非都在修改同一个部件。 PPO → GRPO:主要改变优势(advantage)的估计方式,以同一问题下多个回答的相对奖励取代价值模型; GRPO → DAPO:保留 token 级重要性比率,重点修正采样、裁剪、损失归一化和超长回答的奖励; GRPO → GSPO → GEPO:逐步将重要性权重的统计粒度从 token 提升到 sequence,再提升到 group,以降低长序列及异步训练中的梯度噪声。 理解这三个方向,比记住五个缩写更重要。

