从PPO到GEPO:大模型强化学习中的组策略优化演进

在大语言模型的强化学习中,PPO、GRPO、DAPO、GSPO 和 GEPO 经常被画成一条不断演进的路线。这个说法大体正确,却容易掩盖一个关键事实:它们并非都在修改同一个部件。 PPO → GRPO:主要改变优势(advantage)的估计方式,以同一问题下多个回答的相对奖励取代价值模型; GRPO → DAPO:保留 token 级重要性比率,重点修正采样、裁剪、损失归一化和超长回答的奖励; GRPO → GSPO → GEPO:逐步将重要性权重的统计粒度从 token 提升到 sequence,再提升到 group,以降低长序列及异步训练中的梯度噪声。 理解这三个方向,比记住五个缩写更重要。

AI / 强化学习

Beta分布:缘由及推导

本文主要介绍了Beta分布的概念、相关性质及其推导。

AI / 强化学习

强化学习:基本概念和优化目标

强化学习是指导智能体如何根据环境反馈而选择最佳决策的学习方式,本文主要介绍强化学习的基本概念和优化目标。

AI / 强化学习

C++条件变量(Conditional Variable)

C++的条件变量提供了一种线程同步的方法,本文简要对其进行介绍。

程序设计 / 语言

并查集的C++实现

什么是并查集? 并查集是一种用于快速在元素之间建立集合关系,并且快速判断两个元素是否属于同一集合的数据结构。其基于的基本假设是传递性:如果元素xxx和yyy属于同一集合,并且yyy与zzz也属于同一集合,那么元素xxx与zzz一定属于同一集合。针对...

程序设计 / 算法

C++ 手撕线程池

用C++实现一个线程池

程序设计 / 算法

AC自动机原理与实现

模式匹配算法:AC自动机

程序设计 / 算法

【leetcode题解】30.串联所有单词的子串

leetcode30.串联所有单词的子串 题解

程序设计 / 算法
重走西游路
【游戏简评】:《黑神话:悟空》

【整活向】一觉起来,Python的class关键字不见了???

“欸?为什么我的编辑器给我的class标红了啊???” “你不知道吗?Python的新版本移除了class关键字啊?” “啊???”

程序设计 / 语言
123
- - - - - -