📖标题:CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning
🌐来源:arXiv, 2609.36820v1
🛎️文章简介
🔸研究问题:在使用GRPO进行多目标强化学习时,如何防止数值范围大或波动大的奖励项主导归一化过程,从而掩盖其他重要但数值较小的奖励信号?
🔸主要贡献:提出了CorrGRPO方法,通过将归一化分母中的协方差替换为皮尔逊相关系数,消除了奖励数值量级对优势估计的影响,使模型能更公平地利用所有奖励信号的相关性。
📝重点思路
🔸分析GRPO的缺陷:传统GRPO在多奖励场景下,将总奖励的标准差作为归一化分母。由于方差等于各奖励协方差之和,而协方差受奖励自身标准差(即数值量级)影响极大,导致数值大的奖励项在归一化中占据主导地位,压制了小数值奖励的贡献。
🔸提出CorrGRPO算法:保持分子(中心化总奖励)不变,仅修改分母。将分母中的 pairwise covariances(成对协方差)替换为 Pearson correlation coefficients(皮尔逊相关系数)。
🔸消除量级依赖:通过除以各自的标准差,相关系数去除了奖励数值大小的影响,只保留奖励之间的统计依赖性。这使得不同量级的奖励在归一化过程中拥有平等的话语权。
🔸保持梯度方向:理论推导证明,CorrGRPO仅对优势值进行了正比例缩放,保留了原始梯度的方向,因此兼容现有的策略优化框架如PPO、DAPO等。
🔎分析总结
🔸代码生成任务提升:在LeetCode、HumanEval等基准测试中,CorrGRPO在0.5B到8B不同规模的模型上均优于GRPO和GDPO,显著提升了代码的正确率(Pass@1)和执行效率,拓展了正确性与效率的帕累托前沿。
🔸工具调用能力增强:在RLLA-4K和API-Bank数据集上,CorrGRPO提高了函数名、参数