1. 项目概述:RLVR技术背景与核心挑战
在强化学习领域,可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,简称RLVR)正成为大语言模型后训练的关键技术。这项技术的核心价值在于:当模型生成的每个输出都能获得明确的二元奖励信号(正确/错误)时,如何最有效地利用这些信号来优化模型策略。
传统RLVR方法(如GRPO及其变体DAPO、GSPO)存在两个致命缺陷:首先是正样本的梯度错配问题——模型对低置信度的正确token(即那些需要重点学习的"困难样本")反而分配了较小的梯度权重;其次是负样本的梯度主导问题——高置信度的错误token会产生指数级增长的梯度,压制其他样本的学习信号。这两个问题导致策略优化效率低下,在1.5B和7B参数规模的模型上表现尤为明显。
2. REAL框架设计原理
2.1 核心范式转换:从优势估计到分类标签
REAL框架的革命性在于跳出了传统RLVR的思维定式。它不再将奖励信号用于计算优势函数(Advantage),而是直接将其作为分类标签。这种转换带来了三个关键优势:
- 梯度权重分配更合理:对正样本,模型越不自信的token获得越强的梯度信号
- 梯度上界自然约束:通过Softmax的饱和特性,避免负样本梯度爆炸
- 训练稳定性提升:消除了优势估计带来的方差,降低策略更新的波动
2.2 关键技术实现细节
2.2.1 长度归一化相对对数概率
REAL使用以下公式计算每个样本的logits分值:
s_k = (1/|y_k|) * [log(π_θ(y_k|x)) - log(π_ref(y_k|x))]其中|y_k|是生成序列长度,这种设计:
- 消除了不同长度样本的比较偏差
- 以0作为天然的正负样本分界线
- 保留了策略梯度的相对变化信息
2.2.2 Unified Softmax Loss设计
创新性地引入锚点logits(s^+ = τ, s^- = -τ)的损失函数:
L = -log(exp(s_k^+)/Z) - log(exp(-s_k^-)/Z) Z = exp(s_k^+) + exp(s_k^-) + exp(τ) + exp(-τ)这个设计实现了:
- 强制拉开正负样本的得分差距
- 通过温度系数τ控制梯度上界
- 维持组内样本的竞争机制
3. 实验验证与性能分析
3.1 基准测试结果对比
在1.5B和7B模型上的六大数学推理基准测试显示:
| 模型规模 | 方法 | AIME2024 | AIME2025 | MATH500 | 平均 |
|---|---|---|---|---|---|
| 1.5B | GRPO | 32.1% | 25.6% | 45.2% | 43.1% |
| 1.5B | DAPO | 36.8% | 28.3% | 48.7% | 45.9% |
| 1.5B | REAL | 40.6% | 32.1% | 52.9% | 52.6% |
| 7B | GSPO | 48.2% | 39.7% | 61.3% | 61.5% |
| 7B | REAL | 53.1% | 45.2% | 67.8% | 63.2% |
3.2 训练动态分析
与传统方法相比,REAL展现出:
- 更平滑的熵变化曲线(无熵坍塌或爆炸)
- 验证集准确率稳定上升(无性能停滞)
- 完全正确样本比例持续增长
4. 工程实践要点
4.1 超参数设置建议
- 温度系数τ:推荐0.3-0.5范围
- 批次大小:至少16个候选样本/指令
- 学习率:比常规RL训练低1-2个数量级
- KL散度:可不使用或设置极小权重(β<0.01)
4.2 常见问题排查
性能波动大:
- 检查候选样本多样性(建议每个指令生成16-32个响应)
- 调整温度系数τ控制梯度幅度
收敛速度慢:
- 验证长度归一化实现是否正确
- 检查参考模型π_ref是否固定
过拟合迹象:
- 增加正负样本比例平衡(建议1:2到1:3)
- 添加极小权重KL惩罚(β=0.001)
5. 扩展应用方向
REAL框架的潜力不仅限于数学推理任务,在以下场景同样适用:
- 代码生成:利用单元测试结果作为奖励信号
- 对话系统:使用人工标注的偏好数据
- 文本摘要:基于ROUGE等自动评估指标
- 机器翻译:利用双语评估替代传统BLEU
实际部署中发现,对于连续奖励场景(如评分1-5星),将奖励分桶离散化后REAL仍能保持90%以上的性能优势。这为扩展应用提供了重要启示:任何可量化的评估指标,只要能够明确区分"好"与"坏"的界限,都可以转化为REAL的有效训练信号。