文章主要内容总结
本文提出了一种名为Unified Reward & Policy Optimization(URPO,统一奖励与策略优化)的新型框架,旨在解决传统大型语言模型(LLMs)对齐流程中存在的复杂性、资源密集性和性能天花板问题。
传统的强化学习从人类反馈中学习(RLHF)流程通常将策略模型(“玩家”)与单独训练的奖励模型(“裁判”)分离,奖励模型在强化学习阶段参数固定,导致静态奖励信号限制模型性能。URPO通过以下方式突破这一局限:
- 统一模型与训练阶段:让单个模型同时承担“玩家”(指令遵循)和“裁判”(奖励建模)角色,在单一训练阶段完成优化;
- 数据格式统一:将偏好对、可验证推理(如数学、代码)和开放式指令等对齐数据重构为统一的生成格式,通过Group-Relative Policy Optimization(GRPO)循环优化;
- 协同进化机制:模型从真实偏好和可验证逻辑中学习,同时为开放式任务生成自身奖励,实现生成能力与评估能力的协同进化。
实验表明,在Qwen2.5-7B模型上,URPO显著优于使用单独生成式奖励模型的基线:AlpacaEval指令遵循分数从42.24提升至44.84,综合推理平均分从32.66提升至35.66;同时,其训练副产品(内部评估器)在RewardBench上得分为85.15,超过专用奖励模型(83.55)。
创新点
- 简化且高