news 2026/8/27 14:29:36

每天一个大模型相关知识点系列--GRPO

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
每天一个大模型相关知识点系列--GRPO

GRPO(Group Relative Policy Optimization)是一种用于大语言模型第三阶段训练的强化学习方法,最早由 DeepSeek-Math 提出。

在 GRPO 中,模型被视为一个策略 π,直接对其输出分布进行优化。在强化学习建模中,prompt 对应状态 s,模型生成的完整响应对应动作 a,奖励函数或奖励模型给出的评分对应回报 r。

在训练过程中,对于每一个输入 prompt,模型从当前策略分布中采样多个候选响应,这些响应是同一策略下的不同行动样本。随后,reward model 对这些候选输出进行打分,并在 group 内计算相对优势(group-relative advantage),通常通过减去 group 内平均奖励作为 baseline,以降低策略梯度估计的方差。

基于该相对优势,GRPO 采用策略梯度方法对模型参数进行更新,使得获得较高相对奖励的响应在策略分布中的概率增加,而相对奖励较低的响应概率降低。与此同时,为防止策略更新过大、导致模型偏离原始分布,GRPO 通过引入相对于 reference policy 的 KL 散度正则项对策略更新进行约束,从而在探索与稳定性之间取得平衡。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/27 2:07:22

3分钟深入解析LLM注意力机制:轻松掌握核心原理!

简介 本文以通俗易懂的方式解释了大模型核心的Attention(注意力)机制。通过加权求和,模型有重点地关注关键信息而非平等处理所有内容。文章用淘宝购物类比解释了Q(查询)、K(键)、V(…

作者头像 李华
网站建设 2026/8/25 7:50:59

UnrealPakViewer终极指南:Pak文件分析与虚幻引擎资源管理完整教程

UnrealPakViewer终极指南:Pak文件分析与虚幻引擎资源管理完整教程 【免费下载链接】UnrealPakViewer 查看 UE4 Pak 文件的图形化工具,支持 UE4 pak/ucas 文件 项目地址: https://gitcode.com/gh_mirrors/un/UnrealPakViewer 你是否曾经为无法查看…

作者头像 李华
网站建设 2026/8/27 2:59:27

TradingView图表库K线生成机制深度解析与实战指南

TradingView图表库作为金融科技领域领先的可视化解决方案,其核心的数据流处理机制对于构建高性能交易系统至关重要。本文将从实际开发场景出发,深入剖析实时K线生成的核心原理,并提供可落地的技术实现方案。 【免费下载链接】charting-librar…

作者头像 李华
网站建设 2026/8/26 19:22:52

智能字体协作者:AutoCAD字体自动修复的终极解决方案

智能字体协作者:AutoCAD字体自动修复的终极解决方案 【免费下载链接】FontCenter AutoCAD自动管理字体插件 项目地址: https://gitcode.com/gh_mirrors/fo/FontCenter 在当今数字化设计时代,AutoCAD字体修复已成为提升设计效率的关键环节。您的团…

作者头像 李华
网站建设 2026/8/26 19:22:50

字符设备驱动(5)

一 、简介字符设备与杂项设备的区别: (1)杂项设备的主设备号是固定为10,学习字符类设备就需要自己或者系统来分配 (2)杂项设备可以自动生成设备节点,字符设备需要自己生成设备节点二、申请设备号…

作者头像 李华