news 2026/9/30 2:19:47

Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy...

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy...

Nested-ReFT论文总结与关键部分翻译

一、文章主要内容总结

本文聚焦于大语言模型(LLMs)在数学推理等复杂任务中基于强化学习的微调(ReFT)技术,针对传统ReFT计算成本高的问题,提出了名为“Nested-ReFT”的新型框架,核心内容如下:

1. 研究背景与问题

  • ReFT的优势与局限:ReFT通过行为模型生成多个思维链(CoT)完成结果,结合可验证奖励函数优化模型,在数学推理等领域提升显著,但生成多个完成结果需大量推理步骤,导致训练计算成本高昂。
  • 现有方案痛点:传统ReFT中,行为模型与目标模型架构一致(如使用前一梯度步的目标模型),生成样本的计算资源与目标模型相当,且增加CoT完成结果数量虽能降低更新偏差,却进一步加剧计算开销。

2. 核心框架:Nested-ReFT

  • 核心思路:借鉴离线强化学习(Off-Policy RL)和推测解码(Speculative Decoding),将目标模型的部分层作为行为模型,通过“动态层跳过”机制生成离线完成结果,降低推理成本。
  • 层跳过机制:
    • 定义“有效层集合”:排除模型最内层和最外层(距离边界b层内)的层,仅从中间层中随机跳过一定比例(x%)的层,确保模型生成的结构一致性(内层和外层对生成质量至关
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/30 2:17:47

局域网试题及答案:网工基础自测题库与eNSP实战验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/30 2:17:43

wiliwili 完整指南:手柄用户的多平台第三方B站客户端

wiliwili 完整指南:手柄用户的多平台第三方B站客户端 【免费下载链接】wiliwili 第三方B站客户端,目前可以运行在PC全平台、PSVita、PS4 、Xbox 和 Nintendo Switch上 项目地址: https://gitcode.com/GitHub_Trending/wi/wiliwili 打开游戏机&…

作者头像 李华