news 2026/9/28 20:26:47

【AI黑话日日新】Day 045|Reward Model(奖励模型)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【AI黑话日日新】Day 045|Reward Model(奖励模型)

一句话说清:奖励模型是替人类给 AI 回答打分的中间人,决定训练里哪条回答更“好”。

1. 它到底在说什么

Reward Model 是英文“奖励模型”的直译。它的工作说白了:你给它一个提示和一条回答,它吐回一个数字,表示“一个普通人有多可能喜欢这条回答”。它存在的唯一理由,是你不可能把真人塞进一个跑几百万步的训练循环里,所以先拿人类的偏好比较数据,训出一个便宜的替代品,之后每次都用它代班打分。

用一个生活化的类比理解:像公司评优,先让若干老员工对一堆候选方案两两比较、排出高下,再从这些比较里“悟”出一把打分尺子;以后所有新方案不用再打扰老员工,直接上尺子量一下即可。尺子量得快、量得便宜,但它只是老员工偏好的近似,不是标准答案本身。

2. 为什么现在这个词很热

奖励模型一路从“幕后组件”变成“对齐工程的核心”,时间线很清楚。

  • 2017 年,Christiano 等人发表《Deep RL from Human Preferences》(arXiv:1706.03741,NeurIPS 2017),首次用成对的偏好比较训练奖励模型:机器人学会后空翻,只用了约 900 次人类比较。这奠定了“收集人类判断 → 拟合奖励模型 → 优化策略”的基本循环。
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/28 20:26:16

Java语言的特点

Java为2byte,1byte8bit,故为16bitJDK为Java开发工具包,JRE为Java运行环境,JVM为Java虚拟机,工具下有环境,环境下有虚拟机 .集成开发平台IDE.javac为编译,产生字节码byte code,运行为java.java数据类型:基本引用,基本:字节,字符,短整,整,长整,单精,双精,布尔.byte,short,int,lon…

作者头像 李华
网站建设 2026/9/28 20:25:23

写方案、做报表、重复操作、自主任务,分别该用什么 AI 工具

同事工位上开着六个AI工具的标签页,产出效率却没比只用一个工具的人高多少——工具数量从来不是效率的决定因素,选择顺序才是。市面上能用来提效的AI工具,大致可以按"能力层级"分成四层:内容生成、格式整理、流程自动化…

作者头像 李华
网站建设 2026/9/28 20:25:06

Airtest 与 Poco 手游自动化测试(上篇)

前言 准备篇我们把环境跑通了,还截了第一张屏。从这篇开始正式干活:用 Airtest 的"眼睛和手"操作 App。我们会先搞懂 Airtest 找图的原理,再逐个学会六个核心 API,最后在官方 AirtestDemo 上跑通第一个完整用例。学完这…

作者头像 李华
网站建设 2026/9/28 20:24:15

功能安全Hypervisor:域控制器混合关键性隔离架构的落地之道

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/28 20:24:11

WorkBuddy+deepseek-v4-flash+微信订阅消息构建AI日报工作流

1. 这不是“发个消息”,而是一套闭环工作流的落地实践“我给 WorkBuddy 设了个闹钟:每天上午十点半,一份 AI 日报自动送进微信”——这句话乍看像一句轻松的个人分享,但在我拆解过二十多个类似自动化需求后,它背后藏着…

作者头像 李华