news 2026/9/28 21:19:42

RL-算法01-SAC03:Maximum Entropy RL → Soft Bellman Equation → SAC Critic Loss完整推导

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RL-算法01-SAC03:Maximum Entropy RL → Soft Bellman Equation → SAC Critic Loss完整推导

第3部分:Maximum Entropy RL → Soft Bellman Equation → SAC Critic Loss完整推导

前两部分已经介绍了:

  • SAC在强化学习体系中的位置;
  • SAC网络结构;
  • Actor、Twin Q、Target Network、Replay Buffer。

本部分进入 SAC 最核心的数学部分:

为什么 SAC 不再最大化单纯奖励,而是最大化“奖励 + 熵”?

为什么 Critic Target 中会出现:

Q(st+1,at+1)−αlog⁡π(at+1∣st+1)Q(s_{t+1},a_{t+1})-\alpha\log\pi(a_{t+1}|s_{t+1})Q(st+1​,at+1​)−αlogπ(at+1​∣st+1​)


30. 从传统强化学习目标开始

传统强化学习目标:

J(π)=Eτ∼π[∑t=0∞γtrt]J(\pi)=E_{\tau\sim\pi}[\sum_{t=0}^{\infty}\gamma^tr_t]J(π)=Eτ∼π​[t=0∑∞​γtrt​]

其中:

  • τ\tauτ表示轨迹;
  • rtr_trt​表示奖励;
  • γ\gammaγ表示折扣因子。

优化目标:

π∗=arg⁡max⁡πJ(π)\pi^*=\arg\max_\pi J(\pi)π∗=argπmax​J(π)

即:

找到累计奖励最大的策略。


31. 传统RL的问题:探索不足

假设一个状态:

sss

有两个动作:

动作奖励
a1a_1a1​10
a2a_2a2​9

普通强化学习:

倾向:

a1a_1a1​

最终:

π(a1∣s)→1\pi(a_1|s)\rightarrow1π(a1​∣s)→1

策略变成:

π(a∣s)=[1,0]\pi(a|s)=[1,0]π(a∣s)=[1,0]

此时:

策略熵:

H(π)=0H(\pi)=0H(π)=0

表示:

策略完全确定。


问题:

如果:

a2a_2a2​

虽然当前奖励低:

但是未来收益更高。

由于策略已经不探索:

可能永远发现不了。


32. Maximum Entropy Reinforcement Learning

SAC提出:

不要只最大化奖励。

而优化:

J(π)=E[∑tγt(rt+αH(π(⋅∣st)))]J(\pi)=E[\sum_t\gamma^t(r_t+\alpha H(\pi(\cdot|s_t)))]J(π)=E[t∑​γt(rt​+αH(π(⋅∣st​)))]

其中:

H(π(⋅∣st))H(\pi(\cdot|s_t))H(π(⋅∣st​))

表示策略熵。


32.1 策略熵定义

离散动作:

H(π(⋅∣s))=−∑aπ(a∣s)log⁡π(a∣s)H(\pi(\cdot|s))=-\sum_a\pi(a|s)\log\pi(a|s)H(π(⋅∣s))=−a∑​π(a∣s)logπ(a∣s)

连续动作:

H(π(⋅∣s))=−Ea∼π[log⁡π(a∣s)]H(\pi(\cdot|s))=-E_{a\sim\pi}[\log\pi(a|s)]H(π(⋅∣s))=−Ea∼π​[logπ(a∣s)]


因此:

最大熵目标:

J(π)=E[∑tγt(rt−αlog⁡π(at∣st))]J(\pi)=E[\sum_t\gamma^t(r_t-\alpha\log\pi(a_t|s_t))]J(π)=E[t∑​γt(rt​−αlogπ(at​∣st​))]


33. Maximum Entropy的直观意义

SAC优化:

rt−αlog⁡π(at∣st)r_t-\alpha\log\pi(a_t|s_t)rt​−αlogπ(at​∣st​)

包含两部分:


33.1 奖励项

rtr_trt​

作用:

提高任务收益。


33.2 熵项

−αlog⁡π(at∣st)-\alpha\log\pi(a_t|s_t)−α

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/28 21:19:22

AgentKit银弹落地:解决AI Agent生产落地的所有痛点

文章目录前言1. 先说个事儿1.1 AgentKit是啥2. 为什么Agent落地这么难2.1 卡点一:身份权限乱2.2 卡点二:工具数据散2.3 卡点三:运行环境裸奔2.4 卡点四:出事了查不了3. AgentKit的三层能力3.1 构建与资产层:把Agent当公…

作者头像 李华
网站建设 2026/9/28 21:18:44

基于深度学习的抖音用户购物行为预测系统的设计与实现

摘 要 抖音作为全域兴趣电商头部平台,用户购物呈现“刷到即买”的即兴化特征,流量红利消退后行业获客成本攀升,同质化竞争加剧。传统运营模式难精准捕捉用户碎片化需求,而大数据与AI技术的成熟,为整合用户行为、交易等…

作者头像 李华
网站建设 2026/9/28 21:18:17

MikroORM JSON 属性完全指南:定义、查询、$elemMatch 与索引

后端 【免费下载链接】mikro-orm TypeScript ORM for Node.js based on Data Mapper, Unit of Work and Identity Map patterns. Supports MongoDB, MySQL, MariaDB, MS SQL Server, PostgreSQL and SQLite/libSQL databases. 项目地址: https://gitcode.com/gh_mir…

作者头像 李华
网站建设 2026/9/28 21:17:57

YashanDB 一把定位引起SWAP空间异常的会话和SQL语句

我们的文章会在微信公众号IT民工的龙马人生和博客网站 ( www.htz.pw )同步更新 ,欢迎关注收藏,也欢迎大家转载,但是请在文章开始地方标注文章出处,谢谢! 由于博客中有大量代码,通过页面浏览效果更佳。 Yash…

作者头像 李华