news 2026/9/16 18:48:51

【强化学习实验】- 策略梯度算法

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【强化学习实验】- 策略梯度算法

1.实验内容

策略梯度算法文章中2.2 策略梯度算法。

通俗总结

① 优胜劣汰

② 学如逆水行舟,不进则退。

2.实验目标

2.1 构建策略模型

class PolicyNet(torch.nn.Module): def __init__(self, state_dim, hidden_dim, action_dim): super(PolicyNet, self).__init__() self.fc1 = torch.nn.Linear(state_dim, hidden_dim) self.fc2 = torch.nn.Linear(hidden_dim, action_dim) # 输入就是state, 输出就是一个action分布 def forward(self, x): x = F.relu(self.fc1(x)) x = self.fc2(x) return F.softmax(x, dim=1)

2.2 目标函数 及其 loss函数

loss = -微分对象=-Q*log概率

def update(self, transition_dict): state_list = transition_dict['states'] action_list = transition_dict['actions'] reward_list = transition_dict['rewards'] # 每个episode为单位, 计算动作价值的累计收益 G = 0 # 倒放数据,计算动作的累计收益 self.optimizer.zero_grad() for i in range(len(reward_list)-1, -1, -1): state = torch.tensor([state_list[i]]).to(self.device) action = torch.tensor([action_list[i]]).view(-1, 1).to(self.device) G = reward_list[i] + self.gamma*G logP = torch.log(self.policy_net(state).gather(1, action)) loss = -G*logP loss.backward() self.optimizer.step()

2.3 思考算法的优缺点

a、仅使用sar数据,可能会限制算法的能力上线

b、无偏,但是方差比较大

3.完整代码

见附件

4.实验结果

模型训练750个epoch接近收敛,而后震荡收敛。

尝试扩大epoch,效果如下:

结论:总的来说,可以收敛,但是收敛效果并不是很好,后续和AC算法做一下对比。

有没有小伙伴知道为啥后期收敛效果不好?欢迎评论指教。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/15 19:31:47

HunyuanVideo-Foley离线版发布:支持内网部署与私有化音效生成

HunyuanVideo-Foley离线版发布:支持内网部署与私有化音效生成 在影视后期、短视频工厂乃至军事仿真系统中,一段精准的脚步声可能比画面本身更能传递紧张氛围。然而长期以来,这类细节音效的制作始终依赖人工“Foley录音”——演员在录音棚里模…

作者头像 李华
网站建设 2026/9/15 9:49:09

ComfyUI工作流整合Stable Diffusion 3.5 FP8:实现批量生成高效输出

ComfyUI工作流整合Stable Diffusion 3.5 FP8:实现批量生成高效输出 在AIGC内容生产逐渐从“创意实验”迈向“工业流水线”的今天,一个核心挑战日益凸显:如何在不牺牲图像质量的前提下,让像Stable Diffusion这样的大模型跑得更快、…

作者头像 李华
网站建设 2026/9/15 10:43:12

10、Z变换:原理、计算与应用详解

Z变换:原理、计算与应用详解 1. 引言 在信号处理应用中,拉普拉斯变换和傅里叶变换起着重要作用,它们分别定义在连续时间域和离散时间域。在实际信号处理里,我们更多使用的是傅里叶变换和拉普拉斯变换的离散版本,即离散时间傅里叶变换、离散傅里叶变换以及更为常用的Z变换…

作者头像 李华
网站建设 2026/9/16 17:18:51

17、FIR和IIR滤波器的结构与实现

FIR和IIR滤波器的结构与实现 1. FIR滤波器的快速卷积形式 FIR滤波器的快速卷积形式是一种高效的实现方法。其基本步骤如下: 1. 将输入序列分段成块。 2. 对每个块进行快速傅里叶变换(FFT)。 3. 对滤波器系数 (h(n)) 进行快速傅里叶变换。 4. 将每个块的FFT结果 (X_i(k…

作者头像 李华
网站建设 2026/9/16 13:00:49

22、IIR滤波器的逐步设计

IIR滤波器的逐步设计 1. 引言 滤波器的幅度响应是相对于频率来表示的,因此这些滤波器也被称为频率选择性滤波器。模拟滤波器的系统传递函数用 $H(s)$ 表示,其中 $s = σ + jΩ$,$Ω$ 是连续时间角频率。模拟滤波器的频率传递函数 $H(jΩ)$ 是通过在 $s$ 平面上沿频率轴计算…

作者头像 李华