【字节大神版】2023精选深度强化学习PPO算法/DQN算法/A3C算法原理及实战系统教程,整200集干货,高能项目实战,学会即可快速上岗!

1万
37
2023-11-14 10:36:40
125
103
548
84
下方资料包关注威x公众号【AI技术星球 回复暗号321】领学习资料! 2023B站保姆级资料包,并提供一站式论文指导,顶会发刊辅导(毕业论文,EI期刊,SCI)让你三个月从零入门深度学习!内含: 【1.超详细的人工智能学习大纲】:唐宇迪博士精心整理,快速理清学习思路! 【2.基础知识】:Python基础+高数基础 【3.机器学习入门】:机器学习经典算法详解 【4.深度学习入门】:神经网络基础(CNN+RNN+GAN) 【5.计算机视觉实战项目】:OpenCV图像处理+YOL
计算机博士,专注于机器学习与计算机视觉领域。
视频选集
(1/99)
1-强化学习通过智能体与环境交互进行学习
13:35
2-引入马尔科夫链和价值评估的Q值与V值
10:13
3-详解Q值和V值以及它们之间关系
15:07
4-蒙特卡洛采样回溯计算V值
12:26
5-蒙特卡洛和时序差分估算状态V值
16:30
6-SARSA算法和Q-learning算法
13:56
7-理解Q-table_创建maze交互环境
15:02
8-代码实战Q-Learning_Agent和Env整体交互
12:24
9-代码实战Q-Learning智能体选择行为
12:47
10-代码实战Q-Learning智能体训练模型
13:17
11-代码实战Sarsa_Agent和Env整体交互
10:28
12-代码实战Sarsa_Agent选择行为和训练模型
12:22
13-代码实战SarsaLambda_训练模型
13:31
1-DQN算法思想
10:55
2-DQN算法具体流程
10:38
3-ε-greedy_ReplayBuffer_FixedQ-targets
17:31
4-代码实战DQN_Agent和Env整体交互
14:09
5-代码实战DQN_构建Q网络
11:39
6-代码实战DQN_定义损失函数_构建Target网络更新逻辑
14:18
7-代码实战DQN_训练阶段得到Q网络的预测值和真实值
12:44
8-代码实战DQN_训练阶段最小化损失_记录loss方便展示_随着learn的越多选择action随机性减小
11:14
9-DQN会over-estimate的本质原因
12:59
10-DoubleDQN缓解over-estimate
10:21
11-DoubleDQN代码实战
10:34
12-DuelingDQN
16:05
13-困难样本挖掘_Multi-step_NoiseyNet系统的探索
17:06
14-计算Action的方差避免风险
10:32
15-Rainbow_DQN如何计算连续型的Actions
14:09
1-策略梯度PG_对比基于值和基于策略网络的区别
11:55
2-策略梯度PG_明确目标函数和导函数
11:49
3-策略梯度PG_简化导函数的公式推导
10:13
4-策略梯度PG_总结整体流程_对比交叉熵损失函数求导
09:53
5-策略梯度PG_讲解CartPole环境
10:21
6-代码实战_策略梯度PG和CartPole交互
15:21
7-代码实战_策略梯度PG网络构建
10:44
8-代码实战_策略梯度PG选择行为和参数训练
12:26
9-策略梯度PG_对TotalReward进行均值归一化
10:56
10-策略梯度PG_同一个回合中不同的action回溯不同的TotalReward_代码实战
11:40
1-ActorCritic原理_把PG和QLearning结合起来
15:49
2-AdvantageActorCritic_共享参数和修改reward技巧
15:35
3-代码实战_ActorCritic与环境交互
15:06
4-代码实战_Actor网络构建及训练
11:37
5-代码实战_详解Critic网络构建及训练
16:14
6-A3C架构和训练流程
12:09
7-Pendulum环境_根据网络预测的μ和σ得到连续型的action值
12:33
8-代码实战_A3C_讲解Coordinator调度多线程运算
10:28
9-代码实战_A3C_定义Worker计算loss的逻辑_针对连续型的action提高actor探索性
11:07
10-代码实战_A3C_增加actor探索性用到熵_定义worker正太分布抽样和求梯度的逻辑
10:27
11-代码实战_A3C_定义AC网络结构_定义worker拉取参数和更新全局网络参数的逻辑
10:11
12-代码实战_A3C_结合流程图分三点总结前面讲的代码
10:07
13-代码实战_A3C_讲解线程中worker和环境交互
13:47
14-代码实战_A3C_讲解线程中worker和GlobalNet交互_代码运行效果展示
10:07
1-DDPG解决DQN不能输出连续型动作的问题_DDPG如何训练Actor和Critic
14:32
2-代码实战_DDPG_构建Actor和Critic四个网络_定义Critic求loss和求梯度的逻辑
12:57
3-代码实战_DDPG_Critic网络构建_Actor网络链式求导
13:33
4-代码实战_DDPG_与环境之间的互动_AC训练调整参数_效果展示
12:47
5-TD3_使用DoubleNetwork优化DDPG
16:05
6-PPO_强调AC如何输出连续型动作_区分On-Policy与Off-Policy
10:25
7-PPO_通过重要性采样使得PPO可以做Off-Policy学习
10:12
8-PPO_重要性采样的问题_期望矫正但是方差还是不同带来的问题
11:28
9-PPO_PPO1、TRPO、PPO2三种不同的方式解决两个分布不同的问题
10:55
10-代码实战_PPO与环境整体交互_Actor与Critic网络构建
10:02
11-代码实战_定义PPO1和PPO2不同版本Actor的Loss计算逻辑
10:18
12-代码实战_剖析PPO代码中如何体现Off-Policy的学习方式_效果展示
11:51
13-DPPO分布式PPO
10:23
14-代码实战_DPPO_创建一个PPO和多个Worker_创建多线程
10:07
15-代码实战_DPPO_GlobalPPO和Workers交替执行
11:39
1-一张图通俗解释强化学习.mp4
04:48
2-强化学习的指导依据.mp4
07:08
3-强化学习AI游戏DEMO.mp4
04:49
4-应用领域简介.mp4
06:29
5-强化学习工作流程.mp4
05:49
6-计算机眼中的状态与行为.mp4
07:26
1-基本情况介绍.mp4
11:18
2-与环境交互得到所需数据.mp4
08:31
3-要完成的目标分析.mp4
10:41
4-策略梯度推导.mp4
09:02
5-baseline方法.mp4
06:12
6-OnPolicy与OffPolicy策略.mp4
07:45
7-importance sampling的作用.mp4
08:32
8-PPO算法整体思路解析.mp4
09:21
1-Critic的作用与效果.mp4
10:40
2-PPO2版本公式解读.mp4
11:47
3-参数与网络结构定义.mp4
08:05
4-得到动作结果.mp4
07:18
5-奖励获得与计算.mp4
08:09
6-参数迭代与更新.mp4
11:04
1-算法原理通俗解读.mp4
07:13
2-目标函数与公式解析.mp4
10:08
3-Qlearning算法实例解读.mp4
07:46
4-Q值迭代求解.mp4
09:00
5-DQN简介.mp4
05:08
1-整体任务流程演示.mp4
05:22
2-探索与action获取.mp4
07:00
3-计算target值.mp4
05:18
4-训练与更新.mp4
08:13
1-DoubleDqn要解决的问题.mp4
06:48
2-DuelingDqn改进方法.mp4
06:27
3-Dueling整体网络架构分析.mp4
08:28
客服
顶部
赛事库 课堂 2021拜年纪