【王树森】深度强化学习(DRL)

52.8万
3927
2021-02-10 23:49:16
8802
4370
2.8万
4848
https://youtu.be/vmkRMvhCW5c 课程主讲:王树森(史蒂文斯理工学院计算机科学系的终身制助理教授) 课程内容:基本概念、价值学习、策略学习、Actor-Critic方法、AlphaGo、Monte Carlo (蒙特卡洛) 课程资料:https://github.com/wangshusen/DRL 下载链接:https://pan.baidu.com/s/1XpTgny_Vr0LobBsuYF4KkA 密码:x0wb
懒惰必遭报应
视频选集
(1/23)
深度强化学习(1_5):基本概念 Deep Reinforcement Learning (1_5)
40:01
深度强化学习(2_5):价值学习 Value-Based Reinforcement Learning
28:12
深度强化学习(3_5):策略学习 Policy-Based Reinforcement Learning
22:53
深度强化学习(4_5):Actor-Critic Methods
23:41
深度强化学习(5_5):AlphaGo
53:43
蒙特卡洛 Monte Carlo
25:24
SnapSave.io-随机排列与Fisher-Yates算法
21:37
Sarsa算法 (TD Learning 1_3)
10:56
Q-Learning算法 (TD Learning 2_3)
08:33
Multi-Step TD Target (TD Learning 3_3)
06:36
经验回放 Experience Replay (价值学习高级技巧 1_3)
14:19
高估问题、Target Network、Double DQN (价值学习高级技巧 2_3)
19:37
Dueling Network (价值学习高级技巧 3_3)
15:11
策略梯度中的Baseline (1_4)
09:48
REINFORCE with Baseline (策略梯度中的Baseline 2_4)
11:26
A2C 方法 (策略梯度中的Baseline 3_4)
18:46
REINFORCE与A2C的异同 (策略梯度中的Baseline 4_4)
07:44
离散控制与连续控制 (连续控制 1_3)
04:22
确定策略梯度 Deterministic Policy Gradient, DPG (连续控制 2_3)
15:50
随机策略做连续控制 (连续控制 3_3)
20:33
SnapSave.io-TRPO 置信域策略优化 (Trust Region Policy Optimization)
29:27
多智能体强化学习(1_2):基本概念 Multi-Agent Reinforcement Learning
18:37
多智能体强化学习(2_2):三种架构 Multi-Agent Reinforcement Learning
18:37
客服
顶部
赛事库 课堂 2021拜年纪