【莫烦Python】强化学习 Reinforcement Learning

102.0万
5842
2017-12-03 23:53:13
1.2万
1.2万
3.3万
5014
强化学习是机器学习大家族中的一大类, 使用强化学习能够让机器学着如何在环境中拿到高分, 表现出优秀的成绩. Code: https://github.com/MorvanZhou/Reinforcement-learning-with-tensorflow 莫烦Python: https://mofanpy.com 通过 "莫烦 Python" 支持我做出更好的视频: https://mofanpy.com/support/
AI原来很简单: mofanpy.com
视频选集
(1/31)
什么是强化学习? (Reinforcement Learning)
03:17
强化学习方法汇总 (Reinforcement Learning)
05:55
1 why?
01:41
2 要求准备
05:07
什么是 Q Learning (Reinforcement Learning 强化学习)
06:10
2.1 简单例子
15:24
2.2 Q Learning 算法更新
11:11
2.3 Q Learning 思维决策
09:30
什么是 Sarsa (Reinforcement Learning 强化学习)
02:39
3.1 Sarsa 算法更新
05:27
3.2 Sarsa 思维决策
08:11
什么是 Sarsa(lambda) (Reinforcement Learning 强化学习)
03:37
3.3 Sarsa(lambda)
10:25
什么是 DQN (Reinforcement Learning 强化学习)
03:51
4.1 DQN 算法更新 using Tensorflow
07:03
4.2 DQN 神经网络 using Tensorflow
10:28
4.3 DQN 思维决策 using Tensorflow
21:32
4.4 OpenAI Gym using Tensorflow
12:19
4.5* Double DQN using Tensorflow
13:39
4.6* DQN with Prioritised Replay using Tensorflow
13:17
4.7* Dueling DQN using Tensorflow
07:21
什么是 策略梯度 Policy Gradients (Reinforcement Learning 强化学习)
02:13
5.1 Policy Gradients 算法更新
04:24
5.2 Policy Gradients 思维决策
10:54
什么是 Actor Critic (Reinforcement Learning 强化学习)
02:40
6.1 Actor Critic 演员评论家
09:47
什么是 Deep Deterministic Policy Gradient (DDPG) 强化学习
03:07
6.2 DDPG (Deep Deterministic Policy Gradient)
19:35
什么是 A3C (Asynchronous Advantage Actor.Critic) 强化学习
02:25
6.3 A3C (Asynchronous Advantage Actor Critic)
28:16
6.4 PPO/DPPO Proximal Policy Optimization
14:50
客服
顶部
赛事库 课堂 2021拜年纪