有难度但必读的一篇论文《DeepSeekMath》

21.3万
104
2025-01-30 01:56:55
6513
2319
1.7万
1541
https://arxiv.org/pdf/2402.03300
https://www.waylandz.com 多伦多大学 07 计算机科学
28.6万播放
简介
《Reinforcement Learning》介绍
09:46
《强化学习》1.1章-背景介绍(闲侃较多)
31:59
《强化学习》1.2~1.7章-TicTacToe经典问题
33:46
《强化学习》2.1~2.10章-节多臂老虎机问题
26:09
《强化学习》第3.1-3.5章
50:26
《强化学习》第3.6-3.8章 MDP 马尔可夫决策过程
18:11
《强化学习》第4.1-4.3章 策略更新规则(上)
23:30
《强化学习》第5章 蒙特卡洛MC方法
39:18
《强化学习》第6章 TD时序差分算法
31:20
手撕 AlphaGo Zero
28:19
有难度但必读的《DeepSeekMath》论文导读
31:50
《Kimi K1.5 思维链RL模型》论文导读
43:05
《强化学习》第7章 n 步自举法 (TD)
25:10
《强化学习》第8章 Tabular Methods 表格法
12:29
《强化学习》第9章 On-policy Prediction with Approximation 函数逼近的同轨策略
16:12
《强化学习》第10章 Policy Gradient Methods(策略梯度方法)
13:25
Karpathy的《Deep Reinforcement Learning》2016经典博客
37:49
客服
顶部
赛事库 课堂 2021拜年纪