深度学习优化基础:从泰勒展开到梯度下降法和牛顿法【深度学习中的数学ep4】

1.8万
26
2023-12-07 17:00:00
521
230
1017
79
这节课相对轻松一些,一共就3个内容:泰勒展开及其向量矩阵表达、梯度下降法推导、牛顿法推导。一个相对简单的课后思考: 在讲解过程中对泰勒展开的高阶项进行了省略,那在优化算法里,为什么泰勒展开的高阶项可以省略? 二阶优化算法速度很快,但为何在深度学习实践中很少用? 提这两个小问题给刚接触深度学习的同学思考啦~
ReadPaper是沈向洋老师创办的IDEA研究院研发的论文阅读产品,欢迎登陆readpaper.com,快乐读论文。
自动连播
27.8万播放
简介
深度学习中的矩阵求导基础【深度学习中的数学ep1】
18:04
FC层和LN层该如何求导?【深度学习中的数学ep2】
17:41
如何对简单的神经网络求导?【深度学习中的数学ep3】
17:03
深度学习优化基础:从泰勒展开到梯度下降法和牛顿法【深度学习中的数学ep4】
12:28
Lipschitz连续及其常量的定义讲解【深度学习中的数学ep5】
19:53
奇异值分解和线性代数回顾【深度学习中的数学ep6】
23:15
深度学习实战-SVD、Xavier初始化、Lipschitz常量仿真【深度学习中的数学ep7】
24:59
ResNet的数学分析【深度学习中的数学ep8】
22:31
Transformer主要模块从数学上如何解读?【深度学习中的数学ep9】
15:43
为什么Transformer会好于ResNet,从Lipschitz常量讲起【深度学习中的数学ep10】
24:32
深度学习中的凸优化(上)【深度学习中的数学ep11】
20:42
深度学习中的凸优化(下)【深度学习中的数学ep12】
11:24
混合精度讲解 (上)【深度学习中的数学ep13】
15:10
混合精度讲解(下)【深度学习中的数学ep14】
19:40
从SGD到AdamW - 优化器算法讲解(上) 【深度学习中的数学ep15】
29:09
优化器特性分析 - 优化器算法讲解(中)【深度学习中的数学ep16】
18:19
从Adam到AdamW - 优化器算法讲解(下)【深度学习中的数学ep17】
10:58
Activation和Residual Shortcut的Lipschitz常量分析【深度学习中的数学ep18】
14:12
归一化层该如何选择?【深度学习中的数学ep19】
12:05
自注意力机制解析-从Lipschitz常量的角度出发【深度学习中的数学ep20】【Self-Attention】
09:18
优化器要怎么调参调结构?- 模型优化指南(上)【深度学习中的数学ep21】
26:28
宏观理解深度学习优化-模型优化指南(下)【深度学习中的数学ep22】
22:38
简单聊聊大模型 【深度学习中的数学ep23】
09:56
客服
顶部
赛事库 课堂 2021拜年纪