为什么Transformer会好于ResNet,从Lipschitz常量讲起【深度学习中的数学ep10】

4.8万
28
2023-12-12 12:00:00
1228
594
2969
366
Transformer和CNN两大架构之争在学术界仍有大量论文在讨论,并且仍在对双方进行改进。这一期我们从Lipschitz常量出发,讲讲当年的Transformer为什么效果会比ResNet更好。 本期内容: 从Lipschitz常量理解模型表达能力 ResNet的非线性如何体现 Transformer的Lipschitz常量(理论值、实际值、仿真值之间的关系) 用程序模拟ResNet和Transformer的Lipschitz常量 ps:在曾经的一期沈向洋带你读论文中,我们讨论过Transformer和CNN的话题,感兴趣也可以去看看哟:BV1L3411x7hw
ReadPaper是沈向洋老师创办的IDEA研究院研发的论文阅读产品,欢迎登陆readpaper.com,快乐读论文。
自动连播
27.8万播放
简介
深度学习中的矩阵求导基础【深度学习中的数学ep1】
18:04
FC层和LN层该如何求导?【深度学习中的数学ep2】
17:41
如何对简单的神经网络求导?【深度学习中的数学ep3】
17:03
深度学习优化基础:从泰勒展开到梯度下降法和牛顿法【深度学习中的数学ep4】
12:28
Lipschitz连续及其常量的定义讲解【深度学习中的数学ep5】
19:53
奇异值分解和线性代数回顾【深度学习中的数学ep6】
23:15
深度学习实战-SVD、Xavier初始化、Lipschitz常量仿真【深度学习中的数学ep7】
24:59
ResNet的数学分析【深度学习中的数学ep8】
22:31
Transformer主要模块从数学上如何解读?【深度学习中的数学ep9】
15:43
为什么Transformer会好于ResNet,从Lipschitz常量讲起【深度学习中的数学ep10】
24:32
深度学习中的凸优化(上)【深度学习中的数学ep11】
20:42
深度学习中的凸优化(下)【深度学习中的数学ep12】
11:24
混合精度讲解 (上)【深度学习中的数学ep13】
15:10
混合精度讲解(下)【深度学习中的数学ep14】
19:40
从SGD到AdamW - 优化器算法讲解(上) 【深度学习中的数学ep15】
29:09
优化器特性分析 - 优化器算法讲解(中)【深度学习中的数学ep16】
18:19
从Adam到AdamW - 优化器算法讲解(下)【深度学习中的数学ep17】
10:58
Activation和Residual Shortcut的Lipschitz常量分析【深度学习中的数学ep18】
14:12
归一化层该如何选择?【深度学习中的数学ep19】
12:05
自注意力机制解析-从Lipschitz常量的角度出发【深度学习中的数学ep20】【Self-Attention】
09:18
优化器要怎么调参调结构?- 模型优化指南(上)【深度学习中的数学ep21】
26:28
宏观理解深度学习优化-模型优化指南(下)【深度学习中的数学ep22】
22:38
简单聊聊大模型 【深度学习中的数学ep23】
09:56
客服
顶部
赛事库 课堂 2021拜年纪