ResNet的数学分析【深度学习中的数学ep8】
Transformer为什么会比CNN好
深度学习优化基础:从泰勒展开到梯度下降法和牛顿法【深度学习中的数学ep4】
为什么Transformer会好于ResNet,从Lipschitz常量讲起【深度学习中的数学ep10】
FC层和LN层该如何求导?【深度学习中的数学ep2】
self-attention完整求导公式 [Transformer中的数学part29]
张祥雨:Transformer究竟做对了什么,CNN能不能从中学习?
Transformer主要模块从数学上如何解读?【深度学习中的数学ep9】
self-attention求导 [Transformer中的数学part28]
当FFN遇上Normalization[Transformer中的数学part37]
SGD and Adam in Transformer[Transformer中的数学part36]
强化学习下的多教师知识蒸馏模型【沈向洋带你读论文】【知识蒸馏】
注意力稀疏化原理 [Transformer中的数学part34]
6分钟听懂Swin Transformer V2【CVPR2022 Oral】
理解Wq'Wk的性质 [Transformer中的数学part33]
五种不同的Normalization[Transformer中的数学part39]
【沈向洋带你读论文】张祥雨解读RepLKNet:重新审视CNN中的大卷积核问题【计算机视觉】【模型架构】
理论分析不同参数的影响[Transformer中的数学part35]
Wq Wk Wv的导数推导 [Transformer中的数学part32]
Normalization的本质 [Transformer中的数学part31]