Transformer为什么会比CNN好
Transformer对时序预测真的有效吗? | AAAI'23 Oral
深度学习优化基础:从泰勒展开到梯度下降法和牛顿法【深度学习中的数学ep4】
6分钟听懂Swin Transformer V2【CVPR2022 Oral】
理解Wq'Wk的性质 [Transformer中的数学part33]
代码验证理论 (5)[Transformer中的数学part46]
Transformer主要模块从数学上如何解读?【深度学习中的数学ep9】
Normalization的本质 [Transformer中的数学part31]
强化学习下的多教师知识蒸馏模型【沈向洋带你读论文】【知识蒸馏】
SGD and Adam in Transformer[Transformer中的数学part36]
代码验证理论 (6)[Transformer中的数学part47]
代码验证理论 (4)[Transformer中的数学part45]
Deeply Normalizated Transformer[Transformer中的数学part40]
【沈向洋带你读论文】张祥雨解读RepLKNet:重新审视CNN中的大卷积核问题【计算机视觉】【模型架构】
注意力稀疏化原理 [Transformer中的数学part34]
代码验证理论 (3)[Transformer中的数学part44]
【ReadPaper保姆级教程】手把手教你搞定论文阅读神器ReadPaper | 论文如何高效读懂?论文笔记要怎么做?
【沈向洋带你读论文】Dynamic Head——首次突破COCO单模型测试60AP大关
self-attention完整求导公式 [Transformer中的数学part29]
深度学习中的矩阵求导基础【深度学习中的数学ep1】