Transformer为什么会比CNN好
【ReadPaper保姆级教程】手把手教你搞定论文阅读神器ReadPaper | 论文如何高效读懂?论文笔记要怎么做?
张祥雨:Transformer究竟做对了什么,CNN能不能从中学习?
Transformer对时序预测真的有效吗? | AAAI'23 Oral
注意力稀疏化原理 [Transformer中的数学part34]
当FFN遇上Normalization[Transformer中的数学part37]
self-attention求导 [Transformer中的数学part28]
【沈向洋带你读论文】Transformers 在图学习表征方面真的表现不佳吗?【Transformers】【图学习】
理解Wq'Wk的性质 [Transformer中的数学part33]
SGD and Adam in Transformer[Transformer中的数学part36]
为什么Transformer会好于ResNet,从Lipschitz常量讲起【深度学习中的数学ep10】
Transformer主要模块从数学上如何解读?【深度学习中的数学ep9】
代码验证理论 (3)[Transformer中的数学part44]
五种不同的Normalization[Transformer中的数学part39]
代码验证理论 (5)[Transformer中的数学part46]
Wq Wk Wv的导数推导 [Transformer中的数学part32]
self-attention完整求导公式 [Transformer中的数学part29]
理论分析不同参数的影响[Transformer中的数学part35]
强化学习下的多教师知识蒸馏模型【沈向洋带你读论文】【知识蒸馏】
【沈向洋带你读论文】Dynamic Head——首次突破COCO单模型测试60AP大关