这个实践课程将手把手教你用 PyTorch 实现 Vision Transformer(ViT)。从图像块嵌入到 Transformer 编码器,你将逐步解析每个核心组件。通过在 CIFAR-10 数据集上训练自定义 ViT 模型,你将获得图像分类的实战经验。这个高效的端到端教程,将带你完成从 CNNs 到 Transformer 架构的重要跨越。
代码:https://github.com/MOHAMMEDFAHD/pytorch-collections/blob/main/Building_Vision_Transformer_on_CIFAR_10_From_Scratch_Pytorch.ipynb
视频油管链接:https://www.youtube.com/watch?v=7o1jpvapaT0,作者:@programmingoceanacademy
❤️ 我们的朋友 Scrimba 为该频道提供了支持 - Scrimba 是一个重新发明了互动学习的编码平台:https://scrimba.com/freecodecamp
(中文字幕为机翻,如有错误,欢迎指出)
免费编程课程:https://www.freecodecamp.org/chinese/learn
在专栏阅读技术文章:https://www.freecodecamp.org/chinese/news
在论坛获得帮助:https://forum.freecodecamp.org/c/chinese/533