视频来源:DeepLearning.AI
翻译来源:吴恩达大模型+GPT-4o
代码+《动手学大语言模型》书籍+大模型资源:评论区自取
讲师: Jay Alammar, Maarten Grootendorst
①了解 transformer 的关键组件,包括分词化、嵌入、自我注意和 transformer 块,以建立强大的技术基础。
②了解最近对注意力机制的 transformer 改进,例如 KV 缓存、多查询注意力、分组查询注意力和稀疏注意力。
③比较现代LLMS中使用的标记化策略,并在 Hugging Face Transformers 库中探索 transformer 。