本课程旨在帮助初学者学习如何从头开始训练一个语言模型。Imad 将以摩洛哥达里语为例,带领你完成整个流程。
在本课程中,你将学习:
如何加载文本数据
如何使用字节对编码(BPE)方法从零开始训练分词器
如何使用分词器编码文本数据
语言模型中 Transformer 架构的工作原理
如何进行模型预训练
如何创建监督微调数据集
如何微调模型并构建可对话的AI助手
在 GitHub 仓库获取相关幻灯片、Notebook 和脚本:
https://github.com/ImadSaddik/Train_Your_Language_Model_Course
监督微调数据集下载地址:
https://github.com/ImadSaddik/BoDmaghDataset
https://huggingface.co/datasets/ImadSaddik/BoDmaghDataset
基于 AtlaSet 训练的分词器:
https://github.com/ImadSaddik/DarijaTokenizers
AtlaSet 数据集在 HuggingFace 的访问地址:
https://huggingface.co/datasets/atlasia/Atlaset
如需联系 Imad Saddik,请访问他的社交账号:
LinkedIn: /imadsaddik
YouTube: @3CodeCampers
Discord: imad_saddik
视频油管链接:https://www.youtube.com/watch?v=9Ge0sMm65jo,作者:Imad Saddik
我们的朋友 Scrimba 为该频道提供了支持 - Scrimba 是一个重新发明了互动学习的编码平台:https://scrimba.com/freecodecamp
(中文字幕为机翻,如有错误,欢迎指出)
免费编程课程:https://www.freecodecamp.org/chinese/learn
在专栏阅读技术文章:https://www.freecodecamp.org/chinese/news
在论坛获得帮助:https://forum.freecodecamp.org/c/chinese/533