训练你自己的大语言模型

1616
0
2025-07-22 16:58:31
60
19
169
5
本课程旨在帮助初学者学习如何从头开始训练一个语言模型。Imad 将以摩洛哥达里语为例,带领你完成整个流程。 在本课程中,你将学习: 如何加载文本数据 如何使用字节对编码(BPE)方法从零开始训练分词器 如何使用分词器编码文本数据 语言模型中 Transformer 架构的工作原理 如何进行模型预训练 如何创建监督微调数据集 如何微调模型并构建可对话的AI助手 在 GitHub 仓库获取相关幻灯片、Notebook 和脚本: https://github.com/ImadSaddik/Train_Your_Language_Model_Course 监督微调数据集下载地址: https://github.com/ImadSaddik/BoDmaghDataset https://huggingface.co/datasets/ImadSaddik/BoDmaghDataset 基于 AtlaSet 训练的分词器: https://github.com/ImadSaddik/DarijaTokenizers AtlaSet 数据集在 HuggingFace 的访问地址: https://huggingface.co/datasets/atlasia/Atlaset 如需联系 Imad Saddik,请访问他的社交账号: LinkedIn: /imadsaddik YouTube: ‪@3CodeCampers‬ Discord: imad_saddik 视频油管链接:https://www.youtube.com/watch?v=9Ge0sMm65jo,作者:Imad Saddik 我们的朋友 Scrimba 为该频道提供了支持 - Scrimba 是一个重新发明了互动学习的编码平台:https://scrimba.com/freecodecamp (中文字幕为机翻,如有错误,欢迎指出) 免费编程课程:https://www.freecodecamp.org/chinese/learn 在专栏阅读技术文章:https://www.freecodecamp.org/chinese/news 在论坛获得帮助:https://forum.freecodecamp.org/c/chinese/533
开源社区 freeCodeCamp.org 官方账号,我们的使命是帮助人们免费学习编程。
客服
顶部
赛事库 课堂 2021拜年纪