正文:
大家好,我是一个刚开始AI开发的在校学生
从 import torch 都报错,到现在可以勉强跑通 LLaMA 微调,中间踩的坑比写的代码还多。今天分享几个新手必看的避坑点,希望能帮到和我一样刚开始学习的同学:
1. 别在环境配置上死磕(真的会劝退)
一开始非要装最新版 CUDA 12.x,结果各种报错。后来听了群友建议,换成 CUDA 11.8 + PyTorch 2.0.1,世界瞬间清净了。忠告:先看项目的 requirements.txt,别盲目追新!
2. 数据质量 > 数据数量
第一次做微调,爬了几十万条文本,训练慢到怀疑人生。后来花了一整天写脚本去重、过滤,最后只用 5000 条高质量数据,Loss 反而降得更快了。
3. 善用开源工具,别重复造轮子
一开始总觉得要手搓 Trainer 才显水平,结果连分布式都搞不定。现在学乖了,HuggingFace 的 Transformers + PEFT 真香,LoRA 微调一键启动,先跑通再魔改!
虽然目前还是个小白,但每天进步一点点。希望能借这次机会入站,和站内大佬们多交流学习!大佬们求个三连支持一下入站!🙏