【吴恩达】2026手把手教《LLM微调与强化学习》教程!附代码_大模型微调_LangChain_RAG_agent_生成式AI

2.5万
43
2026-01-06 11:18:55
346
209
1565
100
deep learning.ai 1. 对齐预训练模型以应对真实任务:运用监督微调(SFT)和基于人类反馈的强化学习(RLHF)来提升模型的指令遵循、推理能力及行为安全性。 2. 以评估指导改进:构建能够揭示问题的评估体系,据此选择训练数据与奖励信号,并进行持续迭代优化。 3. 以成本意识推动模型生产就绪:规划模型的晋升策略与服务部署,建立可靠的监控体系,并充分考虑计算资源与预算成本。 (配套课件已整理,求三连! )
助力技术人的每一次成长|提供晚间免费直播课!欢迎咨询:人工智能基础课程/大模型课程/论文发表
视频选集
(1/43)
【模块1】1-对话:Sharon Zhou and AndrewNg
10:45
【模块1】2-背景
05:13
【模块1】3-后训练(微调与强化学习)在LLM训练中的位置
06:31
【模块1】4-微调与强化学习的原理与核心思想
04:50
【模块1】5-实现有效微调与强化学习的关键要素
10:33
【模块1】6-后训练范例:推理
05:20
【模块1】7-后训练范例:安全与保障(RLAIF)
05:20
【模块2】1-数据:你需要什么以及如何准备
07:13
【模块2】2-数据:模型读取or写入数据时的词元(可选说明)
10:27
【模块2】3-微调的数学原理:损失、梯度与权重更新(Part1)
06:13
【模块2】4-微调的数学原理:损失、梯度与权重更新(Part2)
05:37
【模块2】5-微调:超参数与超参数调优(Part1)
07:14
【模块2】6-微调:超参数与超参数调优(Part2)
04:15
【模块2】7-微调:参数高效微调(PEFT)
09:08
【模块2】8-强化学习中的奖励机制与偏好学习
09:46
【模块2】9-强化学习:训练目标与基于人类反馈的强化学习(RLHF)
09:45
【模块2】10-强化学习:PPO算法与GRPO
08:07
【模块3】1-为何评估是北极星
02:18
【模块3】2-后训练中的评估:测试集与评估指标
08:15
【模块3】3-强化学习的测试环境与更新监控
05:48
【模块3】4-奖励攻击
04:49
【模块3】5-误差分析:为什么重要?
02:57
【模块3】6-错误分析:错误诊断与干预措施
04:39
【模块3】7-如何建设优质的评估体系
05:59
【模块3】8-红队测试:现实世界中的失败案例
04:04
【模块4】1-后训练需要多少数据
07:38
【模块4】2-微调所需数据
06:47
【模块4】3-强化学习数据(Part 1)
07:14
【模块4】4-强化学习数据 (Part 2)
04:45
【模块4】5-综合应用
03:00
【模块4】6-合成数据流水线
07:18
【模块4】7-模板工程(通常指提示模板工程)
04:32
【模块4】8-再探宪法AI
05:57
【模块4】9-平衡数据与奖励
05:12
【模块5】1-生产环境的后训练流水线
07:38
【模块5】2-智能体
09:23
【模块5】3-强化学习模型晋升规则(通过、不通过标准)
06:56
【模块5】4-数据反馈飞轮
05:44
【模块5】5-监控与可观测性
04:29
【模块5】6-基础架构 (Part 1)
04:43
【模块5】7-基础架构(Part 2)
07:05
【模块5】8-生产就绪清单
03:12
0-大模型系统学习路线
00:29
客服
顶部
赛事库 课堂 2021拜年纪