deepseek背后的核心利器+极速入门从零搭建基于 veRL 的企业级强化学习中台,vLLM推理加速+显存优化+GSM8K 80%准确率+全流程代码开源!

4571
5
2025-12-01 20:54:49
49
46
189
18
本期课程,我们将实战 DeepSeek背后的核心利器——GRPO(群体相对策略优化)。 相比于复杂的 PPO,GRPO 做了一个极其大胆的决定:直接扔掉 Critic 模型! 我们不需要训练一个额外的模型来打分,而是让模型像参加“选秀比赛”一样,自己生成一组回答,通过群体内部的优胜劣汰来进化。 少训练一个模型,显存直接省一半,效果却不降反升! 实测下来,Qwen2.5-Math 模型在 GSM8K 任务上,通过这套流程,真真切切地学会了“Let's think step by step”,学会了自我纠错。✅置顶评论扫码加入【赋范大模型技术社区】,领【本课程完整课件】+【更多Dify工作流成品】,以及更多【大模型Agent智能体开发硬核技术干货】内容+无门槛技术交流,期待你的加入!
‼️高质量传播大模型技术价值,认知大模型、用好大模型、与大模型共存、做新技术的主人 ,我是木研,关注我,带你掌握前沿技术
视频选集
(1/10)
自动连播
deepseek背后的核心利器+极速入门从零搭建基于 veRL 的企业级强化学习中台,vLLM推理加速+显存优化+GSM8K 80%准确率+全流程代码开源!
03:45
1.大模型微调基础
12:46
2.什么是强化学习?
16:46
3.大模型强化学习的特殊挑战
11:45
4.verl框架是什么?
11:23
5.GRPO算法
11:03
6.数学推理任务与GSM8K数据集
14:39
7.verl的三模型架构
06:46
9.verl的安装与GRPO训练讲解
18:51
10.模型强化学习效果验证
11:06
客服
顶部
赛事库 课堂 2021拜年纪