【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【学习小记】:一个小时从强化学习0基础到理解GRPO
代码实现大模型强化学习(PPO),看这个视频就够了。
【TRPO算法】强化学习一头撞死:学过ppo,grpo,dpo,dapo,没听过这是啥?
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
World Model 专题|青稞AMA第2期
【1080P】安德烈·卡帕西:深入探索像ChatGPT这样的大语言模型|Andrej Karpathy
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
OPD 专题|青稞AMA第3期
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
大模型强化学习的熵机制
【2025最新版】王树森深度强化学习全套课程(280集)涵盖PPO算法/DQN算法/A3CQ-Learning/SARSA算法等强化学习经典算法!学完即可就业!
【青稞Talk 130期】ZEDA:将 Post-Trained MoE 迁移为高效动态 MoE
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk 132期】从 MLA 到 GQLA:无需从头训练,硬件自适应高效注意力机制
verl 源码解读 与 HybridFlow 编程范式讲解