【强化学习的数学原理】课程:从零开始到透彻理解(完结)
[veRL] 从原理层面理解训练参数,PPO & GRPO,batch size,kl & entropy
[Agentic RL][16] 强化学习(verl)训练日志怎么看,今天就给你们来个保姆级的教程~
[EP-5] 字节Verl: 最常用的RL强化学习训练框架
零基础学习强化学习算法:ppo
[Agentic RL][01] 练习两天半,完全从零开始实现PPO算法(基于Qwen2.5-0.5B),不依赖第三方强化学习框架,从原理讲解到代码实现
VeRL 灵活高效的大型语言模型强化学习框架——FORCE大会直播回放
一个视频带你搞懂 verl里面的ray到底起什么作用?verl里面的worker怎么使用?——verl源码解读系列
强化学习综述(下):RLHF·2025
deepseek-r1复现踩坑系列2: verl的二次开发-reward模块
verl 源码解读 & 客制化经验分享
强化学习|技术路线 Roadmap 介绍
【大白话03】一文理清强化学习RL基本原理 | 原理图解+公式推导
【学习小记】:一个小时从强化学习0基础到理解GRPO
由浅入深的了解 verl如何使用fsdp初始化model并且计算logits——verl源码解读系列
代码实现大模型强化学习(PPO),看这个视频就够了。
强化学习综述(中):RLHF
[A100 Training] 02 verl/slime 框架及训练任务介绍,插拔式设计,Qwen3.5全家桶,InfiGUI,thinking mode
一个适合入门强化学习的项目 代码讲解
【GOSIM HANGZHOU 2025】巫锡斌:verl:面向智能体训练的开源LLM强化学习框架