Ray分布式计算的通用框架
【强化学习的数学原理】课程:从零开始到透彻理解(完结)
verl 源码解读 & 客制化经验分享
[veRL] 从原理层面理解训练参数,PPO & GRPO,batch size,kl & entropy
动画理解Pytorch 大模型分布式训练技术 DP,DDP,DeepSpeed ZeRO技术
[EP-5] 字节Verl: 最常用的RL强化学习训练框架
[Agentic RL][01] 练习两天半,完全从零开始实现PPO算法(基于Qwen2.5-0.5B),不依赖第三方强化学习框架,从原理讲解到代码实现
verl 源码解读 与 HybridFlow 编程范式讲解
VeRL 灵活高效的大型语言模型强化学习框架——FORCE大会直播回放
[Agentic RL][12] 练习两天半,教你如何使用verl的multi-turn tool agent,从数据处理、配置文件修改到源码debug
[Agentic RL][15] verl参数怎么看,今天就给你们来个保姆级的教程
03-Ray-大模型时代的AI计算基础设施
代码实现大模型强化学习(PPO),看这个视频就够了。
[Agentic RL][16] 强化学习(verl)训练日志怎么看,今天就给你们来个保姆级的教程~
deepseek背后的核心利器+极速入门从零搭建基于 veRL 的企业级强化学习中台,vLLM推理加速+显存优化+GSM8K 80%准确率+全流程代码开源!
[Agentic RL][06] 练习两天半,使用verl实现code-r1(agent-rl,verl二次开发),原理到代码实现全流程解读
【大模型】verl单机训练避坑,欢迎评论区交流,手把手教学
强烈推荐新人入门LLM的方法——逐行调试一个小模型
由浅入深的了解 verl如何使用fsdp初始化model并且计算logits——verl源码解读系列
[Agentic RL][14] Agent is all you need,verl自定义Agent Loop(python code交互)