一个视频带你搞懂 verl里面的ray到底起什么作用?verl里面的worker怎么使用?——verl源码解读系列
verl 源码解读 & 客制化经验分享
强化学习|训练框架 verl 介绍
[EP-5] 字节Verl: 最常用的RL强化学习训练框架
VeRL 灵活高效的大型语言模型强化学习框架——FORCE大会直播回放
verl 源码解读 与 HybridFlow 编程范式讲解
Ray分布式计算的通用框架
vLLM源码阅读s1——源码介绍
[Agentic RL][05] 练习两天半,教你如何使用verl框架进行强化学习(环境安装、数据集处理、奖励函数构建、重要参数解析、debug)
deepseek背后的核心利器+极速入门从零搭建基于 veRL 的企业级强化学习中台,vLLM推理加速+显存优化+GSM8K 80%准确率+全流程代码开源!
【大模型】verl单机训练避坑,欢迎评论区交流,手把手教学
[Agentic RL][13] VeRL强化学习实用教程:自定义奖励计算的若干方法,从简单到复杂,覆盖所有应用需求
deepseek-r1复现踩坑系列1: 多机多卡环境下GRPO训练32B大模型的框架对比
[pytorch distributed] 从 DDP、模型并行、流水线并行到 FSDP(NCCL,deepspeed 与 Accelerate)
[Agentic RL][12] 练习两天半,教你如何使用verl的multi-turn tool agent,从数据处理、配置文件修改到源码debug
transformers源码阅读——入门(提高nlp工程师的工程能力)
deepseek-r1复现踩坑系列2: verl的二次开发-reward模块
PyTorch数据并行怎么实现?DP、DDP、FSDP数据并行原理?【分布式并行】系列第02篇
数据并行|显存“减负”,从DDP到FSDP进阶
动画理解Pytorch 大模型分布式训练技术 DP,DDP,DeepSpeed ZeRO技术