一个高效可扩展的 Agentic RL 框架
Agentic RL 如何让语言模型成为自主Agent
AI Agent与Agentic AI:原理、区别与应用深度解析
[Agentic RL] 10 分布的视角理解 LLM 的 SFT 训练和 RL 训练,Forward/Reverse KL,分布与奖励
8分钟带你速读重磅综述Agentic RL范式飞跃
[Agentic RL] 14 verl AgentLoop 全流程与计算细节,async rollout 实现,状态机,tool / interaction
OPD 专题|青稞AMA第3期
姚顺雨-从语言模型到语言智能体(From Language Models to Language Agents)
从分布视角看SFT、RL和OPD,解释为什么RL和OPD泛化性能更好
【伯克利大学】《Agentic AI》(全13讲)在实际场景中,像工程师一样打造AI智能体!
[Agentic RL][05] 练习两天半,教你如何使用verl框架进行强化学习(环境安装、数据集处理、奖励函数构建、重要参数解析、debug)
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【杨玉庆 微软亚洲研究院】从Agentic RL到自我演进的智能体 Agent Lightning:智能体原生的学习系统
【全600集】这可能是2026年B站最全最细的【吴恩达Agent智能体】零基础全套教程,逼自己一个月学完,轻松变Agent大神!全程干货0废话!
[Agentic RL] 12 verl infra AgentLoop 基本概念及流程,AgentLoopManager,hybrid训练与推理
MiniMax M2.1:基于真实数据驱动的数据合成,与 Agentic RL
verl: An Open-Source Large-Scale LLM RL Framework for Agentic Tasks
最近爆火的 Harness Engineering 到底是啥?一期讲透!
[EP-5] 字节Verl: 最常用的RL强化学习训练框架
[Agentic RL] 01 PG loss components,dual-clip,entropy,kl,如何自定义 pg loss