【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
朱邦华: SGLang,强化学习,英伟达收购,二次创业,清华,伯克利,LMSYS,Chatbot Arena,勇于放弃
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
300行代码从零实现GRPO算法,手把手教你实现 Agent RL,训练 Agentic RAG (DeepSeek R1 同款技术)
【青稞Talk 131期】UniRL:面向统一多模态模型的分布式 RL 后训练框架
北京大学在读博士李雪曈:基于稀有事件的分布式逻辑回归
verl 源码解读 与 HybridFlow 编程范式讲解
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk102期】从 TRPO 到 SAPO:大模型 RL 算法演进
OPD 专题|青稞AMA第3期
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
Talk | 卡耐基梅隆大学何泰然:安全、敏捷、能泛化的基于强化学习的机器人控制
【青稞Talk 136期】PithTrain:Agent 时代的 MoE 训练框架设计
【青稞Talk 83期】统一 SFT & RL:迈向大型语言模型后训练的统一视角
大模型强化学习的熵机制
【青稞Talk 128期】MinT: 面向百万级 LoRA 策略的训练与推理基础设施
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架