【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
翁家翌:OpenAI,GPT,强化学习,Infra,后训练,天授,tuixue,开源,CMU,清华|WhynotTV Podcast #4
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
World Model 专题|青稞AMA第2期
OPD 专题|青稞AMA第3期
大模型强化学习的熵机制
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk102期】从 TRPO 到 SAPO:大模型 RL 算法演进
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
【青稞Talk 83期】统一 SFT & RL:迈向大型语言模型后训练的统一视角
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
【学习小记】:一个小时从强化学习0基础到理解GRPO
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
【吴恩达】2026手把手教《LLM微调与强化学习》教程!附代码_大模型微调_LangChain_RAG_agent_生成式AI
2026北京智源大会丨强化学习
【极致中配】2026年最新版 Stanford CS336: 从头构建大语言模型
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期