【青稞Talk 145期】Agentic RL 下半场:无需梯度更新的即时强化学习JitRL
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
翁家翌:OpenAI,GPT,强化学习,Infra,后训练,天授,tuixue,开源,CMU,清华|WhynotTV Podcast #4
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk 146期】AI for AI 的前世今生:从进化、自进化与元进化,迈向递归自我改进(RSI)
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
姚顺雨-语言智能体博士答辩 Language Agents: From Next-Token Prediction to Digital Automation
【大白话03】一文理清强化学习RL基本原理 | 原理图解+公式推导
verl 源码解读 与 HybridFlow 编程范式讲解
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
【吴恩达】2026年公认最好的【Agent智能体】教程!大模型入门到进阶,一套全解决!Agentic AI—附带课件代码
【青稞Talk 144期】从 端到端 VLA 到 Harness VLA:面向具身智能与机器人操作任务的记忆增强式执行框架
World Model 专题|青稞AMA第2期
【青稞Talk102期】从 TRPO 到 SAPO:大模型 RL 算法演进
【硬核】手撕RoPE旋转位置编码推导,嘎嘎简单,通俗易懂!
【吴恩达】2026手把手教《LLM微调与强化学习》教程!附代码_大模型微调_LangChain_RAG_agent_生成式AI
【超爽中英】吴恩达《AI for everyone》给所有人的AI课,经典重现