【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 145期】Agentic RL 下半场:无需梯度更新的即时强化学习JitRL
【青稞Talk 146期】AI for AI 的前世今生:从进化、自进化与元进化,迈向递归自我改进(RSI)
【中英双语】2026版首发斯坦福CS329A:自改进AI Agents完整课
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk 140期】在线自进化后训练框架 DRIFT:没有外部专家监督时,如何让 OPD 策略学会自我持续进化
【吴恩达】2026年公认最好的【Agent智能体】教程!大模型入门到进阶,一套全解决!Agentic AI—附带课件代码
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
OPD 专题|青稞AMA第3期
【2026最新】Qwen3-8B本地部署与微调实战,手把手带你从零训练特定领域大模型,环境配置+模型微调+模型部署+效果展示详细教程!
World Model 专题|青稞AMA第2期
【全600集】这可能是2026年B站最全最细的【吴恩达Agent智能体】零基础全套教程,逼自己一个月学完,轻松变Agent大神!全程干货0废话!
【青稞Talk 142期】LA4VLA:从 VLA 预训练中解耦语言-动作监督
【2025版】吴恩达强化学习教程!入门到进阶,全程干货讲解,就怕你不学!(人工智能丨机器学习丨深度学习)
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【附PDF】突然发现李飞飞的agent综述真的好清晰!!如果你agent ai很差,一定要看李飞飞整理的这份综述!!
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【大白话04】一文理清强化学习PPO和GRPO算法流程 | 原理图解
2026北京智源大会丨强化学习