【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
具身世界模型和VLA经典算法详解:WorldVLA
World Model 专题|青稞AMA第2期
【青稞Talk 145期】Agentic RL 下半场:无需梯度更新的即时强化学习JitRL
OPD 专题|青稞AMA第3期
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期
【青稞Talk 152期】Lego-RL:面向真实 Coding Agent 的 Harness-Native 强化学习方法
与梅涛院士聊世界模型的 3 小时访谈:语言、视频、具身终将汇聚,这会是一条全然不同的路径
verl: An Open-Source Large-Scale LLM RL Framework for Agentic Tasks
2026年具身智能入门学习!B站最好的机器人学习教程:模仿学习、最优控制与规划、策略梯度方法、离线强化学习、机器人模拟
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
自变量 x 清华|从 VLA 到世界模型:具身智能模型的最新演进与开源实践
2026南科大【Mujoco教程】具身智能机器人建模原理,从下载安装-底层原理-项目实战,从零构建机器人仿真的Python案例!AI/机器人/具身智能
【青稞Talk 153期】EnvHarness:左脚踩右脚!让环境随着 Agent 的训练一起进化
2026具身智能保姆级入门教程:运动控制、智能感知、导航定位、协同控制、人机交互全详解,究极通俗易懂!