【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
World Model 专题|青稞AMA第2期
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
AI智能体赋能课堂教学:从“会用工具”到“设计学生的学习经历”
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期
2026年具身智能入门学习!B站最好的机器人学习教程:模仿学习、最优控制与规划、策略梯度方法、离线强化学习、机器人模拟
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
【青稞Talk 128期】从 ARPO,到 AEPO,再到 Agent-World:探索通用智能体训练的可行路径
verl 源码解读 与 HybridFlow 编程范式讲解
"Agent is all you need":使用 ADK、A2A、MCP 和 Agent Engine 构建智能体
【青稞Talk 135期】如何设计一个好的自回归 VLA:从问题构建到工程落地的探索之旅
【青稞Talk 94期】RLinf-VLA 实践:从零上手 VLA(OpenVLA )强化学习
【青稞Talk102期】从 TRPO 到 SAPO:大模型 RL 算法演进
B站强推!2025公认最通俗易懂的【具身智能】教程,全套付费课程(附资料)—LLM大模型_RAG_大模型微调_多模态