【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
verl: An Open-Source Large-Scale LLM RL Framework for Agentic Tasks
World Model 专题|青稞AMA第2期
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
怎么加快大模型推理?10分钟学懂VLLM内部原理,KV Cache,PageAttention
verl 源码解读 与 HybridFlow 编程范式讲解
【青稞Talk 126期】STream3R & 4RC: 面向几何与运动理解的流式前馈 3D/4D 重建
【青稞Talk 144期】从 端到端 VLA 到 Harness VLA:面向具身智能与机器人操作任务的记忆增强式执行框架
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
OPD 专题|青稞AMA第3期
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期
【青稞Talk 141期】Alignment unlocks Scaling:Qwen-Robot Suite 的设计原理和背后的思考
【8】KV Cache 原理讲解
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾