【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【吴恩达】2026年公认最好的【Agent智能体】教程!大模型入门到进阶,一套全解决!Agentic AI—附带课件代码
Agent Skill 从使用到原理,一次讲清
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
OPD 专题|青稞AMA第3期
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期
(B站首推)2026李宏毅智能体【Harness Engineering】系列课程全集,公认体验感最好的入门课程!--人工智能/大模型/Agent/LLM
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
具身智能大模型简介
World Model 专题|青稞AMA第2期
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
大模型强化学习的熵机制
(B站首推)2026李宏毅智能体【AI Agent】系列课程全集,公认体验感最好的入门课程!--人工智能/机器学习/深度学习/大模型/LLM
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
verl 源码解读 与 HybridFlow 编程范式讲解
Claude Code 从 0 到 1 全攻略:MCP / SubAgent / Agent Skill / Hook / 图片 / 上下文处理/ 后台任务