翁家翌:OpenAI,GPT,强化学习,Infra,后训练,天授,tuixue,开源,CMU,清华|WhynotTV Podcast #4
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
verl: An Open-Source Large-Scale LLM RL Framework for Agentic Tasks
8个月连获 NeurIPS 与 ICML 双Best Paper,乐洋谈 RL 的能力边界
【中英双语】2026版首发斯坦福CS329A:自改进AI Agents完整课
【青稞Talk102期】从 TRPO 到 SAPO:大模型 RL 算法演进
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【吴恩达】2026年公认最好的【Agent智能体】教程!大模型入门到进阶,一套全解决!Agentic AI—附带课件代码
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期
从分布视角看SFT、RL和OPD,解释为什么RL和OPD泛化性能更好
40分钟了解OPD的主要工作:为什么RL时代还需要On-Policy Distillation
(B站首推)2026李宏毅智能体【AI Agent】系列课程全集,公认体验感最好的入门课程!--人工智能/机器学习/深度学习/大模型/LLM
【青稞Talk 141期】Alignment unlocks Scaling:Qwen-Robot Suite 的设计原理和背后的思考
【青稞Talk 143期】新一代具身智能数据范式ACE-Data-0:以人为中心的环境式采集构建具身数据引擎
【大白话03】一文理清强化学习RL基本原理 | 原理图解+公式推导
【青稞Talk 152期】Lego-RL:面向真实 Coding Agent 的 Harness-Native 强化学习方法
(B站首推)2026李宏毅智能体【Harness Engineering】系列课程全集,公认体验感最好的入门课程!--人工智能/大模型/Agent/LLM
【吴恩达】2026年公认最好的【大模型微调】教程!大模型入门到进阶,一套全解决!Fine tune the LLM large model-附带课件代码