【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
verl: An Open-Source Large-Scale LLM RL Framework for Agentic Tasks
[动手学习大模型8/12] 从零手写RAG和 Agentic RAG(拆解 chatbox工具和 prompt engineering 实现 Agentic)
【吴恩达】2026年公认最好的【Agent智能体】教程!大模型入门到进阶,一套全解决!Agentic AI—附带课件代码
verl 源码解读 与 HybridFlow 编程范式讲解
World Model 专题|青稞AMA第2期
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
300行代码从零实现GRPO算法,手把手教你实现 Agent RL,训练 Agentic RAG (DeepSeek R1 同款技术)
关于大模型的碎碎念,模型架构、预训练、后训练、推理
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
2026Minimind课程学习视频
LLM大模型入门!一口气带你学完AI agent、transformer、LangChain 、RAG 等大模型核心知识点!简直不要太爽!
从分布视角看SFT、RL和OPD,解释为什么RL和OPD泛化性能更好
【青稞Talk 144期】从 端到端 VLA 到 Harness VLA:面向具身智能与机器人操作任务的记忆增强式执行框架
翁家翌:OpenAI,GPT,强化学习,Infra,后训练,天授,tuixue,开源,CMU,清华|WhynotTV Podcast #4
2026版LangChain教程,langchain快速入门, Agent智能体rag项目实战