【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
World Model 专题|青稞AMA第2期
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
大模型强化学习的熵机制
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
OPD 专题|青稞AMA第3期
【吴恩达】2026年公认最好的【大模型微调】教程!大模型入门到进阶,一套全解决!Fine tune the LLM large model-附带课件代码
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk102期】从 TRPO 到 SAPO:大模型 RL 算法演进
LLM大模型入门!一口气带你学完AI agent、transformer、LangChain 、RAG 等大模型核心知识点!简直不要太爽!
【青稞Talk 128期】MinT: 面向百万级 LoRA 策略的训练与推理基础设施
【青稞Talk 81期】MemGen:生成式隐式记忆,Agent Memory 的第三种可能
【青稞Talk 83期】统一 SFT & RL:迈向大型语言模型后训练的统一视角
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期
RLite: 用20行代码从头写RL
【青稞Talk 128期】从 ARPO,到 AEPO,再到 Agent-World:探索通用智能体训练的可行路径