【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
基于大语言模型(LLM)与知识图谱(Knowledge Graph)深度融合的通用智能问答平台
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
大模型强化学习的熵机制
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk】DPA & LLaVA-HUD v4:多模态大模型的深度预对齐与高效视觉编码优化
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
【青稞Talk102期】从 TRPO 到 SAPO:大模型 RL 算法演进
LLMs-Zero-to-Hero,完全从零手写大模型,从数据处理到模型训练,细节拉满,一小时学会。 build a nanoGPT from scratch
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
【青稞Talk 131期】UniRL:面向统一多模态模型的分布式 RL 后训练框架
黑马程序员AI大模型NLP自然语言处理全套视频教程,从传统序列模型到基于Transformer的预训练模型,构建完整NLP知识体系与项目实战
【青稞Talk 83期】统一 SFT & RL:迈向大型语言模型后训练的统一视角
[2026新版本]LM Studio部署与使用教程!全面支持 N卡/A卡/I卡!一键部署本地语言模型!
【青稞Talk 124期】大模型强化学习的Scaling Law
verl: An Open-Source Large-Scale LLM RL Framework for Agentic Tasks