【青稞Talk 136期】PithTrain:Agent 时代的 MoE 训练框架设计
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【2026最新版】斯坦福李飞飞终于把人工智能给讲明白了!一口把机器学习、深度学习、计算机视觉、神经网络、图像处理、物体识别全给讲透了!(附课件资料+开源代码)
OPD 专题|青稞AMA第3期
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【清华大学】清华教授张亚勤:人工智能 无尽的前沿 | 完整版
World Model 专题|青稞AMA第2期
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk 131期】UniRL:面向统一多模态模型的分布式 RL 后训练框架
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
【青稞Talk 83期】统一 SFT & RL:迈向大型语言模型后训练的统一视角
3个月成功转型AI,年薪40W+,迪哥带你一口气解析四大AI就业方向以及AI各学科自学路线图,千万别选错方向了!
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期