【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
OPD 专题|青稞AMA第3期
【青稞Talk 136期】PithTrain:Agent 时代的 MoE 训练框架设计
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【吴恩达】2026年公认最好的【Agent智能体】教程!大模型入门到进阶,一套全解决!Agentic AI—附带课件代码
S-LoRA:实现多 LoRA 大模型的高效并行化推理|青稞Talk 20期
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
World Model 专题|青稞AMA第2期
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
全网最适合初学者的Ollama教程,免费开源,带你从0到1吃透Ollama!
RAG 工作机制详解——一个高质量知识库背后的技术全流程
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【2026最新版】Qwen3本地部署与微调实战,手把手带你从零训练特定领域大模型,环境配置+模型微调+模型部署+效果展示详细教程!
【青稞Talk 94期】RLinf-VLA 实践:从零上手 VLA(OpenVLA )强化学习
Token 到底是什么?—— 揭秘大模型背后的“文字压缩术”
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk】DPA & LLaVA-HUD v4:多模态大模型的深度预对齐与高效视觉编码优化