【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
【2026最新】Qwen3-8B本地部署与微调实战,手把手带你从零训练特定领域大模型,环境配置+模型微调+模型部署+效果展示详细教程!
【青稞Talk 146期】AI for AI 的前世今生:从进化、自进化与元进化,迈向递归自我改进(RSI)
OPD 专题|青稞AMA第3期
【青稞Talk 140期】在线自进化后训练框架 DRIFT:没有外部专家监督时,如何让 OPD 策略学会自我持续进化
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk 145期】Agentic RL 下半场:无需梯度更新的即时强化学习JitRL
World Model 专题|青稞AMA第2期
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径
怎么加快大模型推理?10分钟学懂VLLM内部原理,KV Cache,PageAttention
【青稞Talk 83期】统一 SFT & RL:迈向大型语言模型后训练的统一视角
Rectified Flow:矫正流生成式模型的概念及应用实践|青稞Talk 31期
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
大模型部署选Ollama还是vLLM?看完直接不踩坑
【青稞Talk102期】从 TRPO 到 SAPO:大模型 RL 算法演进
【青稞Talk 144期】从 端到端 VLA 到 Harness VLA:面向具身智能与机器人操作任务的记忆增强式执行框架