【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体
【青稞Talk 128期】MinT: 面向百万级 LoRA 策略的训练与推理基础设施
【青稞Talk 131期】UniRL:面向统一多模态模型的分布式 RL 后训练框架
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk 130期】ZEDA:将 Post-Trained MoE 迁移为高效动态 MoE
OPD 专题|青稞AMA第3期
verl: An Open-Source Large-Scale LLM RL Framework for Agentic Tasks
【青稞Talk 83期】统一 SFT & RL:迈向大型语言模型后训练的统一视角
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
【青稞Talk 135期】如何设计一个好的自回归 VLA:从问题构建到工程落地的探索之旅
【青稞Talk 81期】MemGen:生成式隐式记忆,Agent Memory 的第三种可能
通向可落地的 GUI Agent:通义 GUI 基座模型 MAI-UI、UI-Ins (ICLR 2026) 技术报告|ICLR 2026 CUA Worksh
【青稞 Talk121 期】大规模真实世界仿真重塑端到端自动驾驶学习范式
【青稞Talk 127期】δ-mem:从长上下文到在线记忆,动态演化原生记忆的一次尝试
MobileWorld:面向真实场景的自主移动端智能体评测基准|ICLR 2026 CUA Workshop
【青稞Talk 132期】从 MLA 到 GQLA:无需从头训练,硬件自适应高效注意力机制