UP主做的「合乎周礼」翻译器
All in Transformer | 一次讲透注意力机制:看完彻底听懂!(学不会跟我爆了)(极其详细简单的教程)
【青稞Talk95期】从 π_0 到 π_RL:面向流匹配 VLA 的强化学习后训练框架
【青稞Talk 68期】slime:专为 RL Scaling 设计的大规模 RL 训练框架及实践
【青稞Talk106期】GDPO:解决 GRPO 在多奖励 RL 训练中的"优势崩溃"问题
OPD 专题|青稞AMA第3期
【中英双语】6GB显存跑Qwen 3.6 35B大模型llama.cpps实战?GTX 1060速度飙到17 token/s | Codacus
【青稞Talk 78期】从 LLM-RL 到 Agentic RL:如何让语言模型成为自主智能体|青稞Talk 78期
【青稞Talk 117期】OpenClaw-RL: 结合 GRPO + OPD,在使用中自适应变强的龙虾
【青稞Talk101期】MiniMax M2.1:Agent 后训练经验与认知
Transformer 架构挑战者出现? 两篇顶级论文拆解
【青稞Talk 133期】VeRL-Omni:基于 VeRL 及 vLLM-Omni 构建的面向多模态生成模型的高效RL后训练框架
【青稞Talk 135期】如何设计一个好的自回归 VLA:从问题构建到工程落地的探索之旅
花5万买Mac Studio跑AI值不值?用了一年终于能回答了。附模型评论和硬件对比,部署指南
【官方双语】直观解释注意力机制,Transformer的核心 | 【深度学习第6章】
【数学】注意力机制到底在做什么?
World Model 专题|青稞AMA第2期
Gemma 4 还是 Qwen?本地跑模型,我直接告诉你选谁
【青稞Talk 123期】DeepSeek V4 模型在 SGLang 中的系统级优化与全栈适配
【青稞Talk 136期】PithTrain:Agent 时代的 MoE 训练框架设计
【青稞Talk 125期】重探 On-Policy Distillation(OPD):三类典型失败以及修复路径