240. 为什么注意力要除以√dk而不是√d model?(新版)【每天一个宝藏问题】
239. 如何可视化MTP?(新版)【每天一个宝藏问题】
238. 扩散语言模型和自回归语言模型有何异同?【每天一个宝藏问题】
161. MoE每个token都要选专家,那prefill要如何并行?【每天一个宝藏问题】
114. 为什么除以√dk是在给注意力升温?【每天一个宝藏问题】
234. 为什么MLA连V也不需要显式解压?(新版)【每天一个宝藏问题】
173. 如何证明任意两句话的公共前缀都有相同的KV Cache?【每天一个宝藏问题】
237. ViT如何使用RoPE?(1D简单版)【每天一个宝藏问题】
[171]. MegaScale_MoE:字节 1440 卡训 352B MoE,比 Megatron 快 1.88 倍,论文精读【每天一个宝藏论文】
13. 旋转位置编码和复数欧拉公式有什么关系?【每天一个宝藏问题】
112. 如何可视化MOE?【每天一个宝藏问题】
231. 从prefill和decode角度理解投机解码何以加速?(新版)【每天一个宝藏问题】
193. 为什么前向KL让生成模型倾向平均,反向KL倾向专精?【每天一个宝藏问题】
236. 为什么自注意力矩阵是正方形,而交叉注意力矩阵是长方形?(新版)【每天一个宝藏问题】
183. 为什么注意力要除以√dk而不是√d model【每天一个宝藏问题】
36. 为什么推理时prefill是GEMM,而decode是(Batched)GEMV?【每天一个宝藏问题】
我看到了人类数学的落日
可视化 OpenAI 对纳维-斯托克斯问题的解答 - Complexity - 中配
33. 用户改提示词为什么不会影响前面的KV Cache?【每天一个宝藏问题】
每天认识一个AI术语之——拟合与过拟合