
本文是Minimax M3的最新技术报告 MiniMax Sparse Attention 的深度解读,这是一种为超长上下文大语言模型设计的分组查询块稀疏注意力机制。为了解决传统注意力机制在处理百万级全文本时面临的计算复杂度随长度平方增长的瓶颈,MSA 通过一个轻量级的索引分支(Index Branch)为每个查询组动态筛选出最重要的前 K 个键值块,从而将计算负担维持在固定且极低的水平。该方案不仅通过算法与 GPU 内核的联合设计实现了在 1M 上下文下高达 14.2 倍的推理提速,还利用 KL 散度对齐损失确保了稀疏模型在多模态理解和逻辑推理任务中能够媲美全注意力模型的性能。其核心价值在于提出了一种极简且易于扩展的架构,既支持从头开始的稀疏预训练,也支持从已有稠密模型无损转换,为工业级长文本应用提供了兼具极高性能与高精度的实操路径。

欢迎来到本次关于 MiniMax Sparse Attention (MSA) 的深度解析。随着大模型在智能体工作流、代码库推理和永久记忆等场景中的广泛应用,处理数十万到上百万超长上下文的能力已成为前沿大模型的“刚需”。然而,传统的Softmax注意力机制带来的二次方算力开销,使得这种超长上下文在生产环境的部署变得难以承受。为此,MiniMax提出了一种极简、高效且可扩展的稀疏注意力机制——MSA,在原生的109B参数多模态MoE模型上实现了最高 28.4倍 的算力释放,并已将推理内核与生产级模型全面开源

上下文长度是评估大模型能力的一个关键维度。目前,大语言模型正在从短暂的单轮对话转向长周期的智能体工作流(Agentic Workflows),这要求模型能在跨度极大的步骤中进行代码推理、网页导航和结构化文档生成。这类任务动辄涉及百万级别的Token。如图所示,传统Causal Softmax Attention 的计算复杂度为 O(N2),随着序列长度 N 的增长,算力成本呈平方级爆炸。这种严苛的算力和内存瓶颈,使得传统的全注意力机制在生产环境中的部署成为了一个几乎无法实现的“不可能的三角”

为了打破算力瓶颈,MSA 遵循了“奥卡姆剃刀”原则,在大量消融实验后仅保留了最核心的组件。它采用了基于分组查询注意力(GQA)的块级稀疏架构。 具体来说,MSA 放弃了对GPU不够友好的Token级筛选,而是采用分块选择(Blockwise Selection),并在此基础上增加了一个极其轻量级的独立分支(Index Branch)来进行 Top-K 精准召回。对于每一个GQA分组,该机制都会独立规划出最优的稀疏路径,使得每个查询只需关注被选中的关键块。通过这种设计,MSA的算法复杂度成功从 O(N2) 断崖式降至与序列增长无关的固定值 O(N⋅kBk)。

这页展示了MSA在109B模型上带来的惊人性能飞跃。在保持与全注意力机制(GQA)相媲美的下游任务性能的前提下,MSA实现了指数级的效率提升。 在100万(1M)上下文长度下,相比于GQA,MSA将每个Token的注意力计算量(FLOPs)暴降了 28.4倍。由于架构极大减少了算力冗余,在H800 GPU的实测环境中,MSA成功将理论算力转化为了实打实的运行速度:预填充(Prefill)阶段提速了 14.2倍,解码(Decoding)推理阶段提速了 7.6倍。

MSA的底层是一个精巧的“双轨引擎”架构。 左侧是索引分支(Index Branch),它仅仅增加了两个投影矩阵,通过计算极简的打分后采用 Max-Pooling 聚合成区块级(Block-level)得分,从而为每个GQA分组选出 Top-K 的关键块。 右侧是主干分支(Main Branch),它接收到选中的块索引后,仅在这些“最有价值”的块内执行绝对精确的 Softmax Attention,彻底丢弃所有无效计算。此外,架构中强制保留了包含当前查询的“局部块(Local Block)”,确保了基础的语义连续性和训练的稳定性

在MSA的实际部署配置中,我们将每一个块的大小(Bk)设定为128个Token,并且每次为每个查询和GQA分组选取 k=16 个区块。 这意味着什么?这意味着,哪怕全局上下文长度扩展到了夸张的 1,000,000 个Token,MSA也会强制模型在每一层将计算预算严格限制在 16×128=2,048 个“黄金Token”上。无论文本多长,模型的注意力算力天花板被彻底锁死在了这2048个Token上,实现了极致的信息压缩。

“算法如果不与硬件执行路径协同设计,稀疏化只是纸上谈兵。” 为了把理论上的省算力变成墙上时钟的加速,MSA在底层Kernel上做了两项重大创新: 首先是无指数计算内核(Exp-Free Top-K Kernel):它抛弃了耗时的Softmax及其包含的指数运算,直接利用原始得分排序(由于Softmax本身保序),并在寄存器级别为较小的 k 值(k=16)做了极速优化的共享内存分配。 其次是KV外层迭代循环(KV-Outer Iteration):这颠覆了传统的Query循环模式。通过基于被选中的KV块反向聚合关联的Query,将张量核心(Tensor Core)的算术强度(FLOPs/IO)从原来的 G 倍极大提升至了大约 23Bk 倍,极大地缓解了内存带宽瓶颈。

MSA不仅支持从零训练,还能完美支持现有的全注意力(Full-Attention)模型权重进行“无损切换”。 这得益于其精妙的二阶段训练策略:阶段1(预热期 Warmup),模型暂时保持全注意力机制运行,利用辅助的KL Loss让新加入的“索引分支”去拜师学艺,模仿“主分支”正确的注意力分布规律。阶段2(稀疏继续预训练 Sparse CPT),此时开启Top-K截断,并实施关键的梯度截断(Gradient Detach),在索引分支输入端阻止辅助KL Loss的梯度回传,彻底防止它污染Backbone(主干网络)的权重

无需复杂的人工硬编码规则,MSA在训练后自然涌现出了惊人的自主稀疏路径规划能力。 通过可视化注意力分布,我们发现它学会了三件事:第一,注意力下沉(Attention Sink),模型自发将首个Token群作为全局信息的“定海神针”,即使没有强制规则也会高频选中;第二,局部上下文(Local Context),它会高度关注当前Query附近的Token,保障语句语义的连贯性;第三,长程检索(Long-Range Retrieval),不同GQA分组的注意力头会自适应地扫描不同的历史记忆条带,实现了灵活且互补的信息捕捉。

这是在原生 109B 参数量级的真实对比数据。MSA 在处理通用知识(MMLU, ARC)、数学(GSM8K, MathVista)、代码(HumanEval, EvalPlus)以及视觉与多模态(MMMU, VideoMME)等各大榜单时,交出了令人满意的答卷。 与全注意力基线模型相比,从零开始的稀疏预训练模型(MSA-PT)不仅没有发生能力降级,反而凭借结构特性,在数学与多模态原生任务上实现了微小的反超。这证明了用稀疏机制替代稠密注意力不会妥协模型的综合智力。

长文本检索是检验稀疏模型能力的终极试金石。在这里,我们测试了业界公认的 HELMET-128K 和 RULER-128K 榜单。 在每次仅仅分配 16×128=2048 个Token这种极限压力的算力预算下,MSA(MSA-CPT)与全计算基线(Full)打成了平手,完美保持了128K甚至1M级别的长文本精准记忆与复杂推理能力。这不是妥协,而是真正的底层架构进化。
Minimax 技术报告的发布页带来了M3模型权重的开源,大家有兴趣可以去往开源网站自主尝试,感谢大家的观看。