本文《SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space》由腾讯优图实验室和伦敦国王学院的研究者合作提出,主要针对大语言模型(LLMs)中全注意力(Full Attention)的二次计算复杂度问题。论文指出,尽管稀疏注意力(Sparse Attention)能降低计算成本,但原生稀疏注意力训练方法(如NSA、MoBA)存在一个关键悖论:这些旨在近似全注意力的模型,反而在注意力稀疏性上低于全注意力模型,导致性能下降。SSA通过引入一个统一的训练框架,结合全注意力和稀疏注意力,并强制双向对齐,从而提升注意力稀疏性和模型性能。
论文的主要贡献包括:
提出SSA框架,通过双向对齐增强稀疏注意力训练的效果。
证明提高模型的内在注意力稀疏性可以同时改善稀疏和全注意力推理性能。
实验显示SSA在多个基准测试中达到最先进水平,并支持灵活的计算-性能权衡。
全注意力机制在长上下文处理中计算成本高昂,而训练自由的稀疏注意力方法(如滑动窗口注意力)虽然高效,但常导致性能严重下降。原生稀疏注意力方法(如MoBA、NSA)旨在通过训练缓解这一问题,但论文发现它们存在“梯度更新缺陷”:在稀疏训练中,低排名的键值对被排除,无法接收梯度更新,导致模型无法学习抑制无关令牌,从而注意力稀疏性不足。
Figure 1 展示了初步实验结果:稀疏注意力训练模型(SA)在注意力熵和稀疏性上均不如全注意力模型(FA),而SSA在两者上均取得最优结果,这突显了SSA的动机——通过对齐机制提高稀疏性。
SSA的核心是一个双流训练框架,在训练过程中以50%的概率随机选择全注意力或稀疏注意力流,并引入双向对齐损失来强制两个流的输出一致性。这确保了梯度能流向所有令牌,同时促进稀疏分布。
具体来说,SSA的损失函数包括:
主要损失:交叉熵损失,基于采样的注意力模式(全或稀疏)。
对齐损失:由稀疏性损失(鼓励全注意力输出模仿稀疏注意力)和承诺损失(鼓励稀疏注意力输出接近全注意力)组成,总损失为 L=Emode[Lmode]+αLalignment。

Figure 2 直观展示了SSA的训练流程:双流并行,通过对齐机制实现双向正则化。这种方法不仅提升了稀疏性,还保持了训练效率,因为辅助注意力计算仅用于对齐,不传播到下一层。
论文使用Llama-3.2-1B架构进行预训练,上下文长度为8k,数据集为SmolLM corpus(100B tokens)。基线方法包括:
FullAttn:标准全注意力。
MoBA:可训练的稀疏注意力方法。
NSA:结合多种注意力模式的复杂框架。
评估维度包括:
语言建模:WikiText困惑度(PPL)。
常识推理:PIQA、HellaSwag、ARC等基准。
长上下文外推:使用LongBench、NIAH(Needle-in-a-Haystack)和PG19评估外推能力。
语言建模性能
如表1所示,SSA在稀疏注意力推理下达到最低困惑度,并在全注意力推理下匹配FullAttn性能。这表明SSA的对齐机制有效缩小了稀疏与全注意力之间的差距。
常识推理
SSA在常识推理任务中 consistently 优于基线,甚至在感受野为256时超越FullAttn。这归因于SSA的稀疏分布使模型更关注信息丰富的令牌,减少噪声。
稀疏级别外推
SSA在不同稀疏级别下表现出单调性能提升,而MoBA外推能力较差(Figure 3)。这表明SSA的稀疏性促进了对长上下文的稳定适应。
在长上下文设置下(如32k令牌),SSA在NIAH任务中达到100%准确率(全注意力推理),而FullAttn在超出训练长度后崩溃。SSA的困惑度保持稳定,优于其他方法(Table 2)。
Figure 4 进一步分析了长上下文外推:稀疏注意力训练通过缓解“注意力沉没”现象(即模型过度关注早期令牌),改善了外推能力。SSA的注意力分布更稀疏,从而在长序列中保持性能。
论文通过消融实验验证了SSA组件的必要性:
对齐损失:移除后性能显著下降,双向对齐是关键。
稀疏级别:过小或过大的感受野都会损害性能,需平衡设计。
采样比例:全注意力流比例影响性能,适度混合最优。
这些实验表明SSA的鲁棒性,并强调了对齐机制的作用。
SSA通过解决稀疏注意力训练的梯度缺陷,实现了更高的注意力稀疏性和性能。它不仅提升了稀疏推理效率,还意外地改善了长上下文外推能力,为设计可扩展的LLMs提供了新方向。论文的代码和配置公开,促进了后续研究。
总之,这篇论文通过创新的对齐框架,在稀疏注意力领域做出了重要推进,强调了稀疏性在模型泛化中的核心作用。