长文本处理能力是新一代语言模型的关键需求,但传统注意力机制带来的巨大计算开销一直是一个棘手的问题。在这种背景下,稀疏注意力机制展现出了提升计算效率同时又能保持模型性能的巨大潜力。
北大和DeepSeek提出名为NSA的创新性稀疏注意力机制,它能够原生支持训练,通过将算法创新与硬件优化相结合,实现了高效的长文本处理。NSA采用了动态分层的稀疏策略:在保证全局信息获取的同时,还能够精确捕捉局部细节,这得益于其巧妙结合了粗粒度的令牌压缩和细粒度的令牌选择。
NSA的主要创新点有两个:一是通过精心设计的算法平衡了计算密度,并针对现代硬件做了专门优化,显著提升了运行速度;二是实现了端到端的训练模式,在确保模型性能的前提下大幅降低了预训练的计算量。
同时,NSA是一个专为硬件优化的系统,打破了性能与成本之间的权衡取舍,推动高效 LLM 发展到新的阶段。
讲者简介:袁境阳,北京大学计算机学院博士生。主要研究方向是高效大语言模型和稀疏注意力机制,曾获北京市优秀毕业生、北京大学优秀毕业生等荣誉。在NeurlPS, ACL, ICML, ACM MM等多个计算机顶会上以第一作者身份发表论文,谷歌学术被引用5000余次。袁境阳目前在DeepSeek实习,作为核心贡献者参与了DeepSeek-V2、DeepSeek-V3、DeepSeek-R1及等多个业界领先的大语言模型的研发工作。