ACL 2025最佳论文|LLM注定是稀疏架构

1.9万
6
2025-08-20 10:37:01
393
138
1011
148
长文本处理能力是新一代语言模型的关键需求,但传统注意力机制带来的巨大计算开销一直是一个棘手的问题。在这种背景下,稀疏注意力机制展现出了提升计算效率同时又能保持模型性能的巨大潜力。 北大和DeepSeek提出名为NSA的创新性稀疏注意力机制,它能够原生支持训练,通过将算法创新与硬件优化相结合,实现了高效的长文本处理。NSA采用了动态分层的稀疏策略:在保证全局信息获取的同时,还能够精确捕捉局部细节,这得益于其巧妙结合了粗粒度的令牌压缩和细粒度的令牌选择。 NSA的主要创新点有两个:一是通过精心设计的算法平衡了计算密度,并针对现代硬件做了专门优化,显著提升了运行速度;二是实现了端到端的训练模式,在确保模型性能的前提下大幅降低了预训练的计算量。 同时,NSA是一个专为硬件优化的系统,打破了性能与成本之间的权衡取舍,推动高效 LLM 发展到新的阶段。 讲者简介:袁境阳,北京大学计算机学院博士生。主要研究方向是高效大语言模型和稀疏注意力机制,曾获北京市优秀毕业生、北京大学优秀毕业生等荣誉。在NeurlPS, ACL, ICML, ACM MM等多个计算机顶会上以第一作者身份发表论文,谷歌学术被引用5000余次。袁境阳目前在DeepSeek实习,作为核心贡献者参与了DeepSeek-V2、DeepSeek-V3、DeepSeek-R1及等多个业界领先的大语言模型的研发工作。
发扬科学思辨精神,链接全球AI 爱好者
ACL 2025
(9/10)
4.2万播放
简介
ACL 2025最佳论文-北大人工智能研究院吉嘉铭博士深度讲解
01:00:26
ACL 2025 | 智能体与数据合成 3篇工作
01:05:16
ACL 2025 | LLM 安全与对齐 2篇工作
27:58
ACL 2025 | 多模态与应用场景 5篇工作
01:27:00
ACL 2025 | LLM推理与知识边界专题3篇工作
46:41
ACL 2025 杰出论文 | Pre³:通过确定性下推自动机实现更快的大模型结构化文本生成
35:15
ACL 2025 最佳主题论文 | Meta-rater: 一种多维度的预训练数据筛选框架
27:11
ACL 2025 杰出论文 | 重新思考提示词策略在大语言模型测试时间拓展时的作用:一个概率论的视角
52:35
ACL 2025最佳论文|LLM注定是稀疏架构
37:49
ACL 2025 杰出论文 Llama see, llama do: 大模型的上下文趋同与干扰信息的机制解析 | 牛靖程博士开讲
30:13
客服
顶部
赛事库 课堂 2021拜年纪