讲座摘要:
当前主流的大语言模型普遍采用Next-token prediction作为训练目标,并基于Transformer架构构建。然而,在上下文长度显著增长的应用场景下,这两种基础范式暴露出诸多问题:包括长文本任务的训练低效,以及Transformer固有的position bias现象,如lost-in-the-middle、attention sink。尽管已有许多工程手段试图缓解这些问题,我们却仍缺乏对其成因的根本理解。本次talk将系统回答以下两个核心问题:
-为什么Next-token prediction的困惑度(Perplexity)越低,长文本任务的表现却未必越好?
-Transformer中Position Bias现象的根本成因是什么?
基于这些分析,我们提出了新的长文本训练目标 LongCE 和评估指标 LongPPL,系统性地提升了多个大模型在长上下文任务下的性能,并为Transformer结构的改进提供了理论依据。
本次报告主要基于以下两篇论文展开:
- What is Wrong with Perplexity for Long-context Language Modeling? ICLR 2025 (北大、MIT、阿里巴巴)
- On the Emergence of Position Bias in Transformers. ICML 2025 (MIT, 被MIT News专题报道)
讲者信息:
王一飞,麻省理工学院计算机科学与人工智能实验室(MIT CSAIL)博士后,导师为 Stefanie Jegelka 教授。他的研究聚焦于基础模型的理论与算法设计,涵盖自监督学习、长文本建模、推理能力与模型安全性等方向。他的多项研究成果入选ICLR、ICML、NeurIPS的 Oral 和 Spotlight,曾四次获得最佳论文奖,并被 MIT News、CSAIL News、Anthropic 等机构报道。王一飞本科及博士均毕业于北京大学,获得数据科学学士、哲学学士与应用数学博士学位。博士阶段由王奕森、林宙辰与杨建生教授联合指导。
个人主页:
相关工作:
What is Wrong with Perplexity for Long-context Language Modeling? ICLR 2025
https://www.arxiv.org/abs/2410.23771
On the Emergence of Position Bias in Transformers. ICML 2025
https://www.arxiv.org/pdf/2502.01951