[FAI] 北京大学 李柄辉 | 理解大模型预训练动力学:从泛函尺度律视角

1832
0
2026-05-15 19:30:00
61
21
105
17
讲座标题(中文): 理解大模型预训练动力学:从泛函尺度律视角  讲座标题(英文): Understanding LLM Pre-Training Dynamics via Functional Scaling Laws 讲座摘要:尺度律(Scaling Law)已成为指导现代人工智能发展的核心准则。它不仅确立了“大规模参数是实现模型通用性的必要条件”这一共识,更揭示了资源投入能稳定提升系统性能的规律。在工程实践中,经验性的尺度律已被广泛用于指导实际大模型的训练。然而,现有的经验尺度律仍面临三大局限: 1.缺乏动态视角:无法刻画训练的完整动力学过程; 2.忽视超参影响:难以定量反映学习率、批大小等关键超参数对训练效率的影响; 3.现象解释力不足:无法解释实际训练中的重要观测(如采用 WSD 学习率调度时,损失曲线呈现出的显著两阶段特性)。 针对上述局限性,本系列研究从第一性原理出发,基于幂律核回归模型,推导出了能够精确刻画模型训练完整损失动力学的泛函尺度律(Functional Scaling Law)。泛函尺度律表明,模型训练可解耦为“信号学习”与“噪声积累/遗忘”两个动力学过程,整体的损失曲线行为由两者间的动态平衡所决定。更进一步,基于泛函尺度律框架,我们从理论层面分析了模型训练中的学习率调度与批大小调度的最优方案,并在真实大模型预训练中验证了理论结果的有效性。 讲者信息:李柄辉,北京大学国际机器学习研究中心 2023 级博士生,本科毕业于北京大学图灵班。研究方向为深度学习理论,特别是大模型预训练机理、优化理论及尺度律。其关于泛函尺度律与学习率调度的相关工作曾获选NeurIPS 2025 Spotlight论文。目前,已在NeurIPS、ICLR、ICML、COLT等学术顶会以第一/共一作者身份发表论文 10 篇,并入选中国科协青年人才托举工程博士生专项计划。
争做国内最好的人工智能研讨班!seminar官网:fai-seminar.ac.cn
FAI-Seminar
(71/76)
31.2万播放
简介
[FAI] 北大 张博航 | 基于子图的图神经网络表达能力探究
01:28:33
[FAI] 北大 罗胜杰 | 人工智能与通用分子表征
01:22:02
[FAI] MIT 刘子鸣 | 智能从饥饿中诞生
01:20:51
[FAI] UMich马鉴昊 | 均值估计还能这么玩?稀疏鲁棒均值估计
01:01:36
[FAI] 北大 金及凯 | 无穷维与有限维区别多大?算子学习的最优算法
01:24:53
[FAI] 中科大 王博涵 | 动量可以加速SGD吗?
01:17:45
[FAI] 清华 滕佳烨 | 现代机器学习视角下的不确定性度量 | ICLR 23
01:05:55
[FAI] 普林斯顿 蔡天乐 | 让大语言模型自己创造工具
55:33
[FAI*] TTIC 李志远 | 平坦正则化对泛化的帮助 (special talk)
01:05:56
[FAI] 清华 陈乐偲 | 双层优化问题最优一阶算法
55:39
[FAI] NeurIPS23' oral 北大 张博航 | 思维链如何解锁大模型的隐藏能力
01:08:13
[FAI] 清华 顾欣然 | 分布式学习中如何设置通信频率?平方同步律!
01:13:37
[FAI] DeepMind 石佳欣 | 长序列建模?基于小波理论的神经网络框架
01:13:06
[FAI] JMLR 港中文 范凤磊 | 揭秘ReLU神经网络
01:03:17
[FAI] CMU 刘冰彬 | 顺序推理问题的"捷径"解法 ICLR 23' oral, NeurIPS 23' spotlight
01:12:10
[FAI] 清华 温凯越 | Transformer不能被单元方法解释 NeurIPS 23'
01:02:07
[FAI] 清华 游凯超 | 理解、学习与使用PyTorch编译器(torch.compile)
48:23
[FAI] UMich 胡威 | 神经网络表示中的隐藏结构
01:05:02
[FAI] CMU 翟润天 | 表征学习和大模型的泛
01:25:49
[FAI] 北大 罗胜杰 | 高效等变网络设计 ICLR 24'
01:19:58
[FAI] Princeton 高天宇 | 上下文并行编码实现语言模型的长文本拓展
01:07:10
[FAI] 香港大学 邹荻凡 | 基于扩散蒙特卡洛方法的快速采样算法
58:37
[FAI] NYU 陆一平 | 基于模拟算法校准的AI4science:算法与理论
01:13:08
[FAI] Princeton 俞鼎力 | 张量程序VI:无限深度神经网络中的特征学习
01:09:36
[FAI] Princeton 吕凯风 | 浅谈神经网络在算法推理上的局限性
01:30:19
[FAI] CMU 李禹辰 | 现代语言模型的理论理解
01:19:21
[FAI*] 清华大学 李建 | 深度学习中梯度方法的泛化与隐式偏差 (special talk)
01:13:17
[FAI] 北大 张博航 | 图神经网络表达能力的评估准则
01:12:27
[FAI] CMU 黎善达 | 更快的大模型推理 & AIMO竞赛第二名方法分享
01:16:47
Transformer上下文学习的训练过程分析
01:19:20
[FAI] Berkeley 吴京风 | 梯度下降新视角:大步长、振荡与加速
01:12:07
[FAI] 港城大 马梓业 | 通过增强鞍点的可逃脱性以克服非凸景观下的挑战
01:39:29
[FAI] 人大 刘勇 | 检索增强能提升大模型的推理能力吗?
53:36
[FAI] 清华大学 陈乐偲 | 基于“懒”Hessian技术的快速牛顿算法 ICLR 25' Oral
01:05:18
[FAI] 清华 吕凯风 | 大模型训练中的扩展定律与相变现象
01:37:45
[FAI] Stanford 温凯越 | 山谷河流:从损失景观理解WSD学习率机制
01:15:22
[FAI] Princeton 黄凯旋 | MATH-Perturb: 评估llm面对复杂改动的数学推理能力
59:33
[FAI] 清华 卢睿 | 理解扩散模型生成文字的幻觉问题 | ICLR 2025
01:03:37
[FAI] MIT 杨松琳 | 可扩展线性RNN的进展:DeltaNet及其变体
01:55:24
[FAI] 清华 陈焕然 | 扩散模型即为(可证明的)鲁棒分类器
01:17:18
[FAI] UCB 席浩诚 | 利用稀疏性加速视频扩散Transformer推理
50:35
[FAI] UCB 蔡榆杭 | 神经网络中梯度下降算法的隐式偏差
57:15
[FAI] Princeton 王子轩 | 从易到难:Transformer如何学会多步组合推理
01:08:35
[FAI] 北大 李柄辉 | 深入理解深度学习中的对抗样本现象:从模型表达能力与训练动力学视角
01:26:58
[FAI] Princeton 王嘉宸 | 如何为模型训练团队推荐数据集?重新思考代理模型
01:26:05
[FAI] 港中深 张雨舜 | 浅谈神经网络Hessian矩阵的特殊结构
01:20:23
[FAI] 港中深 Dmitry Rybin | XX^T Can Be Faster
01:03:13
[FAI] MIT 王一飞 | LLM的长文本困境:NTP任务与Transformer架构的内在偏差
01:13:13
[FAI] 上海AI Lab 付杰 | 在基于RL的LLM形式化软件验证中降低人类先验知识
01:14:15
[FAI] CMU 杨新宇 | 并行编码与解码:高效可扩展的生成式模型架构设计
01:19:22
[FAI] 浙大 陈谋祥 | 语言模型的并行拓展定律
49:30
[FAI] Yale 陈思宇 | 解析大语言模型中的多义性
01:11:12
[FAI-STAT] UPenn 苏炜杰 | ICML 2023排序实验:使用保序机制以提升AI会议的审稿质量
01:20:27
[FAI] LSE 史成春 | 大模型的双重鲁棒对齐
01:11:18
[FAI] 港中深 李子牛 | Knapsack RL:通过优化预算分配解锁大语言模型的探索能力
52:15
[FAI] UCB 江昊哲 | 模型是否能被引导产生任意行为?——关于神经网络满射性质的分析
56:47
[FAI] MIT 戴言 | 如何给各怀鬼胎的用户分配资源,还能满足预算限制?
01:06:53
[FAI] 港科广 何海韵 | 分布信息嵌入:面向大语言模型水印的理论框架
01:09:15
[FAI] CMU 徐翊轩 | 不是所有的答案都有用:在大语言模型强化学习中对答案进行下采样
39:13
UCSC 朱芮捷 | 利用Loop语言模型扩展Latent Reasoning
01:05:32
[FAI] 清华大学 邱子涵 | 大语言模型,预训练,机制可解释性
01:07:53
[FAI] 清华大学 温浩东 | Adam优化器隐式偏差:极小值流形附近的理论分析
01:20:41
[FAI] 清华大学 罗开荣 | 开元-2B:构建高性能的全流程开源模型——数据遴选与课程学习的实践
01:20:49
[FAI] Princeton 尚书宁 | 理解深度学习中的良性过拟合现象:从隐式偏差与训练动力学视角
50:31
[FAI] Columbia Peter Chen | 重新思考LLM强化学习中的探索与利用
01:06:52
[FAI] 中国人民大学 刘勇 | 统一缩放定律
51:43
[FAI] Northwestern University 陆一平 | 模型越宽,优化真的会越难吗?
59:10
[FAI] UCL 陈宗昊 | 含观测变量的非参工具变量回归
55:46
[FAI] 同济大学 汪子乔 | f-散度在现代学习理论中的统一视角:从领域自适应到弱到强泛化
01:08:42
[FAI] UPenn 马鉴昊 | Muon 中谱正交化的预条件优势
01:06:54
[FAI] 北京大学 李柄辉 | 理解大模型预训练动力学:从泛函尺度律视角
01:24:24
[FAI] 清华大学 陆伊炀 | 单步生成模型的近期进展
01:25:43
[FAI] Princeton 朱星宇 | 一种具有中间层时序循环的Transformer架构
01:09:02
[FAI] 港大 雷云文 | 过参数化浅层神经网络的非空泛化界限
51:09
[FAI] 上交大 刘方辉 | AI4SLT:人工智能赋能统计学习理论
58:08
[FAI] 麻省理工 刘逸舟 | 规模定律的普适性:涌现幂律拥有稳健的幂指数
01:10:25
客服
顶部
赛事库 课堂 2021拜年纪