讲座标题(中文): 理解大模型预训练动力学:从泛函尺度律视角
讲座标题(英文): Understanding LLM Pre-Training Dynamics via Functional Scaling Laws
讲座摘要:尺度律(Scaling Law)已成为指导现代人工智能发展的核心准则。它不仅确立了“大规模参数是实现模型通用性的必要条件”这一共识,更揭示了资源投入能稳定提升系统性能的规律。在工程实践中,经验性的尺度律已被广泛用于指导实际大模型的训练。然而,现有的经验尺度律仍面临三大局限:
1.缺乏动态视角:无法刻画训练的完整动力学过程;
2.忽视超参影响:难以定量反映学习率、批大小等关键超参数对训练效率的影响;
3.现象解释力不足:无法解释实际训练中的重要观测(如采用 WSD 学习率调度时,损失曲线呈现出的显著两阶段特性)。
针对上述局限性,本系列研究从第一性原理出发,基于幂律核回归模型,推导出了能够精确刻画模型训练完整损失动力学的泛函尺度律(Functional Scaling Law)。泛函尺度律表明,模型训练可解耦为“信号学习”与“噪声积累/遗忘”两个动力学过程,整体的损失曲线行为由两者间的动态平衡所决定。更进一步,基于泛函尺度律框架,我们从理论层面分析了模型训练中的学习率调度与批大小调度的最优方案,并在真实大模型预训练中验证了理论结果的有效性。
讲者信息:李柄辉,北京大学国际机器学习研究中心 2023 级博士生,本科毕业于北京大学图灵班。研究方向为深度学习理论,特别是大模型预训练机理、优化理论及尺度律。其关于泛函尺度律与学习率调度的相关工作曾获选NeurIPS 2025 Spotlight论文。目前,已在NeurIPS、ICLR、ICML、COLT等学术顶会以第一/共一作者身份发表论文 10 篇,并入选中国科协青年人才托举工程博士生专项计划。