讲座标题(中文):模型越宽,优化真的会越难吗?从矩阵算子范数看神经网络优化器
讲座标题(英文): Does Optimization Really Get Harder as Models Get Wider? Understanding Neural Network Optimizers through Matrix Operator Norms
讲座摘要:为什么同一种优化器,在小模型上效果很好,但当模型变宽、参数规模变大之后,训练却可能变得不稳定?我们把 AdamW、Muon 等常见优化器统一放到“矩阵算子范数下的最速下降”这个视角中重新理解。进一步地,我们也关心一个更底层的问题:矩阵算子范数,是否真的能够刻画神经网络内部更本质的几何结构,并因此解释不同优化器在宽度变化下的行为差异?我们希望从更底层的几何结构出发,解释优化器为什么会随着模型宽度变化而表现不同。在分析过程中,我们发现,传统的矩阵范数放到深层网络里并不好用,因为它们难以逐层组合,也就很难给出对网络宽度不敏感的稳定性保证。为了解决这个问题,我们提出了一类均值归一化的算子范数,并基于它构造出更适合宽模型的优化方式,例如重缩放版 AdamW、行归一化和列归一化方法。直观来说,我们是在寻找一种更合理的更新尺度,让每一层在模型不断变宽时依然能够保持训练稳定。进一步地,我们给出了一套更系统的学习率缩放规律 (在),用来说明超参数应该如何随着模型宽度一起变化,这也让小模型到大模型之间的超参数迁移更有依据。我们的理论结果表明,Muon 的平滑性常数在最坏情况下会随着宽度增长到 O(√Width),而我们提出的行归一化方法则可以做到对宽度不敏感。基于这些分析,我们进一步提出了优化器 MOGA。在 GPT-2 和 LLaMA 的大规模预训练实验中,我们观察到 MOGA,尤其是行归一化版本,能够取得与 Muon 相当的效果,并且在大 token、低 loss 阶段表现出更高的训练效率。
讲者信息:陆一平,现任美国西北大学工业工程与管理科学系兼任工程科学与应用数学系助理教授,他于 2023 年在斯坦福大学获得应用数学博士学位,此前于 2019 年毕业于北京大学应用数学专业。加入西北大学之前,他曾在纽约大学 Courant 数学科学研究所担任 Courant Instructor。他的研究横跨机器学习、数值算法与应用概率,长期目标是推动一种融合领域知识、机器学习与随机实验的新型科学研究范式。具体而言,他的工作连接了深度学习理论、科学机器学习、随机模拟、控制理论、核算子与逼近理论、鲁棒机器学习以及基础模型等多个方向,并较早在深度学习与微分方程交叉领域开展系统研究。陆一平曾获得 2024 年 CPAL Rising Star Award、2022 年 University of Chicago Rising Star in Data Science 等荣誉,也曾担任 ICML、NeurIPS、ICLR 和 AISTATS 等顶级机器学习会议的 Area Chair。