[FAI] 港大 雷云文 | 过参数化浅层神经网络的非空泛化界限

1096
0
2026-06-14 19:30:00
个人观点,仅供参考
31
8
29
5
讲座标题(中文): 过参数化浅层神经网络的非空泛化界限 讲座标题(英文): Non-vacuous Generalization Bounds for Overparameterized Shallow Neural Networks 讲座摘要: Overparameterized neural networks often exhibit a benign overfitting phenomenon, achieving excellent generalization performance despite having more parameters than training samples. Traditional generalization analyses typically yield vacuous bounds due to overparameterization. In this talk, we show non-vacuous generalization bounds by controlling the Rademacher complexity of overparameterized shallow neural networks (SNNs), supported by empirical studies involving highly overparameterized SNNs. Our complexity bounds are fully dependent on the distance from the initialization point and are expressed in terms of the path-norm of the networks. 讲者信息: 雷云文于武汉大学获得博士学位。现任香港大学数学系助理教授。他的研究方向包括机器学习、数据科学、学习理论与随机优化。同时,他担任《机器学习》《机器学习研究汇刊 TMLR》《IEEE 神经网络与学习系统汇刊》副编辑,并兼任国际机器学习大会(ICML)、神经信息处理系统大会(NeurIPS)、国际学习表征会议(ICLR)及国际人工智能与统计会议(AISTATS)的领域主席。
争做国内最好的人工智能研讨班!seminar官网:fai-seminar.ac.cn
FAI-Seminar
(74/76)
31.2万播放
简介
[FAI] 北大 张博航 | 基于子图的图神经网络表达能力探究
01:28:33
[FAI] 北大 罗胜杰 | 人工智能与通用分子表征
01:22:02
[FAI] MIT 刘子鸣 | 智能从饥饿中诞生
01:20:51
[FAI] UMich马鉴昊 | 均值估计还能这么玩?稀疏鲁棒均值估计
01:01:36
[FAI] 北大 金及凯 | 无穷维与有限维区别多大?算子学习的最优算法
01:24:53
[FAI] 中科大 王博涵 | 动量可以加速SGD吗?
01:17:45
[FAI] 清华 滕佳烨 | 现代机器学习视角下的不确定性度量 | ICLR 23
01:05:55
[FAI] 普林斯顿 蔡天乐 | 让大语言模型自己创造工具
55:33
[FAI*] TTIC 李志远 | 平坦正则化对泛化的帮助 (special talk)
01:05:56
[FAI] 清华 陈乐偲 | 双层优化问题最优一阶算法
55:39
[FAI] NeurIPS23' oral 北大 张博航 | 思维链如何解锁大模型的隐藏能力
01:08:13
[FAI] 清华 顾欣然 | 分布式学习中如何设置通信频率?平方同步律!
01:13:37
[FAI] DeepMind 石佳欣 | 长序列建模?基于小波理论的神经网络框架
01:13:06
[FAI] JMLR 港中文 范凤磊 | 揭秘ReLU神经网络
01:03:17
[FAI] CMU 刘冰彬 | 顺序推理问题的"捷径"解法 ICLR 23' oral, NeurIPS 23' spotlight
01:12:10
[FAI] 清华 温凯越 | Transformer不能被单元方法解释 NeurIPS 23'
01:02:07
[FAI] 清华 游凯超 | 理解、学习与使用PyTorch编译器(torch.compile)
48:23
[FAI] UMich 胡威 | 神经网络表示中的隐藏结构
01:05:02
[FAI] CMU 翟润天 | 表征学习和大模型的泛
01:25:49
[FAI] 北大 罗胜杰 | 高效等变网络设计 ICLR 24'
01:19:58
[FAI] Princeton 高天宇 | 上下文并行编码实现语言模型的长文本拓展
01:07:10
[FAI] 香港大学 邹荻凡 | 基于扩散蒙特卡洛方法的快速采样算法
58:37
[FAI] NYU 陆一平 | 基于模拟算法校准的AI4science:算法与理论
01:13:08
[FAI] Princeton 俞鼎力 | 张量程序VI:无限深度神经网络中的特征学习
01:09:36
[FAI] Princeton 吕凯风 | 浅谈神经网络在算法推理上的局限性
01:30:19
[FAI] CMU 李禹辰 | 现代语言模型的理论理解
01:19:21
[FAI*] 清华大学 李建 | 深度学习中梯度方法的泛化与隐式偏差 (special talk)
01:13:17
[FAI] 北大 张博航 | 图神经网络表达能力的评估准则
01:12:27
[FAI] CMU 黎善达 | 更快的大模型推理 & AIMO竞赛第二名方法分享
01:16:47
Transformer上下文学习的训练过程分析
01:19:20
[FAI] Berkeley 吴京风 | 梯度下降新视角:大步长、振荡与加速
01:12:07
[FAI] 港城大 马梓业 | 通过增强鞍点的可逃脱性以克服非凸景观下的挑战
01:39:29
[FAI] 人大 刘勇 | 检索增强能提升大模型的推理能力吗?
53:36
[FAI] 清华大学 陈乐偲 | 基于“懒”Hessian技术的快速牛顿算法 ICLR 25' Oral
01:05:18
[FAI] 清华 吕凯风 | 大模型训练中的扩展定律与相变现象
01:37:45
[FAI] Stanford 温凯越 | 山谷河流:从损失景观理解WSD学习率机制
01:15:22
[FAI] Princeton 黄凯旋 | MATH-Perturb: 评估llm面对复杂改动的数学推理能力
59:33
[FAI] 清华 卢睿 | 理解扩散模型生成文字的幻觉问题 | ICLR 2025
01:03:37
[FAI] MIT 杨松琳 | 可扩展线性RNN的进展:DeltaNet及其变体
01:55:24
[FAI] 清华 陈焕然 | 扩散模型即为(可证明的)鲁棒分类器
01:17:18
[FAI] UCB 席浩诚 | 利用稀疏性加速视频扩散Transformer推理
50:35
[FAI] UCB 蔡榆杭 | 神经网络中梯度下降算法的隐式偏差
57:15
[FAI] Princeton 王子轩 | 从易到难:Transformer如何学会多步组合推理
01:08:35
[FAI] 北大 李柄辉 | 深入理解深度学习中的对抗样本现象:从模型表达能力与训练动力学视角
01:26:58
[FAI] Princeton 王嘉宸 | 如何为模型训练团队推荐数据集?重新思考代理模型
01:26:05
[FAI] 港中深 张雨舜 | 浅谈神经网络Hessian矩阵的特殊结构
01:20:23
[FAI] 港中深 Dmitry Rybin | XX^T Can Be Faster
01:03:13
[FAI] MIT 王一飞 | LLM的长文本困境:NTP任务与Transformer架构的内在偏差
01:13:13
[FAI] 上海AI Lab 付杰 | 在基于RL的LLM形式化软件验证中降低人类先验知识
01:14:15
[FAI] CMU 杨新宇 | 并行编码与解码:高效可扩展的生成式模型架构设计
01:19:22
[FAI] 浙大 陈谋祥 | 语言模型的并行拓展定律
49:30
[FAI] Yale 陈思宇 | 解析大语言模型中的多义性
01:11:12
[FAI-STAT] UPenn 苏炜杰 | ICML 2023排序实验:使用保序机制以提升AI会议的审稿质量
01:20:27
[FAI] LSE 史成春 | 大模型的双重鲁棒对齐
01:11:18
[FAI] 港中深 李子牛 | Knapsack RL:通过优化预算分配解锁大语言模型的探索能力
52:15
[FAI] UCB 江昊哲 | 模型是否能被引导产生任意行为?——关于神经网络满射性质的分析
56:47
[FAI] MIT 戴言 | 如何给各怀鬼胎的用户分配资源,还能满足预算限制?
01:06:53
[FAI] 港科广 何海韵 | 分布信息嵌入:面向大语言模型水印的理论框架
01:09:15
[FAI] CMU 徐翊轩 | 不是所有的答案都有用:在大语言模型强化学习中对答案进行下采样
39:13
UCSC 朱芮捷 | 利用Loop语言模型扩展Latent Reasoning
01:05:32
[FAI] 清华大学 邱子涵 | 大语言模型,预训练,机制可解释性
01:07:53
[FAI] 清华大学 温浩东 | Adam优化器隐式偏差:极小值流形附近的理论分析
01:20:41
[FAI] 清华大学 罗开荣 | 开元-2B:构建高性能的全流程开源模型——数据遴选与课程学习的实践
01:20:49
[FAI] Princeton 尚书宁 | 理解深度学习中的良性过拟合现象:从隐式偏差与训练动力学视角
50:31
[FAI] Columbia Peter Chen | 重新思考LLM强化学习中的探索与利用
01:06:52
[FAI] 中国人民大学 刘勇 | 统一缩放定律
51:43
[FAI] Northwestern University 陆一平 | 模型越宽,优化真的会越难吗?
59:10
[FAI] UCL 陈宗昊 | 含观测变量的非参工具变量回归
55:46
[FAI] 同济大学 汪子乔 | f-散度在现代学习理论中的统一视角:从领域自适应到弱到强泛化
01:08:42
[FAI] UPenn 马鉴昊 | Muon 中谱正交化的预条件优势
01:06:54
[FAI] 北京大学 李柄辉 | 理解大模型预训练动力学:从泛函尺度律视角
01:24:24
[FAI] 清华大学 陆伊炀 | 单步生成模型的近期进展
01:25:43
[FAI] Princeton 朱星宇 | 一种具有中间层时序循环的Transformer架构
01:09:02
[FAI] 港大 雷云文 | 过参数化浅层神经网络的非空泛化界限
51:09
[FAI] 上交大 刘方辉 | AI4SLT:人工智能赋能统计学习理论
58:08
[FAI] 麻省理工 刘逸舟 | 规模定律的普适性:涌现幂律拥有稳健的幂指数
01:10:25
客服
顶部
赛事库 课堂 2021拜年纪