[FAI] 同济大学 汪子乔 | f-散度在现代学习理论中的统一视角:从领域自适应到弱到强泛化

1486
1
2026-04-14 19:30:00
38
15
38
5
讲座标题(中文):f-散度在现代学习理论中的统一视角:从领域自适应到弱到强泛化 讲座标题(英文): A Tour of f-Divergence in Modern Learning Theory: From Domain Adaptation to Weak-to-Strong Generalization 讲座摘要:The family of f-divergences provides a versatile language for measuring distribution shift and statistical dependence, with applications spanning domain adaptation, generalization theory, and modern large language model training. In this talk, I will introduce the basic variational perspective of f-divergence and show how it serves as a common tool across three seemingly different problems. First, I will discuss an improved f-divergence framework for unsupervised domain adaptation, where refined discrepancy measures lead to sharper target-risk and generalization guarantees. Second, I will present conditional f-information bounds, which extend conditional mutual information methods and obtain new information-theoretic generalization bounds in the supersample setting. Finally, I will turn to weak-to-strong generalization in LLMs, where f-divergence-based losses provide a principled way to analyze and improve learning from weak supervision, while also revealing fundamental limitations and equivalences among different losses.  讲者信息:汪子乔现为同济大学计算机科学与技术学院助理教授、博士生导师,深研究方向为机器学习基础理论、大模型学习理论与算法以及信息论。近几年主要成果发表在人工智能、机器学习及数据挖掘等相关领域国际顶级会议,涵盖NeurIPS、ICML、ICLR、UAI、AAAI、KDD、WWW等,博士论文被提名2025年加拿大人工智能协会最佳博士论文奖,以及提名2025年渥太华大学总督学术奖章和Pierre Laberge论文奖。目前担任ICLR, NeurIPS等人工智能会议的领域主席,曾担任2024年IEEE 北美信息论暑期学校(NASIT)联合程序主席。个人主页:https://ziqiaowanggeothe.github.io/
争做国内最好的人工智能研讨班!seminar官网:fai-seminar.ac.cn
FAI-Seminar
(69/77)
31.4万播放
简介
[FAI] 北大 张博航 | 基于子图的图神经网络表达能力探究
01:28:33
[FAI] 北大 罗胜杰 | 人工智能与通用分子表征
01:22:02
[FAI] MIT 刘子鸣 | 智能从饥饿中诞生
01:20:51
[FAI] UMich马鉴昊 | 均值估计还能这么玩?稀疏鲁棒均值估计
01:01:36
[FAI] 北大 金及凯 | 无穷维与有限维区别多大?算子学习的最优算法
01:24:53
[FAI] 中科大 王博涵 | 动量可以加速SGD吗?
01:17:45
[FAI] 清华 滕佳烨 | 现代机器学习视角下的不确定性度量 | ICLR 23
01:05:55
[FAI] 普林斯顿 蔡天乐 | 让大语言模型自己创造工具
55:33
[FAI*] TTIC 李志远 | 平坦正则化对泛化的帮助 (special talk)
01:05:56
[FAI] 清华 陈乐偲 | 双层优化问题最优一阶算法
55:39
[FAI] NeurIPS23' oral 北大 张博航 | 思维链如何解锁大模型的隐藏能力
01:08:13
[FAI] 清华 顾欣然 | 分布式学习中如何设置通信频率?平方同步律!
01:13:37
[FAI] DeepMind 石佳欣 | 长序列建模?基于小波理论的神经网络框架
01:13:06
[FAI] JMLR 港中文 范凤磊 | 揭秘ReLU神经网络
01:03:17
[FAI] CMU 刘冰彬 | 顺序推理问题的"捷径"解法 ICLR 23' oral, NeurIPS 23' spotlight
01:12:10
[FAI] 清华 温凯越 | Transformer不能被单元方法解释 NeurIPS 23'
01:02:07
[FAI] 清华 游凯超 | 理解、学习与使用PyTorch编译器(torch.compile)
48:23
[FAI] UMich 胡威 | 神经网络表示中的隐藏结构
01:05:02
[FAI] CMU 翟润天 | 表征学习和大模型的泛
01:25:49
[FAI] 北大 罗胜杰 | 高效等变网络设计 ICLR 24'
01:19:58
[FAI] Princeton 高天宇 | 上下文并行编码实现语言模型的长文本拓展
01:07:10
[FAI] 香港大学 邹荻凡 | 基于扩散蒙特卡洛方法的快速采样算法
58:37
[FAI] NYU 陆一平 | 基于模拟算法校准的AI4science:算法与理论
01:13:08
[FAI] Princeton 俞鼎力 | 张量程序VI:无限深度神经网络中的特征学习
01:09:36
[FAI] Princeton 吕凯风 | 浅谈神经网络在算法推理上的局限性
01:30:19
[FAI] CMU 李禹辰 | 现代语言模型的理论理解
01:19:21
[FAI*] 清华大学 李建 | 深度学习中梯度方法的泛化与隐式偏差 (special talk)
01:13:17
[FAI] 北大 张博航 | 图神经网络表达能力的评估准则
01:12:27
[FAI] CMU 黎善达 | 更快的大模型推理 & AIMO竞赛第二名方法分享
01:16:47
Transformer上下文学习的训练过程分析
01:19:20
[FAI] Berkeley 吴京风 | 梯度下降新视角:大步长、振荡与加速
01:12:07
[FAI] 港城大 马梓业 | 通过增强鞍点的可逃脱性以克服非凸景观下的挑战
01:39:29
[FAI] 人大 刘勇 | 检索增强能提升大模型的推理能力吗?
53:36
[FAI] 清华大学 陈乐偲 | 基于“懒”Hessian技术的快速牛顿算法 ICLR 25' Oral
01:05:18
[FAI] 清华 吕凯风 | 大模型训练中的扩展定律与相变现象
01:37:45
[FAI] Stanford 温凯越 | 山谷河流:从损失景观理解WSD学习率机制
01:15:22
[FAI] Princeton 黄凯旋 | MATH-Perturb: 评估llm面对复杂改动的数学推理能力
59:33
[FAI] 清华 卢睿 | 理解扩散模型生成文字的幻觉问题 | ICLR 2025
01:03:37
[FAI] MIT 杨松琳 | 可扩展线性RNN的进展:DeltaNet及其变体
01:55:24
[FAI] 清华 陈焕然 | 扩散模型即为(可证明的)鲁棒分类器
01:17:18
[FAI] UCB 席浩诚 | 利用稀疏性加速视频扩散Transformer推理
50:35
[FAI] UCB 蔡榆杭 | 神经网络中梯度下降算法的隐式偏差
57:15
[FAI] Princeton 王子轩 | 从易到难:Transformer如何学会多步组合推理
01:08:35
[FAI] 北大 李柄辉 | 深入理解深度学习中的对抗样本现象:从模型表达能力与训练动力学视角
01:26:58
[FAI] Princeton 王嘉宸 | 如何为模型训练团队推荐数据集?重新思考代理模型
01:26:05
[FAI] 港中深 张雨舜 | 浅谈神经网络Hessian矩阵的特殊结构
01:20:23
[FAI] 港中深 Dmitry Rybin | XX^T Can Be Faster
01:03:13
[FAI] MIT 王一飞 | LLM的长文本困境:NTP任务与Transformer架构的内在偏差
01:13:13
[FAI] 上海AI Lab 付杰 | 在基于RL的LLM形式化软件验证中降低人类先验知识
01:14:15
[FAI] CMU 杨新宇 | 并行编码与解码:高效可扩展的生成式模型架构设计
01:19:22
[FAI] 浙大 陈谋祥 | 语言模型的并行拓展定律
49:30
[FAI] Yale 陈思宇 | 解析大语言模型中的多义性
01:11:12
[FAI-STAT] UPenn 苏炜杰 | ICML 2023排序实验:使用保序机制以提升AI会议的审稿质量
01:20:27
[FAI] LSE 史成春 | 大模型的双重鲁棒对齐
01:11:18
[FAI] 港中深 李子牛 | Knapsack RL:通过优化预算分配解锁大语言模型的探索能力
52:15
[FAI] UCB 江昊哲 | 模型是否能被引导产生任意行为?——关于神经网络满射性质的分析
56:47
[FAI] MIT 戴言 | 如何给各怀鬼胎的用户分配资源,还能满足预算限制?
01:06:53
[FAI] 港科广 何海韵 | 分布信息嵌入:面向大语言模型水印的理论框架
01:09:15
[FAI] CMU 徐翊轩 | 不是所有的答案都有用:在大语言模型强化学习中对答案进行下采样
39:13
UCSC 朱芮捷 | 利用Loop语言模型扩展Latent Reasoning
01:05:32
[FAI] 清华大学 邱子涵 | 大语言模型,预训练,机制可解释性
01:07:53
[FAI] 清华大学 温浩东 | Adam优化器隐式偏差:极小值流形附近的理论分析
01:20:41
[FAI] 清华大学 罗开荣 | 开元-2B:构建高性能的全流程开源模型——数据遴选与课程学习的实践
01:20:49
[FAI] Princeton 尚书宁 | 理解深度学习中的良性过拟合现象:从隐式偏差与训练动力学视角
50:31
[FAI] Columbia Peter Chen | 重新思考LLM强化学习中的探索与利用
01:06:52
[FAI] 中国人民大学 刘勇 | 统一缩放定律
51:43
[FAI] Northwestern University 陆一平 | 模型越宽,优化真的会越难吗?
59:10
[FAI] UCL 陈宗昊 | 含观测变量的非参工具变量回归
55:46
[FAI] 同济大学 汪子乔 | f-散度在现代学习理论中的统一视角:从领域自适应到弱到强泛化
01:08:42
[FAI] UPenn 马鉴昊 | Muon 中谱正交化的预条件优势
01:06:54
[FAI] 北京大学 李柄辉 | 理解大模型预训练动力学:从泛函尺度律视角
01:24:24
[FAI] 清华大学 陆伊炀 | 单步生成模型的近期进展
01:25:43
[FAI] Princeton 朱星宇 | 一种具有中间层时序循环的Transformer架构
01:09:02
[FAI] 港大 雷云文 | 过参数化浅层神经网络的非空泛化界限
51:09
[FAI] 上交大 刘方辉 | AI4SLT:人工智能赋能统计学习理论
58:08
[FAI] 麻省理工 刘逸舟 | 规模定律的普适性:涌现幂律拥有稳健的幂指数
01:10:25
[FAI] 北大 张辉帅 | 从 Muon 到 OLion:谱几何与隐式偏置的交汇
54:35
客服
顶部
赛事库 课堂 2021拜年纪