NeurIPS 2025 最佳论文亚军 | 为什么大模型越训练越强?神经缩放定律的数学本质

1.3万
2
2025-12-25 10:20:00
388
109
863
124
📝 视频简介 本期视频为大家带来NeurIPS 2025最佳论文Runner-Up作品《Superposition Yields Robust Neural Scaling》的直播录播内容。论文提出大语言模型中表征的“叠加现象”是驱动神经规模定律(neural scaling laws)的核心机制,揭示了模型维度、数据分布与训练损失之间的内在数学关系。 🔍 本期视频你将看到: 什么是神经缩放定律?为什么它对于大模型训练如此重要? 表征叠加(superposition)如何影响模型的表现? 弱叠加与强叠加状态下,损失与模型维度之间的不同缩放规律 Anthropic玩具实验与真实LLM实验的对应验证 如何利用这一理论优化大模型训练与预测缩放极限? 🚀 一句话总结: 表征叠加是驱动大模型遵循神经缩放定律的“隐形引擎”,让你理解为什么模型越大、数据越多,效果越强。 👥 论文讲者: 刘逸舟(MIT博士生,研究方向为大语言模型宏观涌现行为与神经缩放定律) 如果你对大语言模型、神经网络理论、缩放定律、AI训练优化、MIT研究动态等话题感兴趣,请点赞、投币、收藏三连支持!也欢迎在评论区留下你的看法~
发扬科学思辨精神,链接全球AI 爱好者
NeurIPS 2025
(34/36)
8.9万播放
简介
NeurIPS 2025 Spotlight | InterMT:算法如何学会与人类“对齐”?多轮交错偏好对齐技术拆解
23:58
NeurIPS 2025 Spotlight | 为什么AI画画先学轮廓后学细节?哈佛学者用数学给出了答案
11:44
NeurIPS 2025 | 这个模型让电解质预测起飞!GeoMix:几何混合模型详解
15:58
NeurIPS 2025 Spotlight | 破除安全性能取舍!SafeVLA实现性能安全双赢
32:08
NeurIPS 2025 Spotlight | 告别卡顿!720P AI视频生成加速5倍,FPSAttention技术详解
11:06
NeurIPS 2025 Spotlight | 他们造了个会“偷懒”的AI!自动跳过简单题,准确率还更高?
15:21
NeurIPS 2025 Spotlight | 线性Attention新突破!CBSA机制:收缩广播少数token,实现高效可解释
16:37
NeurIPS 2025 Spotlight | 训练大模型,只需要一个向量就够了?!
14:15
NeurIPS 2025 Spotlight | 不用重新训练?测试时实时校准,让时空预测模型更强更稳!
19:48
NeurIPS 2025 Spotlight | 图浓缩翻车了?对抗攻击下如何保住GNN的训练效率!MRGC:鲁棒图浓缩新框架
22:07
NeurIPS 2025 特邀报告 | 自回归+扩散=?上交大博导邓志杰老师带你将AR模型痛点全解决!
24:56
NeurIPS 2025 特邀报告 | 中科大张岸教授带你揭秘大模型都偷偷学了什么?
45:51
NeurIPS 2025 特邀报告 | 让大数据知识“活”起来!北航孙庆赟老师揭秘AI高效推理新范式
30:03
NeurIPS 2025 特邀报告 | 偏微分方程求解大突破?上交大严骏驰教授带你玩转高维PDE与自动发现!
36:38
NeurIPS 2025 Oral | 20倍加速!物理级真实感,超强图像视频重照明模型 UniLumos
18:35
NeurIPS 2025 Oral | 玩家一号降临!AI把你的自拍变成可交互的“元宇宙”
13:10
NeurIPS 2025 预讲会 | DAMO开发者矩阵专场
02:21:28
NeurIPS 2025 预讲会 | 北京大学对齐小组专场
01:11:32
NeurIPS 2025 预讲会 | 上海交通大学邓志杰老师团队专场
38:16
NeurIPS 2025 预讲会 | 北航ACT BD/MAGIC课题组
01:56:45
NeurIPS 2025 预讲会 | Alpha Lab-NExT专场
02:09:56
NeurIPS 2025 预讲会 | LLM 安全、对齐与可信 AI 主题合辑
01:20:18
NeurIPS 2025 预讲会 | 机器学习理论与方法 主题合辑
01:08:06
NeurIPS 2025 预讲会 | AI 智能体与强化学习 主题合辑
48:13
NeurIPS 2025 预讲会 | AI for Science与应用 主题合辑
31:51
NeurIPS 2025 预讲会 | LLM推理、认知与优化 主题合辑
01:46:26
NeurIPS 2025 预讲会 | 多模态大模型与应用 主题合辑
02:31:30
NeurIPS 2025 预讲会 | 高效AI与模型压缩 主题合辑
01:07:33
NeurIPS 2025 预讲会 | RL推理与离策略优化 主题合辑
17:05
NeurIPS 2025 预讲会 | 检索增强生成 (RAG) 与知识管理 主题合辑
01:01:59
NeurIPS 2025 预讲会 | 时空数据 主题合辑
01:35:34
NeurIPS 2025 预讲会 | 生成式推荐专场:大模型如何重塑推荐系统?
02:04:27
NeurIPS 2025 最佳论文亚军 | 打脸OpenAI o1?清华最新研究:强化学习根本没让大模型变聪明?!
37:52
NeurIPS 2025 最佳论文亚军 | 为什么大模型越训练越强?神经缩放定律的数学本质
45:09
NeurIPS 2025 最佳论文 | 阿里邱子涵揭秘:门控注意力如何重塑大模型性能边界?
01:00:08
NeurIPS 2025 最佳论文 | 2.6万次提问揭开AI“蜂群思维”:大模型正在让我们的想法同质化?
30:52
客服
顶部
赛事库 课堂 2021拜年纪