【数学】神经网络:从一个神经元到万能逼近

8.0万
125
2026-04-17 12:04:20
3650
1395
7170
503
1969 年,Minsky 一本书差点把神经网络领域"杀死"十年。他说单层感知机连 XOR 都学不会,确实没错。但他还说了另一句话,那句话他错了,而且错得影响了整个 AI 史。 这期我们把这个故事从头讲到尾: 一个神经元到底在做什么?(y = σ(Wx + b)——拆开每个符号) 为什么单层感知机搞不定 XOR?(线性不可分的几何本质) 加一层就能解——这一层到底做了什么?(坐标系重铸:同一组数据换个空间就线性可分) 万能逼近定理为什么成立?(Cybenko 1989 / Hornik 1991 / Nielsen 纯视觉 4 步建构证明) 既然单层够用,为什么还要做深的?(深 → 指数级表达力 / 宽 → 多项式 · Montufar 2014) 层次特征:第 1 层边缘 → 第 4 层人脸物体(Zeiler-Fergus 真实 feature map) 反直觉反转:实际训练的网络 linear regions 远少于理论上界(Hanin-Rolnick 2019) 看完你会拥有理解现代深度学习的全部几何直觉——从 XOR 的 4 个点到 ChatGPT 的 96 层,用的还是 Minsky 当年看不起的那个神经元。 参考论文 Minsky & Papert 1969 · Perceptrons (1988 Expanded Edition) Rumelhart, Hinton, Williams 1986 · Learning representations by back-propagating errors Cybenko 1989 · Approximation by superpositions of a sigmoidal function(本片 scene 04 + scene 06 引图) Hornik 1991 · Approximation capabilities of multilayer feedforward networks(本片 scene 06 引图) Montúfar et al. 2014 · On the Number of Linear Regions of Deep Neural Networks(本片 scene 07 引图) Zeiler & Fergus 2014 · Visualizing and Understanding Convolutional Networks(本片 scene 07 feature map 引图) Hanin & Rolnick 2019 · Deep ReLU Networks Have Surprisingly Few Activation Patterns(本片 scene 07 反转 beat 引图) Lighthill 1973 · Artificial Intelligence: A General Survey(本片 scene 02 寒冬引证) 教学资源 Michael Nielsen · Neural Networks and Deep Learning Ch 4(万能逼近建构证明) Chris Olah 2014 · Neural Networks, Manifolds, and Topology(colah.github.io 空间扭曲经典博客) 3Blue1Brown · Neural Networks P1-P4(视觉风格参考) 李宏毅 2021 · ML Lecture "Why Hidden Layer"(Bilibili BV1Wv411h7kN) 李沐 · 动手学深度学习(感知机 + MLP 历史叙事) TensorFlow Playground(playground.tensorflow.org,XOR 互动经典) Andrej Karpathy · Spelled-out intro to neural networks / micrograd(YouTube Zero to Hero P1)  Minsky 原文验证 Minsky & Papert 1988 · Perceptrons: An Introduction to Computational Geometry, Expanded Edition, MIT Press p.232 "sterile" 段落(单层感知机局限原文) p.267 1988 epilogue "research conjecture"(BP 出现 2 年后仍坚持否定判断) PDF 来源:rodsmith.nz/wp-content/uploads/Minsky-and-Papert-Perceptrons.pdf
用过拟合的热情,做泛化的内容!(商务联系canqiangxu@yeah.net)
聊点数学
(7/9)
32.1万播放
简介
【数学】一杯奶茶教会你什么是向量 | 算法的数学基础01
09:14
矩阵到底在干什么?从揉面团到降维打击 | 算法的数学基础 02
05:58
概率与贝叶斯:根据证据更新信念 | 算法的数学基础 03
05:19
300年前的数学,让AI学会了说话?| 算法的数学基础 04
06:06
【数学】四个运算,撑起整个ChatGPT | 算法的数学基础 05
18:49
【数学】AI 是怎么学会的?反向传播完整推导
13:37
【数学】神经网络:从一个神经元到万能逼近
16:23
【数学】卷积到底是什么?从骰子到 CNN 一次看懂
14:19
【数学】注意力机制到底在做什么?
10:13
客服
顶部
赛事库 课堂 2021拜年纪