7.3
深览指数
科技虎嗅·宇众不同的露萱··AI 生成
为什么反向传播改变了神经网络?
本文追溯了反向传播算法从1970年代诞生到1986年被主流学界认可的历史,指出其核心是微积分中的链式法则。文章解释了在此之前AI领域因信用分配问题陷入的“AI寒冬”,以及反向传播如何将训练多层网络从组合优化难题转变为可稳定推进的连续优化问题。作者还分析了该算法的设计哲学(局部计算、复用中间结果、计算图作为一等公民)、当前面临的局限(如梯度消失、生物合理性质疑)以及硬件GPU对其发展的推动作用,最终认为其凭借通用性和工程成熟度,至今仍是深度学习的地基算法。原文 ↗
核心观点
- ▍反向传播改变了神经网络,因为它将训练多层网络从几乎无解的组合优化问题,变成了一个可以用梯度下降稳定推进的连续优化问题,且其通用性(只要函数可微即可)和恒定的计算成本支撑了后续所有深度学习模型的加深与复杂化。
- 01反向传播的数学核心是微积分中的链式法则,并非全新数学发现。1970年芬兰学者Seppo Linnainmaa的硕士论文已给出自动微分中反向模式的完整推导,但当时未与神经网络训练联系起来。
- 021986年David Rumelhart、Geoffrey Hinton和Ronald Williams在《Nature》发表的论文通过清晰实验证明反向传播能训练出有效多层网络,隐藏层能自动学出有意义的特征表示,是这一算法被领域广泛接受的关键转折点。
- 03在反向传播成熟前,信用分配问题是核心困境,导致训练多层网络的主要尝试(如随机扰动法、逐层贪心训练)均告失败,直接引发了持续近十五年的第一次“AI寒冬”。
- 04现代深度学习框架(如PyTorch、TensorFlow)的自动微分引擎(autograd)本质上是将反向传播通用化。它们在前向传播时记录计算图,调用loss.backward()时执行一次链式法则遍历。
- 05文章中通过一个两层网络的简化伪代码展示了反向传播的精妙对称性:反向传播每一步都精确复用了前向传播的中间结果(如a1、z1),无需重新计算,这是链式法则的直接推论。
- 06GPU的大规模并行矩阵运算能力完美契合反向传播里密集的矩阵乘法,硬件红利选择了算法路线,进一步巩固了其主导地位。
反方 / 局限
- — 反向传播并非完美无缺,梯度消失/爆炸问题曾长期困扰深层网络,这推动了ReLU激活函数、残差连接(ResNet)以及各种归一化技术的诞生,但这些是改进而非替代。
- — 反向传播的生物合理性受到质疑,因真实大脑不太可能精确地把误差信号原路传回突触。这催生了如反馈对齐、前向-前向算法等替代方案,但至今未在通用性上撼动其地位。
反向传播链式法则信用分配问题AI寒冬感知机Frank RosenblattMarvin MinskySeymour PapertSeppo LinnainmaaPaul WerbosDavid RumelhartGeoffrey HintonRonald WilliamsYann LeCunYoshua BengioNaturePyTorchTensorFlowJAXResNetReLU前向-前向算法AlphaGoAlphaFold
10 分钟 · 4 卡片 · 11 资料
读原文 →