神经元与感知机
神经网络最小的零件:一次加权求和,加一个偏置,再拧一下非线性
定义
神经元是神经网络的基本计算单元:它接收若干输入,给每个输入配一个权重,求和后加上一个偏置,再通过激活函数得到输出。单层感知机是最早的神经元模型,它对输入做一次加权求和,再按阈值得出 0 或 1,因此在几何上只能画出一条直线(或超平面)把数据分成两类。
直观理解
把它想成一次打分。要判断“这封邮件是不是垃圾邮件”,就给每条线索一个权重:出现“中奖”加 0.8 分,有“同事签名”扣 0.5 分……加权求和再加一个底线偏置,超过阈值才判为垃圾邮件。感知机的局限同样直观:它只能画一条直线,因此像 XOR 这种“两类点交错排布”的问题,无论把线放在哪里都分不开。要把这类关系表达出来,就必须在中间插入一层新的神经元。
一个神经元的解剖:三条输入各带一个权重,加权求和后加上偏置,再经激活函数得到输出
单层感知机学不会 XOR:损失始终卡在 0.69(随机猜测的水平),而含隐藏层的多层网络能一路降到接近 0(点击图例开关曲线)
- 单层感知机(无法收敛)
- 含隐藏层的多层网络
工作原理
- 01
加权求和:给每条线索分配权重
每个输入 xᵢ 乘以对应的权重 wᵢ,再全部相加。权重决定“这条线索有多重要”,可正可负,是模型训练中要学的核心参数。
- 02
加上偏置:把阈值挪一个位置
再叠加一个偏置 b,相当于为决策阈值加了一个可学习的偏移。没有它,神经元在输入全为零时只能输出一个固定值,灵活性大打折扣。
- 03
通过激活函数:引入非线性
加权和 z = Σ wᵢxᵢ + b 被送进激活函数。早期感知机用阶跃函数(输出 0 或 1),今天多用 ReLU 等平滑函数。正是这一步让神经元具备“开/关”或“弯曲”的能力。
- 04
单层的边界:从感知机到多层网络
一个感知机只能回答“点落在线哪一侧”。要表达 XOR 这类非线性关系,必须把多个神经元堆成隐藏层,把原始输入先映射到一个新的空间——在那个空间里,原本不可分的数据变得可分。这正是多层网络存在的理由。
为什么需要隐藏层:单层感知机只有一条直线,无法分开 XOR;隐藏层把输入映射到新空间后,同一问题变得线性可分
应用场景
- 线性分类与逻辑回归的几何基础,也是理解决策边界的起点
- 作为深层网络的构成单元:一层全连接层就是许多这样的神经元并排
- 可解释的打分卡:信用评分、简单推荐里的特征加权求和
- 理论分析的最小模型:用它讨论线性可分、容量与收敛
常见误区
- 单层感知机学不会 XOR,不是“训练得不够久”,而是它的表达能力上限——无论迭代多少步、把线放在哪里都不可能分开。
- 很多人以为“层数多就非线性”,其实在加入激活函数之前,多层线性变换叠加起来仍等价于一次线性变换(详见激活函数词条)。
- 参数量大不等于能拟合任意函数。要得到通用近似能力,既需要足够的宽度,也需要非线性与足够的深度。
关键术语
- 权重
- 某个输入对输出的影响强度,可正可负
- 偏置
- 可学习的阈值偏移量
- 激活函数
- 对加权和做非线性变换的函数
- 线性可分
- 存在一个超平面能把两类完全分开