人工智能面试题更新 2026-08-05

在深度神经网络中,ReLU 激活函数相对于 Sigmoid 和 tanh 函数有哪些优势?请从梯度传播、计算效率和稀疏激活等角度分析其原因。

人工智能技术原理

考察说明

考察对常见激活函数特性的理解及对比分析能力。

回答思路

  1. 【回答框架 1】ReLU 定义为 max(0, x),相比 Sigmoid 和 tanh,其导数在正区间恒为 1,负区间为 0,因此有效缓解了梯度消失问题,尤其在深层网络中,梯度能更顺畅地反向传播。
  2. 【回答框架 2】Sigmoid 和 tanh 在输入绝对值较大时导数趋近于 0,容易导致梯度消失;而 ReLU 的正区间导数恒定,训练更加稳定高效,且计算简单,只需比较和取零操作,显著降低计算成本。
  3. 【回答框架 3】ReLU 将负输入映射为 0,产生稀疏激活,有利于特征提取和模型泛化,但可能导致部分神经元永久失活(Dead ReLU),因为梯度为零无法更新。为此,出现了 Leaky ReLU 等变体来解决这一问题。
  4. 【回答框架 4】Sigmoid 输出非零中心,导致后层神经元输入全为正,可能引起梯度更新呈锯齿状;tanh 输出零中心,优于 Sigmoid,但仍有饱和区。ReLU 虽输出非负,但多数场景下性能更好。
  5. 【关键点 1】ReLU 缓解梯度消失,计算高效,支持稀疏激活。
  6. 【关键点 2】Sigmoid 和 tanh 存在梯度饱和问题,深层网络训练困难。
  7. 【关键点 3】ReLU 可能产生神经元死亡,需 Leaky ReLU 等变体规避。
  8. 【易错点 1】忽略 ReLU 的输出非零中心问题对梯度更新的影响。
  9. 【易错点 2】误以为 ReLU 不会产生梯度消失,其实负区间梯度为零,导致部分神经元失活。