$$ f(x) = max(0,x) $$

ReLU解决了梯度消失的问题,当输入值为正时,神经元不会饱和
由于ReLU线性、非饱和的性质,在SGD中能够快速收敛
计算复杂度低,不需要进行指数运算
与Sigmoid函数一样,其输出不是以0为中心的
Dead ReLU 问题。当输入为负时,梯度为0。这个神经元及之后的神经元梯度永远为0,不再对任何数据有所响应,导致相应参数永远不会被更新
训练神经网络的时候,一旦学习率没有设置好,第一次更新权重的时候,输入是负值,那么这个含有ReLU的神经节点就会死亡,再也不会被激活。所以,要设置一个合适的较小的学习率,来降低这种情况的发生