用户5190用户5190
用户8898用户8898
用户1672用户1672组件 | ResNet | ViT | LLaMA |
归一化 | Batch Normalization:在每个卷积层后进行BN,减小内部协变量偏移,输出均值接近0,方差接近1。 | Layer Normalization:在每个自注意力层和前馈层后进行LN,保持输出均值和方差稳定,适合处理序列数据。 | RMSNorm:使用均方根归一化,确保每层输出均值和方差在合理范围内,增强模型稳定性。 |
权重初始化 | He初始化:适用于ReLU激活函数,保持激活值的均值和方差在合理范围,促进收敛。 | 均匀分布或正态分布初始化:确保每层输出均值和方差适中,保持稳定学习过程。 | 均匀分布或正态分布初始化:同样确保输出均值和方差适中,稳定训练。 |
激活函数 | ReLU及其变种:简单高效,能减轻梯度消失问题,但输出均值偏向正值,方差较大。 | GELU(Gaussian Error Linear Unit):平滑非线性激活,输出均值和方差稳定,适合复杂模型。 | SwiGLU(Swish-Gated Linear Unit):结合Swish和门控机制,增强非线性表达能力,保持输出均值和方差稳定。 |
模型 | 激活函数 | 对收敛性的影响 | 优点 | 缺点 |
ResNet | ReLU | 稳定训练并支持更深的网络结构,减少梯度消失问题。 | 减少梯度消失;支持残差连接,允许更深的网络。 | 可能会出现“死神经元”现象,即某些神经元不再激活。 |
Vision Transformer | GELU | 提高收敛速度,提供更平滑的线性与非线性区域过渡,改善训练过程中的梯度流动。 | 减少梯度消失,保持平滑性,适合处理复杂模式。 | 对超参数的调优依赖性较强,可能需要更多的实验。 |
Llama3 | SwiGLU | 通过非单调特性改善优化过程,使得收敛更加高效,适应复杂的任务。 | 结合了激活函数和线性单元的优点,适合大规模模型。 | 由于其复杂性,可能导致解释性较差,难以理解其内部机制。 |