大模型
模型训练
AI Agent
AIGC
多模态
AI安全
模型训练
为什么大模型几乎都用偶数层的 Transformer block?有什么训练上的考量?
1天前
模型训练
隐藏层宽度对训练的影响:宽模型 vs 深模型,哪个更容易训、哪个效果更好?
1天前
模型训练
从 SiLU 到 Swish 到 SwiGLU:一个激活函数的家族谱系
1天前
模型训练
注意力 Dropout vs 隐藏层 Dropout vs 残差 Dropout:不同位置效果大不同
1天前
模型训练
激活函数的可导性:为什么训练中选平滑激活函数比选硬切换的函数更关键
2天前
模型训练
Dense vs Sparse 激活:MoE 中每个 token 只激活部分专家,训练动态完全不同
2天前
模型训练
ReLU² 激活函数:Princeton 证明在某些场景下比 SwiGLU 更适合大模型
2天前
模型训练
Pre-Norm Transformer 为什么比 Post-Norm 更好训练?残差流的视角解释
2天前
模型训练
门控线性单元 GLU:为什么带门控的激活函数在 LLM 训练中全面胜出?
2天前
模型训练
Early Stopping 在大模型训练中还有用吗?数据量和参数量都很大时的策略
2天前
模型训练
2 / 6
上一页
1
2
3
4
5
6
下一页