大模型
模型训练
AI Agent
AIGC
多模态
AI安全
模型训练
无归一化 Transformer:去掉 LayerNorm 能不能训?有什么替代方案?
2天前
模型训练
GELU 的两种近似:tanh 近似和 erf 精确计算,在训练速度和精度上的差异
3天前
模型训练
Mish 激活函数:平滑非单调的设计,为什么没在 LLM 训练中流行起来?
3天前
模型训练
DropPath 和 DropConnect:Dropout 的两种变体,在 Vision Transformer 中效果显著
3天前
模型训练
为什么 LLaMA 用 RMSNorm + SwiGLU 而不 LayerNorm + GeLU?架构选择的训练考量
4天前
模型训练
GeGLU vs SwiGLU vs ReGLU:GLU 家族激活函数的横向对比与选型指南
4天前
模型训练
GeLU 和 ReLU 的训练差异:为什么大模型都从 ReLU 换成了 GeLU 家族?
4天前
模型训练
SwiGLU:LLaMA 选择的激活函数,为什么比 GELU 效果好?门控机制的直觉理解
4天前
模型训练
Prodigy 的 d 参数自适应机制:让学习率自己找到合适的大小
4天前
模型训练
大模型训练中 optimizer 的内存布局:fp32 参数 + fp32 状态 = 三倍模型大小的显存
4天前
模型训练
3 / 6
上一页
1
2
3
4
5
6
下一页