大模型
模型训练
AI Agent
AIGC
多模态
AI安全
模型训练
NAdam 和 RAdam:Adam 的两个改进版,修正了原始 Adam 的什么缺陷?
4天前
模型训练
优化器的确定性:同样的数据和种子,Adam 每次跑出来的结果一样吗?
4天前
模型训练
Muon 优化器:2024 年兴起的新 optimizer,用矩阵正交化替代自适应学习率
2026年8月28日
模型训练
优化器状态到底占多少显存?Adam 训一个 7B 模型,光状态就要 60GB+
2026年8月28日
模型训练
8-bit Adam:把优化器状态也量化了,显存再砍一半
2026年8月28日
模型训练
ZeRO-Offload:把优化器状态卸载到 CPU 内存,用时间换空间的极致操作
2026年8月28日
模型训练
分布式训练中的优化器状态同步:每张卡上的 Adam 状态一致吗?不一致会怎样?
2026年8月26日
模型训练
优化器的 epsilon 不只是防除零:数值稳定性在大模型训练中被严重低估的角色
2026年8月26日
模型训练
AdamW 的 weight decay 跟 L2 正则化不是一回事——90%的人搞混的细节影响训练效果
2026年8月25日
模型训练
Adafactor:T5 背后的省显存优化器,不存二阶矩状态也能训好模型
2026年8月25日
模型训练
4 / 6
上一页
1
2
3
4
5
6
下一页