大模型
模型训练
AI Agent
AIGC
多模态
AI安全
模型训练
Token 效率:同样的文本,不同 Tokenizer 编码后 token 数差多少?对训练成本的影响
12分钟前
模型训练
SentencePiece:语言无关的分词器训练工具,Google 系列模型的标配
37分钟前
模型训练
Byte-Level BPE:为什么 GPT 系列要用字节级而不是字符级?处理未知字符的优雅方案
59分钟前
模型训练
中文模型的 Tokenizer 怎么训?用字、用词、还是用子词?三种路线的优劣对比
1小时前
模型训练
词表大小对训练的影响:32K、50K、100K 词表,哪个训练效率最高?
1小时前
模型训练
标签平滑的 temperature 参数怎么调?太平滑模型学不到东西、太尖锐又容易过拟合
9小时前
模型训练
Dropout 的推理时关闭:train() 和 eval() 模式切换时最容易犯的 bug
10小时前
模型训练
权重衰减与学习率的交互效应:为什么改了学习率,weight_decay 也要跟着调?
10小时前
模型训练
GroupNorm 和 InstanceNorm:在什么场景下比 LayerNorm 更适合?
11小时前
模型训练
BPE 分词器的训练过程:从字符级到子词级,算法是怎么一步步合并 token 的?
1天前
模型训练
1 / 6
1
2
3
4
5
6
下一页