大模型
模型训练
AI Agent
AIGC
多模态
AI安全
大模型
YaRN:Yet another RoPE extensioN——把上下文窗口扩展十倍的工程方案
1小时前
大模型
位置编码的外推问题:为什么模型训了 4K 长度,直接用 8K 就会崩溃
1小时前
大模型
NTK-Aware 插值:不改模型参数就能扩展上下文窗口,背后的数学原理是什么
2小时前
大模型
线性注意力(Linear Attention):把 O(n²) 的复杂度降到 O(n),代价是什么?
10小时前
大模型
Flash Attention 到底做了什么?用 GPU 的 SRAM 把注意力计算的显存占用砍掉一半
11小时前
大模型
ALiBi(Attention with Linear Biases):不用显式位置编码,直接在注意力分数上加距离惩罚
1天前
大模型
RoPE(旋转位置编码):把位置信息编码进复数旋转,为什么成了主流选择
1天前
大模型
格拉默矩阵和线性注意力:不稳定性是怎么被发现并逐步解决的
1天前
大模型
大模型的安全对齐(Alignment)到底是怎么做的?RLHF 和 DPO 的博弈
1天前
大模型
为什么 Flash Attention 算出来的结果和标准注意力有微小差异?有损但值得
2天前
大模型
1 / 4
1
2
3
4
下一页