大模型
模型训练
AI Agent
AIGC
多模态
AI安全
AI安全
RLHF 中的安全维度训练:在奖励模型中专门加安全维度的打分
3分钟前
AI安全
安全微调(Safety Fine-tuning)的策略:什么数据、什么比例、什么时候做
26分钟前
AI安全
思维链安全推理:让模型先内部推理再决定是否回答,比直接拒答更有效吗
47分钟前
AI安全
输出内容的安全重定向:不只是拒绝回答,还能引导到安全话题
1小时前
AI安全
Aegis Guard:NVIDIA 的多层安全防护方案——输入和输出的双重保护
1小时前
AI安全
电路完成度评估:怎么判断我们发现了一个行为的完整电路还是只是一部分
9小时前
AI安全
注意力归因矩阵:追踪信息在 Transformer 层间的流动路径
10小时前
AI安全
Transformer 的 Grokking 现象:训练很久之后突然学会——对安全有什么启示
10小时前
AI安全
可解释性在幻觉检测中的应用:通过分析内部状态判断模型什么时候在编造
10小时前
AI安全
白盒安全评估:利用模型内部信息来检测对齐是否真正生效
11小时前
AI安全
1 / 7
1
2
3
4
5
6
下一页