大模型
模型训练
AI Agent
AIGC
多模态
AI安全
AI安全
LLaMA Guard:Meta 开源的安全分类模型——训练数据、架构和性能
1天前
AI安全
NeMo Guardrails 框架:NVIDIA 的对话安全控制框架——怎么配置和使用
1天前
AI安全
困惑度(Perplexity)异常检测:越狱提示通常有异常高的困惑度——能用来检测吗
1天前
AI安全
安全分类器(Safety Classifier):训练一个专门判断内容是否安全的辅助模型
1天前
AI安全
输出过滤器的设计:在模型输出到达用户之前做最后一道安全检查
1天前
AI安全
可解释性与安全审计:可解释性如何帮助发现模型的安全漏洞
1天前
AI安全
Integrated Gradients(积分梯度):Shapley 值的连续版本,在大模型中怎么用
1天前
AI安全
输入过滤器的设计:正则表达式、关键词列表、分类器——多层过滤怎么组合
2天前
AI安全
越狱攻击的成功率指标设计:ASR、PASS@K——怎么科学评估越狱效果
2天前
AI安全
Unicode 同形字攻击:用视觉相似但编码不同的字符绕过关键词过滤
2天前
AI安全
2 / 7
上一页
1
2
3
4
5
6
下一页