大模型
模型训练
AI Agent
AIGC
多模态
AI安全
AI安全
越狱攻击的自动化框架:自动化搜索、评估、迭代——红队自动化的最新进展
2天前
AI安全
缩放规律与可解释性:模型变大后,内部表征是变复杂了还是变简单了
2天前
AI安全
越狱即服务(JaaS):暗网上出售的越狱提示和自动化工具
2天前
AI安全
自适应越狱(Adaptive Jailbreak):根据模型返回实时调整攻击策略
3天前
AI安全
Attention 可视化的局限性:注意力权重不等于特征重要性——为什么不能直接看 Attention Map
3天前
AI安全
越狱攻击的可迁移性:一个模型上成功的越狱提示,能不能用在其他模型上
4天前
AI安全
梯度引导的提示优化:用模型自身的梯度来搜索最有效的越狱提示
4天前
AI安全
Token 分割攻击:把敏感词拆成多个 token,让模型不认识但人能拼出来
4天前
AI安全
跨模态提示注入:在图片 EXIF 数据、文档元数据中嵌入攻击指令
4天前
AI安全
间接提示注入(Indirect Prompt Injection):通过网页、邮件等外部内容注入指令
4天前
AI安全
3 / 7
上一页
1
2
3
4
5
6
下一页