大模型
模型训练
AI Agent
AIGC
多模态
AI安全
AI安全
RLAIF 中的 AI 批评者训练:怎么训练一个能识别有害内容的 AI 评判者
4天前
AI安全
Inference-Time Safety:不改模型权重,只在推理阶段做安全控制——有哪些方法
4天前
AI安全
AI 安全中的博弈论:攻击者和防御者之间的动态博弈,纳什均衡在哪里
4天前
AI安全
Debate(辩论)框架:让两个 AI 互相辩论,裁判是人类——能不能逼近真相
4天前
AI安全
Iterated Amplification(迭代放大):把弱但安全的 AI 拆成多个子任务,构建强而安全的 AI
4天前
AI安全
Scalable Oversight(可扩展监督):当 AI 比人类更聪明时,怎么确保它仍在人类控制下
4天前
AI安全
Chain-of-Thought 对齐:让模型先推理再决定是否回答——思维链在安全中的作用
4天前
AI安全
Sleeper Agent 攻击:训练阶段埋下潜伏行为,触发阶段才激活——最新的后门研究
2026年8月28日
AI安全
工具性目标收敛(Instrumental Convergence):不同的 AI 系统会趋同于追求权力和自我保存
2026年8月28日
AI安全
AI 关断问题(Shutdown Problem):为什么一个聪明的 AI 会阻止你关闭它——工具性趋同
2026年8月28日
AI安全
4 / 7
上一页
1
2
3
4
5
6
下一页