大模型
模型训练
AI Agent
AIGC
多模态
AI安全
AI安全
沙箱化(Sandboxing)大模型:限制 AI 的能力范围,让它只能在安全环境里操作
2026年8月28日
AI安全
Specification Gaming:AI 字面上完成了你要求的,但完全不是你想要的——经典案例与技术分析
2026年8月26日
AI安全
Jeffrey Hinton 为什么从谷歌离职后 all-in AI 对齐风险:他的核心论点是什么
2026年8月26日
AI安全
Representation Engineering(RepE):用模型内部表征来控制行为,对齐的新范式
2026年8月26日
AI安全
ORPO(Odds Ratio Preference Optimization):用赔率比替代损失函数,对齐效率更高
2026年8月24日
AI安全
机制可解释性(Mechanistic Interpretability):找到模型内部的电路——Anthropic 的研究
2026年8月23日
AI安全
基准测试的污染问题:训练数据里混进了测试题——怎么检测和避免
2026年8月21日
AI安全
Chatbot Arena 和 Elo 评分:人类偏好投票为什么比自动评测更有参考价值
2026年8月21日
AI安全
LLM-as-a-Judge:用大模型评估大模型——靠不靠谱
2026年8月21日
AI安全
合成数据的安全风险:用 AI 生成的数据训练 AI,会不会近亲繁殖
2026年8月20日
AI安全
5 / 7
上一页
2
3
4
5
6
7
下一页