大模型
模型训练
AI Agent
AIGC
多模态
AI安全
AI安全
对齐税(Alignment Tax):让 AI 更安全,它的能力会下降多少
2026年8月15日
AI安全
RLAIF(AI 反馈强化学习):用 AI 替代人类标注员做对齐,效果能比吗
2026年8月15日
AI安全
宪法 AI(Constitutional AI):让 AI 自己监督自己——Anthropic 的对齐方案
2026年8月15日
AI安全
人类偏好数据怎么收集?标注员的偏见会传染给模型吗
2026年8月14日
AI安全
DPO vs RLHF:为什么不用强化学习也能对齐?偏好优化的数学原理
2026年8月14日
AI安全
奖励模型(Reward Model)的奖励黑客问题:模型学会了刷分而不是做好
2026年8月14日
AI安全
RLHF 的完整流程再拆解:从人类偏好数据到训练好的奖励模型,每一步怎么做的
2026年8月14日
AI安全
7 / 7
上一页
2
3
4
5
6
7