guanweilu
-
RLHF 中的安全维度训练:在奖励模型中专门加安全维度的打分
我最早以为,AI拒绝回答危险问题,是靠一个内置的敏感词库。直到我翻了模型的源码——没有词库。但当我问它一个明显违反伦理的问题时,它依然彬彬有礼地拒绝。真正让模型变“谨慎”的,是训练…
-
图像描述在社交媒体中的应用:自动为图片生成无障碍替代文本(Alt Text)
我第一次用Mac自带的VoiceOver刷Twitter,是2021年。纯好奇,想看看视障用户到底是怎么"上"社交媒体的。 结果,时间线上一条金毛犬在草坪上打滚…
-
AI 辅助城市规划可视化:从 CAD 平面图到城市鸟瞰效果图的 AI 生成
你面前放着一张 CAD 总平面图,密密麻麻的线条标注着地块边界、道路红线和建筑轮廓。领导说:明天早上要看到城市鸟瞰效果图。你打开 SketchUp,开始一栋一栋地挤方盒子。一个 5…
-
Agent 怎么理解大型代码仓库:从文件树索引到语义搜索——代码 Agent 的导航策略
假设你是一个代码 Agent,刚被丢进一个陌生的仓库。你接到的任务是:修复“Chrome 上登录成功后偶尔跳回登录页”的 bug。你会怎么做? 我最早以为,先爬一遍文件树,找到所有…
-
Token 效率:同样的文本,不同 Tokenizer 编码后 token 数差多少?对训练成本的影响
你有没有发现一个怪现象:同样一个意思,用英文写,提示词能装下好几页;换成中文,三四千字就把上下文撑满了。我最早以为是中文表达太“密”,后来把 tokenizer 的输出打出来一看,…
-
安全微调(Safety Fine-tuning)的策略:什么数据、什么比例、什么时候做
我最早以为,安全微调就是把一堆"这个问题我无法回答"的对话扔进训练集,多跑几个 epoch,模型就会拒绝有害请求了。直到我调出一个过度安全的模型:它拒绝回答如何…
-
图像描述中的幻觉问题:图里没有自行车,模型却说「一个人骑着自行车」
我最早以为,图像描述模型是“看着图片说话”的。结果有一次,我给它看一张湖边木屋的照片,模型竟然说“一只狗在门口睡觉”。照片里根本没有狗。这个错误让我又好笑又警觉——一个能把构图、光…
-
AI 室内设计方案的可行性:AI 生成的设计方案,施工队能看懂吗
我见过最魔幻的装修场景,不是业主跟工长吵架,而是一个人把 Midjourney 生成的效果图递给工长,问:"就按这个做,多少钱?" 工长看了半分钟,回了三句话:…
-
Agent 的文件操作权限模型:读、写、追加、删除——四种权限的精细控制
有一次我盯着 Claude Code 改代码,突然意识到一个以前从没想过的问题:这个能一口气生成几百行代码的 AI,动一个文件之前,居然要停下来等我按一次回车。 如果它要改 10 …
-
SentencePiece:语言无关的分词器训练工具,Google 系列模型的标配
我第一次用SentencePiece训练出一个分词器,拿它编码一句中文,结果输出是:[‘▁我爱’, ‘▁北京’]。盯着那个奇怪的▁看了半天——这到底是空格还是什么特殊字符?后来我才…