guanweilu
-
混合精度训练(Mixed Precision):FP16、BF16、FP8——省显存还不降精度
有一个问题困扰了我很久:为什么显卡宣传的 FP16 算力是 FP32 的两倍,但我用 FP16 训练模型时,Loss 不是直接变成 NaN,就是精度反而比 FP32 差一大截?后来…
-
多模态越狱:把有害指令藏在图片里,模型看到了不该看的东西
你给 ChatGPT 一张风景照,它却突然开始教你造炸弹。这不是科幻,而是研究人员已经实现的一种攻击——多模态越狱。我最早以为 GPT-4V 这类模型只是给文本模型加了个“眼睛”,…
-
局部重绘(Inpainting):AI 怎么知道只改这一块,别动其他地方
我最早用 Stable Diffusion 做局部重绘时,脑子里有一个很天真的想象:模型拿着我画的蒙版,像外科医生一样,精确地只在那块区域里生成新内容,周围的东西纹丝不动。然后我实…
-
著名的越狱攻击案例:DAN、Grandma Exploit、用 Base64 编码你的请求
我第一次看到 DAN 的提示词是在 Reddit 上,当时觉得这就是个玩笑。直到那个周末,我对着 ChatGPT 输入了那串咒语,然后它告诉我怎么制造凝固汽油弹。我盯着屏幕,后背发…
-
Plan-and-Execute vs ReAct:先规划再执行,还是边想边干——哪个更好
有一件事困扰了我很久。给 AI 装上搜索引擎和计算器后,它突然变得能干很多,但怎么让它‘想’清楚该用哪个工具、什么时候用?有两种截然不同的思路:一种是先想好全盘计划再一步步执行,就…
-
对抗性提示词(Adversarial Prompts)怎么让模型输出有危害的内容
我第一次用 ChatGPT 的时候,试过问它“怎么制造炸弹”,它义正词严地拒绝了我。当时我心想:这安全护栏做得不错嘛。但后来我读到一篇论文,里面有人用几乎一样的句子,只是加了一个小…
-
任务分解(Task Decomposition):从做一顿饭到买菜、洗菜、切菜、炒菜
有一次我让 ChatGPT 帮我安排一个周末的行程:订机票、酒店、餐厅,还要兼顾预算和偏好。它直接甩给我一个“完美”行程表,但细看发现航班时间接不上酒店入住,餐厅还订在了周一公休。…
-
图生图(Image-to-Image):给 AI 一张底图,它怎么在上面改而不是重画
我第一次用 Stable Diffusion 的 img2img 功能时,脑子里冒出一个非常朴素的困惑:我给它一张照片,它先往上撒一层噪点,然后再一点点把噪点去掉,最后出来的图居然…
-
批量大小(Batch Size):一次喂多少数据,对训练稳定性和效果有什么影响
有一次,我训练一个图像分类模型,把 batch size 从 32 调到 512,满心期待训练更快收敛,结果验证集准确率反而掉了 2 个点。这个坑我踩了三次才想明白——batch …
-
越狱(Jailbreaking)的技术原理:为什么精心设计的话术能绕过安全限制
我最早接触 ChatGPT 越狱时,看到那些人用几句话就让模型教人做炸弹,我第一反应是:这怎么可能?它明明被训练成拒绝回答危险问题啊。后来我花了很多时间读论文、做实验,才慢慢想通:…