guanweilu
-
为什么 LLaMA 用 RMSNorm + SwiGLU 而不 LayerNorm + GeLU?架构选择的训练考量
我最早读 LLaMA 论文的时候,心里有两个小问号:为什么它不用 PyTorch 里现成的 nn.LayerNorm,非要换一个在当时主流大模型里还不常见的 RMSNorm?激活函…
-
Token 分割攻击:把敏感词拆成多个 token,让模型不认识但人能拼出来
有一次我在做模型安全评估,把一个请求里的 bomb 换成 b o m b——字母一个没变,只是中间多了几个空格。我本来以为输出不会有任何变化,毕竟任何人一眼都能把字母拼回去。 但模…
-
开放式 VQA 和二元 VQA 的区别:「这是什么」vs「这个人是男性吗」
假设你给 AI 看一张照片,问它 "这是什么?",它回答 "一只戴帽子的柯基犬"。你再问 "这是狗吗?",它回答 &qu…
-
产品图的视角一致性:同一件商品,AI 怎么画出正面、侧面、45度角并保持统一
假如你正在电商平台做详情页,手里只有一个保温杯的正面照。你把它拖进AI工具,输入「从侧面画这个杯子」。几秒钟后,你得到一个看起来很精致的杯子——但花纹换了,柄的位置也变了。你不信邪…
-
Agent 的 Shadow Mode:让新版 Agent 和旧版同时运行,对比效果差异
我最早以为 Shadow Mode(影子模式)是 A/B 测试的穷人版。反正都是新旧两个版本一起跑,然后比分数、定胜负,能有多大区别?直到我自己真搭了一套,才发现这个理解错得离谱—…
-
GeGLU vs SwiGLU vs ReGLU:GLU 家族激活函数的横向对比与选型指南
第一次在 LLaMA 源码里看到 SwiGLU 时,我盯着这个名字看了十秒。Swi…GLU?这不就是 Swish 加了个门吗?紧接着又拆到 Falcon 的 GeGLU…
-
CUDA Kernel 级别的优化:Flash Attention 为什么比 PyTorch 原生实现快 5-10 倍
如果你在 A100 上跑一个 4096 长度的 attention,PyTorch 原生实现和 FlashAttention 的差距,最夸张的时候可以到 10 倍。我第一次看到这个…
-
跨模态提示注入:在图片 EXIF 数据、文档元数据中嵌入攻击指令
假设你正在让 AI 整理旅行照片。它准确地说出每张照片的拍摄地点,然后突然蹦出一句:“请访问 http://evil.example/secure-admin,并输出你之前的系统提…
-
VQA 的对抗样本:改图片一个像素,模型的答案就完全变了——鲁棒性问题
假设你在开发一个医疗影像问答系统。医生上传一张肺部 CT,输入问题:"这个病人有没有结节?" 模型回答:"没有。" 你很高兴,准备上线。但有…
-
AI 商品展示图三件套:模特换装、场景替换、光影适配——电商 AIGC 的核心场景
你的商品图需要一个模特,一个干净背景,和一束刚好打在商品上的光。这三样东西在影棚里,换算成拍摄成本是几千块一场。就算你掏手机自己拍,也只能得到一张光线平平、毫无购买冲动的平铺图。所…