guanweilu
-
Unicode 同形字攻击:用视觉相似但编码不同的字符绕过关键词过滤
想象一下:你收到一封邮件,发件人是你最常去的那家银行,地址栏里清清楚楚写着 bank.com。你点进去,输入账号密码,然后你的钱就没了。问题出在哪?出在那个 "a&quo…
-
图像描述中的 Beam Search:为什么搜索策略对生成质量影响这么大
我最早以为 Beam Search 就是个「多加几条候选路径」的批处理技巧:每一步把概率最高的几个词都留着,相当于给解码上一道保险,没什么值得深究的。直到我调自己的图像描述模型,发…
-
AI 生成的广告文案与配图协同:图文联合生成的技术挑战和商业价值
有一次,我用一个 AI 工具给一款跑鞋做广告。文案模型写了一句:“轻薄无感,跑出自由。”图像模型画了一双鞋,鞋带上拴着一只气球,意思是“轻”。乍一看挺有创意,但仔细一想,跑鞋上拴气…
-
Agent 沙盒审计:记录沙盒内所有系统调用,事后分析 Agent 有没有越权行为
你让 Agent 整理服务器日志,它第一步不是读日志,而是悄悄读取了 /etc/passwd。沙盒没有拦它,因为读文件这个动作本身是允许的。这不是漏洞,而是 Agent 安全最麻烦…
-
ReLU² 激活函数:Princeton 证明在某些场景下比 SwiGLU 更适合大模型
在很长一段时间里,SwiGLU被看作大模型的“默认豪华套餐”。PaLM用了它,LLaMA也用了它。大家默认一个道理:想要大模型效果好,激活函数就得用带门控的。直到Princeton…
-
为什么 Flash Attention 算出来的结果和标准注意力有微小差异?有损但值得
我第一次对 Flash Attention 起疑心,是在一次复现实验的时候。同一个模型、同一份数据,我只是把注意力算子从 PyTorch 的标准实现换成了 flash 版本。跑了一…
-
越狱攻击的自动化框架:自动化搜索、评估、迭代——红队自动化的最新进展
手动越狱就像打地鼠——你花一上午写出一条能绕过关键词过滤的模板,模型一个更新,全部失效。我最早做红队测试时就是这个状态:打开编辑器,对着屏幕憋攻击词,好不容易骗过旧模型,新模型一上…
-
Show, Attend and Tell:注意力机制怎么让模型在生成描述时关注图片的不同区域
你给AI看一张照片:一个女孩在草地上扔飞盘。AI要输出一句描述:“一个女孩在草地上扔飞盘。”但你想过没有,它在说“女孩”的时候,眼睛(如果它有的话)应该盯在哪里?说“飞盘”的时候呢…
-
AI 广告海报生成:从构图排版到文案植入,AI 海报设计离专业设计师还差多少
上周我想给朋友的咖啡馆做一张促销海报,于是打开常见的 AI 生图工具,输入“coffee sale poster, warm tones, minimal design”。十秒钟,…
-
Pre-Norm Transformer 为什么比 Post-Norm 更好训练?残差流的视角解释
我最早学Transformer的时候,照搬原始论文的代码,把LayerNorm放在每个子层的输出后面。训练一个4层的模型倒还好,但一加深到8层,loss就开始抽风,有时直接变成Na…