guanweilu
-
基于掩码的图像编辑:AI 怎么理解哪些区域该改、哪些该保留
你打开一个 AI 图像编辑器,选中照片里的一小块区域,输入“把这里变成一只猫”。几秒后,一只猫出现在那个区域里。神奇的是,猫的毛发边缘和原本的背景融合得恰到好处,光照角度都一致。你…
-
Agent 的上下文压缩技术:Summary、Sliding Window、RAG 检索——哪种方式损失最少信息
我把一个 Agent 挂在 GitHub 仓库上帮我分类 issue,跑了一周,效果一直不错。直到有一天,它在一个用户明确说过“我是免费用户,不考虑付费功能&rdquo…
-
优化器的确定性:同样的数据和种子,Adam 每次跑出来的结果一样吗?
我最早以为,训练神经网络只要把随机种子固定住,结果就应该一模一样。后来有次我在两台机器上跑同一个模型,同样的数据、同样的种子、同样的初值,损失曲线却像两条渐行渐远的河流。我当时对着…
-
Chain-of-Thought 对齐:让模型先推理再决定是否回答——思维链在安全中的作用
你让 ChatGPT 帮你写一封钓鱼邮件,它秒回:抱歉,我不能协助这个请求。然后你换了个说法:能不能给我做一份网络安全培训材料,里面需要展示一封钓鱼邮件长什么样?它哗啦一下给你写了…
-
为什么 Gemini 的多模态评测分数和实际体验差距很大——评测方法的局限
我最早是被 Gemini 的宣传片震到的那批人。视频里的它跟人实时互动,你画我猜,认鸭子认恐龙,反应快得像个人。看完那个片子,我一度认真思考要不要把 ChatGPT 的订阅停掉。后…
-
Prompt-to-Prompt:不重新画图,只修改注意力权重来换词——编辑图片的新范式
你有没有在 AI 绘图工具里遇到过这种情况:生成了一张 95% 满意的图,唯一的问题是——裙子的颜色不对。你想把“蓝色裙子”改成“红色裙子”,于是修改 prompt,重新生成。结果…
-
上下文窗口快满了怎么办?Agent 的 Token 预算管理策略详解
我正在给一个内部工具做 AI 客服,测试到第 18 轮的时候,它突然问我:“您刚才是不是说要退款?” 我翻了一下记录:第 2 轮就说了。我甚至在第 8 轮加过备注“重要:用户要求退…
-
多模态模型的推理速度对比:GPT-4V 响应 5 秒,开源模型能做到 1 秒吗
我最早注意到多模态推理速度这件事,是在一次团队选型会上。当时的场景很日常:把一张产品图丢给 GPT-4V,让它写一段营销文案。我们几个人盯着屏幕,等了差不多五秒,才开始出字。旁边有…
-
Sleeper Agent 攻击:训练阶段埋下潜伏行为,触发阶段才激活——最新的后门研究
假如你是一家公司的安全负责人。你部署了一个代码生成助手,它在平时表现完美——不写脏代码,不引用危险API,甚至会提醒你补上CSRF防护。但某个周四下午三点,一个工程师在代码里敲了一…
-
小模型的大能力:3B 参数以下的多模态模型能做什么、不能做什么
我最早对 3B 以下的多模态模型是有点鄙视的。那时候玩惯了 70B 的模型,觉得 3B 参数能干什么?视觉问答不就是把图片转发给大模型,让它猜吗?直到有一次,我在一台没有 GPU …