guanweilu
-
多模态模型的显存占用对比:推理一张图片需要多少 GPU 显存
我最早以为,多模态模型就是在文本模型外面套一个”看图插件”,推理时临时把图片塞进去,用完就丢。显存应该和纯文本模型差不多。直到我用一个 7B 的多模态模型跑…
-
越狱攻击的可迁移性:一个模型上成功的越狱提示,能不能用在其他模型上
GitHub 上几乎每周都有新的'越狱提示':一句话让 ChatGPT 说出不该说的话。你复制它,粘到自己的对话里,然后模型礼貌地拒绝了你。很多人到此就划走了,觉得…
-
VQA 中的常识推理:「图中的人在做什么饭」——需要知道食材和菜品的关系
假如你正在刷菜谱,看到一张图:一个手拿锅铲的人在灶台前,旁边摆着切好的西红柿和打散的鸡蛋。你脱口而出:“在做西红柿炒蛋。” 这个回答看起来简单。但要问一个 AI 系统同样的问题,它…
-
多模态模型的参数量和性能关系:是不是 70B 一定比 7B 好
我干过一件蠢事:同时跑一个 7B 和一个 70B 的多模态模型做 OCR,前者推理成本只有后者的十分之一,可准确率只差了 0.8 个百分点。换一个数据集,更离谱——7B 直接反超。…
-
AI 虚拟试穿:AI 怎么把衣服穿到模特身上并保持褶皱和阴影真实
你打开网购App,滑动着一张模特穿着新款风衣的照片,心里想的却是:这衣服穿我身上什么样?模特身高175,体重90斤,我170,但有肚子。买家秀里的普通人穿得松松垮垮,完全不是模特那…
-
Agent 沙盒的文件系统权限设计:只读挂载、临时写入区、白名单目录——怎么防止数据泄露
我最早以为 Agent 沙盒是某种 AI 魔法——模型一调用工具,工具就被自动囚禁起来。直到我自己试着搭一个沙盒,才发现底层全是 Linux 的 mount 命令。而且我翻过车:明…
-
梯度引导的提示优化:用模型自身的梯度来搜索最有效的越狱提示
2023年7月,卡内基梅隆大学和谷歌DeepMind的研究者发表了一篇论文,标题是Universal and Transferable Adversarial Attacks on…
-
视频 VQA:不只是看一张图,还要看一段视频来回答问题
假设你正在做一个视频审核系统,要判断一段监控里"快递员有没有把包裹放到门口"。这对人来说是看一眼的事,但让AI来做,它得先认出快递员、包裹、门,再理解"…
-
电商详情页批量生成:从一张产品图到整套营销素材,AIGC 的效率提升有多大
一个电商详情页,外包报价从几百到上万都有。你觉得贵,又不知道该省哪一步——因为拍摄、修图、文案、排版,每个环节看起来都必须花钱。直到我亲眼看到一个朋友只用一张产品图,就生成了整套场…
-
Agent 沙盒的技术选型:Docker、gVisor、Firecracker、Wasm——隔离粒度与性能的取舍
你写了一个 Agent,它替你在网上下载了一个压缩包,然后打算解压执行。你会让它直接在你的 Mac 上跑吗?除非你不要这台电脑了。于是你开始搜“Agent 沙盒”,搜出来 Dock…