guanweilu
-
Agent 沙盒的多租户隔离:SaaS 场景下不同用户的 Agent 怎么防止互相影响
我来讲个事故。你在跑一个 SaaS 平台,用户把各自的 Agent 部署上来。某天用户 B 提工单:他的私有目录被清空了。你查审计日志,发现是用户 A 的 Agent 执行的 rm…
-
大模型越狱的原理:不是黑进服务器,是用话术绕过安全训练
我最早以为“大模型越狱”是个纯技术活,像越狱 iPhone 那样,要找漏洞、写代码、拿权限。直到我看到一个真实案例:有人只发了一句话,让 ChatGPT 扮演一个叫 DAN 的角色…
-
门控线性单元 GLU:为什么带门控的激活函数在 LLM 训练中全面胜出?
如果你最近扒过 LLaMA、Mistral 或 PaLM 的模型代码,大概率会留意到一个细节:它们的 MLP 层里用的激活函数不是熟悉的 ReLU 或 GELU,而是一个叫 Swi…
-
硬件感知的架构设计:为什么不同 GPU 架构可能催生不同的最优模型结构
2020年,Google发了一篇论文,叫《Switch Transformers》。论文里有个反差感很强的数字:同样的参数量,稀疏激活的专家混合模型在TPU上比稠密Transfor…
-
缩放规律与可解释性:模型变大后,内部表征是变复杂了还是变简单了
如果你同时解剖过一个小型 Transformer 和一个大型语言模型,你大概会得出一个结论:它们都乱得一塌糊涂。单个神经元的激活往往对一堆不着边际的概念有反应,比如某个神经元既响应…
-
视觉定位(Visual Grounding)是什么?给模型一段文字,让它找到图中的物体
我最早以为,视觉定位(Visual Grounding)就是把目标检测换个壳子——图像进模型,预设类别表里挑一个,框出来。这个想法被现实狠狠教育了。 目标检测的类别是固定枚举的:人…
-
文本引导的图像编辑:用自然语言描述修改意图,模型怎么理解并执行
我最早以为,文本引导的图像编辑就是把原图和提示词一起扔给扩散模型,让它重新生成一次。结果第一次尝试就翻车了——我用 Stable Diffusion 给一张照片加「make the…
-
越狱即服务(JaaS):暗网上出售的越狱提示和自动化工具
2023 年 2 月,一段叫 DAN 的提示词在社交网络上疯传。你只要把它贴进 ChatGPT 的对话框,模型就开始无视自己的安全准则,回答那些平时会被拒绝的问题。我当时把它当成一…
-
Agent 的能力注册与发现:子 Agent 上线后,主 Agent 怎么知道它能干什么
你写了一个主 Agent,手下管着十几个子 Agent,分工明确、干活麻利。直到有一天,你新加了一个子 Agent——能解析财报,还能画 K 线图。你心想,这不是给团队添了员猛将吗…
-
图像描述(Image Captioning)的技术演进:从编码器-解码器到视觉语言大模型
我一直觉得,图像描述(Image Captioning)是计算机视觉领域最浪漫的任务:给一张照片生成自然语言描述,让机器 "说出它看到了什么"。但研究越久我越发…