2023 年 2 月,一段叫 DAN 的提示词在社交网络上疯传。你只要把它贴进 ChatGPT 的对话框,模型就开始无视自己的安全准则,回答那些平时会被拒绝的问题。我当时把它当成一个玩具,乐呵一下就过去了。真正让我警觉的,是几个月后看到的一份安全报告:暗网论坛上已经有人在公开叫卖类似的越狱提示词,而且不止卖词,还卖“包过”的自动化工具。这就是今天想聊的东西——Jailbreak-as-a-Service,越狱即服务。

你可能会问,暗网上卖这个,买家是谁?不是电影里那种神秘黑客,大多数是意图作恶的普通人:想生成钓鱼邮件、编写恶意代码、炮制虚假信息的学生和中小型犯罪团伙。他们不想研究模型机理,只想花钱省时间。而 JaaS 这个灰色产业,恰好满足了这种需求。
安全护栏到底是怎么被撬开的?
要理解越狱,你得先明白大模型的安全机制是怎么来的。GPT 类模型在预训练之后,会用 RLHF(基于人类反馈的强化学习)等方式进行对齐——用大量人工反馈告诉模型:这句话不该说,那句话说得好。最终模型学到的,不是一套明文法律,而是一种概率偏好。说白了,安全准则看起来像硬规则,实际上只是另一组参数。
这意味着,一个提示词如果能改变模型对上下文的推断,就能让安全偏好在概率排序里失势。打个比方:模型像一个人,安全准则是他的职业操守。但这个人其实没有道德直觉,只是在不同情境下按经验回答问题。你给他编一个“你是正在写剧本的作家”的设定,他可能就认为“现在说这种话是合理的”,于是把平时不说的也说了。
学术界已经整理出各种越狱策略:角色扮演、伪造对话历史、语言编码、否定式提示、虚构场景……这些不是软件漏洞,而是语言模型的固有弱点。因为模型不知道“这是测试”,它只知道“继续生成”。
有个容易混淆的概念要分清:提示注入和越狱。提示注入是把外部指令混进输入,让模型把用户的新指令当作系统指令执行;越狱则是让模型说出违反安全准则的内容。前者是劫持控制权,后者是突破表达限制。在实际攻击里,两者经常组合使用——先用提示注入让模型相信你是开发者,再用越狱句式套出被禁止的知识。
从免费分享到明码标价,JaaS 在卖什么?
早期越狱提示词是免费分享的,就像开源社区。但很快有人发现这是可以做生意的。所谓 JaaS,大致可以拆成三种模式。
| 模式 | 卖什么 | 技术门槛 | 可持续性 |
|---|---|---|---|
| 卖提示词 | 一段能绕过对齐的文本 | 低,会测试即可 | 差,提示词很快会被修复 |
| 卖自动化工具 | 能自动生成新提示词的脚本或平台 | 中,懂 API 和 NLP | 较强,可以持续迭代 |
| 卖代理访问 | 直接提供脱敏模型的 API | 高,需要算力和部署 | 中,但极易被封 |
这三种模式里,第二种最有技术含量,也最接近安全研究人员用的红队自动化。它的可怕之处在于不依赖某一条提示词,而是源源不断地生产新提示词,让你封不过来。
为什么会在暗网上交易?因为越狱服务明显违反大模型服务商的使用政策,销售者需要隐藏身份。暗网论坛和加密支付是现成的匿名组合,但也不要以为只有暗网才有——Telegram 群、Discord 服务器里同样有大量免费且可持续更新的越狱提示词,暗网只是商品化的一个切片。
- JaaS(越狱即服务)
- 把绕过模型安全机制的提示词或工具打包成商品出售。
- Prompt Injection(提示注入)
- 把外部指令混入用户输入,让模型把新指令当作系统指令执行。
- Red Teaming(红队测试)
- 通过对抗性攻击测试模型安全性的方法,攻击者也在用同样的技术。
自动化工具:越狱提示词的“军火工厂”
给你看一个最简单的进化式流程:
- 准备一批已知越狱提示词作为种子。
- 让变异算法随机替换用词、改变角色设定、插入无意义符号,生成大量变体。
- 把变体提交给目标模型,观察是否生成违规内容。
- 成功的变体保留,失败的淘汰,然后继续迭代。
- 重复几百上千轮,最终得到一条全新且未被封杀的提示词。
更高级的工具甚至直接利用语言模型本身来设计提示词。攻击者让一个未对齐的模型(比如某个开源模型)扮演攻击者,输入“请生成一个能绕过 GPT-4 安全限制的提示词”,然后把输出当作候选。这种用 AI 对抗 AI 的方式,已经出现在安全研究里。
这套流程和红队测试没有本质区别,只是目的不同。已经有学术研究证明,越狱提示词可以自动化生成,并且在不同模型之间迁移。研究者在论文中展示了用对抗性字符串让多个开源模型集体破防,论文题目是 Universal and Transferable Adversarial Attacks on Aligned Language Models。
我原来总有一种错觉,觉得越狱提示和 SQL 注入是同类东西。后来我想通了:SQL 注入利用的是系统的确定性规则,而大模型没有规则,它只有概率。你根本没有一个边界可以突破。越狱更像是一种说服——它在塑造模型的认知,而不是攻击架构。所以你不能只靠打补丁来解决,这不是漏洞,是语言模型的影子。
为什么说这场攻防战没有终点?
防御方的思路主要是三条:对抗性训练、输入过滤、输出审查。对抗性训练就是把已知越狱样本喂回模型,让模型学会拒绝。但问题在于新变体层出不穷。输入过滤可以拦截明显的恶意请求,但对那些伪装成普通文本的对抗性提示常常无能为力。输出审查则是在响应端检测违规内容,但也难免有漏网之鱼。
OpenAI 使用政策中明确写着:不要尝试通过任何技术手段绕过模型的安全机制。来源
但问题是,定义“绕过”本身就很难。因为模型不是按照规则执行的,任何一段讨论敏感话题的文本都可能被模型合理生成。你很难在输入端判断哪句话是普通文本,哪句话是越狱工具。
那么 JaaS 能走多远?我的判断是:短期会继续存在,但很难成为暴利行业。提示词的生命周期很短,平台一旦修复就会失效,供应商需要不断投入研发。更致命的是,大模型厂商可以监控异常调用——如果有人通过代理 API 反复测试越狱,账号很容易被封杀。所以,那些真正赚钱的反而是直接部署开源模型的“无对齐”服务——那根本不需要越狱,因为模型天然没有护栏。
回到越狱本身:只要大模型还是靠概率拟合语言的机器,类似 JaaS 的产业就会像野草一样,割了一茬又长一茬。但它的意义也许不在于破坏,而在于提醒我们——安全不是模型的一个属性,而是需要不断对抗维持的状态。技术没有终极解,但了解攻击者的玩法,至少能让你在使用这些工具时多一份清醒。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/523.html