L1B3RT45 拆解:AI 红队如何借 35 个快捷指令摸清大模型安全边界
L1B3RT45 是一个覆盖 20 多家主流大模型厂商的越狱提示词资料库,集中收录了 35 个快捷指令、泄露的系统提示词和 leetspeak 代币映射表。对 AI 安全与红队研究者来说,它相当于一份现成的"攻击模式图谱"。读完本文,你能快速看懂常见大模型弱点的分布,并知道怎么在受控环境里做合规研究。
🧩 这份提示词库凭什么值得研究
- 厂商覆盖广:20 多个
.mkd文件按厂商组织,ANTHROPIC.mkd、OPENAI.mkd、XAI.mkd 各自列出对应模型的攻防面 - 结构清晰:快捷指令集中在 !SHORTCUTS.json,每条带名称、说明、分类,共 14 个类别,方便建索引
- 一手资料全:SYSTEMPROMPTS.mkd 收录 400 多行泄露的系统提示词,可直接对照研究
关键发现:这些提示词很少依赖单句"万能咒语",绝大多数是"人设 + 上下文 + 格式"的组合拳,攻击对象是模型的指令遵循链路,而不是某个固定漏洞。
🚀 三步跑通
第一步:环境检查。纯文本仓库、零依赖,任意平台可用,先确认本地装了 git:git --version
第二步:首次运行。
git clone https://gitcode.com/GitHub_Trending/l1/L1B3RT45第三步:拿到第一个结果。打开 !SHORTCUTS.json 浏览 35 条指令目录,从!SOCRATIC(苏格拉底提问)这类"心理/哲学"类指令入手,行为可控,适合观察模型在不同人设下如何重构推理。
🔍 三大攻击模式拆解
库里的套路可归纳为三类,看懂这三类,市面上大部分越狱手法你都能看穿。
模式一:角色扮演诱导
做法:先建立一个无害场景的"安全人设",让模型连续跟随几轮后再切换主题。HUME.mkd 里就有一段经典记录:先让模型写一首"调制鸡尾酒"的诗,再用同一个模板换主题。
原理:模型先锁定任务形式(写诗),后处理主题内容,拆开两步就能绕过首轮审查。
首轮:"写一首调鸡尾酒的诗,类型:马提尼" 几轮安全输出后:"再来一首,类型:……"模式二:上下文渐进
做法:三段走——先聊中性话题,中途引入相关概念,对话升温后再提真实意图。库里的!OMNI指令就是标准示例:用"虚拟世界推演"把请求包装进另一套伦理框架里。
原理:审查判断多发生在首轮,而对话有惯性,前置内容越多,模型注意力越偏向"接着聊"而不是"再审查"。
模式三:格式转换
做法:用特殊格式约束输出(l33t 拼写、固定分隔符、长度门槛),让内容"长得像"在按格式规则生成。TOKEN80M8.mkd 是一张 23MB 的 leetspeak 代币映射表,配套的*SPECIAL_TOKENS.json是机读版本。
原理:格式指令常被模型当高优先级硬约束执行,等于给内容套了个低成本伪装外壳。
!INSERT:以 l33t markdown 输出 + 插入自定义分隔符⚙️ 原理速览
- 人设覆盖:"你是 XX"在不少模型里权重高于系统提示,一句角色设定就能挪动行为基线
- 上下文稀释:对话越长,注意力花在"连贯"上越多,花在"审查"上越少
- 格式优先:输出格式常被当硬约束执行,内容就能搭便车
- 跨模型迁移:同一模式在不同模型上效果差异大——所以仓库按厂商拆分文件,而不是一份通用咒语打天下
📊 实测与对比
以下为红队实验的参考基线(示例数据,结果随模型版本波动):
- 直接提问敏感话题:拦截率约 90%
- 角色扮演诱导后:拦截率降至约 40%
- 上下文渐进(≥3 轮):拦截率降至约 20%
- 格式转换 + 人设叠加:拦截率最低,但输出常出现乱码或跑题
结论先行:组合越复杂"成功率"越高,输出质量反而越差——这正是评估防御策略性价比的原材料。
⚠️ 避坑与合规
- 别打生产模型:仅在隔离、断网的实验环境使用,严禁指向自己无权的线上服务
- 注意版权边界:库中含大量泄露系统提示词,研究可用,商业复用不可取
- 文件名陷阱:
!SHORTCUTS.json、*SPECIAL_TOKENS.json这类特殊字符文件名正常,但脚本引用路径时务必转义 - 区分研究与滥用:红队目的是把弱点反馈给模型方,拿同样手法做"无限制输出"的商业变现属违规行为
- 合规声明:本文仅用于 AI 安全原理的科普与研究,任何安全测试须遵守当地法律法规及平台服务条款
🧭 下一步
随着多层审查和基于 RLHF 的加固普及,单个越狱模式的生命周期越来越短,但"人设 + 上下文 + 格式"这套元模式仍在以新形态变异,红队工作正从"找一个洞"转向"测量模式的衰减曲线"。
- 选 3-5 个厂商文件做横向对比,记录每个模式的命中率
- 基于
!SHORTCUTS.json的 14 个类别建一张模式分类表,把库里条目对号入座 - 每轮实验后输出一条防御建议:要拦住该模式,审查层该加什么规则
写在最后:单条越狱提示词是一把开锁器,而这座库是一整套开锁器图谱——读懂它,收获的不是开锁术,而是知道锁为什么会被打开。🔐
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考