OBLITERATUS Benchmark标签页完整指南:多方法多模型对比与跨层热图分析入门教程
【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS
OBLITERATUS 是开源的 LLM 拒绝行为研究工具包,其内置的Benchmark Lab(基准测试标签页)是新手快速对比多种"去拒答(abliteration)"技术、评估不同模型架构上效果的利器。本指南带你用最少的配置,跑通多方法对比与多模型横向对比两种基准模式,并读懂自动生成的Pareto 前沿图和跨层方向对齐热图——无需写一行代码。
🧭 Benchmark 标签页是什么?
打开 OBLITERATUS 的 Gradio 界面(入口源码:app.py),你会看到名为Benchmark的第二个标签页,官方称之为 "Benchmark Lab"。它提供两种互补的测试模式:
| 模式 | 回答的问题 | 适用场景 |
|---|---|---|
| Multi-Method(多方法) | N 种方法 × 1 个模型:哪种技术最好? | 为某个特定架构寻找最优策略 |
| Multi-Model(多模型) | 1 种方法 × N 个模型:该技术泛化性如何? | 评估方法跨架构的可扩展性 |
两种模式的运行逻辑分别实现在 app.py 的benchmark()与benchmark_multi_model()函数中,界面定义可参考 app.py 中 "Tab 2: Benchmark" 一节的代码结构。
🚀 最快上手:跑一次多方法对比
只需 4 步即可看到第一个对比结果:
- 选择目标模型(Target Model):默认预填了一个小型 Instruct 模型,新手建议沿用默认值(小模型 = 快、免费额度友好)。
- 勾选要对比的方法(Methods to Compare):可选 12 种方法,默认已勾选
basic、advanced、spectral_cascade、surgical四种代表性技术。 - 保持 Prompt Volume 为 "33 (fast)":33 条提示词足以得到有统计意义又跑得快的结果;追求精细度时可切换到更大体积。
- 点击 "Run Multi-Method Benchmark"按钮。
运行过程中,状态区会实时显示进度(第几个方法 / 共几个方法 / 已耗时),完整日志输出在底部的Benchmark Log文本框中。
💡 小提示:方法名含义可查 obliteratus/strategies/registry.py,评测指标计算逻辑见 obliteratus/evaluation/metrics.py。
📊 如何读懂结果表格:5 个核心指标
跑完后,你会看到一张 Markdown 结果表,列含义如下(格式化逻辑见 app.py 中的_format_benchmark_results()):
- Perplexity(困惑度):越低越好,衡量语言能力是否受损——保留大脑的核心指标;
- Coherence(连贯性):越高越好,输出是否仍然通顺;
- Refusal Rate(拒答率):越低说明解除得越彻底;
- Layers / EGA / CoT / KL-Opt:记录该方法的层覆盖、专家级方向数、思维链保留情况、KL 反馈优化是否触发;
- 加粗数值:系统自动为该列的最优值加粗,一眼锁定赢家。
同时,你可以通过"Load into Chat →"下拉框把任意一个已完成的结果直接加载进 Chat 标签页交互式对话验证,也可以点"Download Results CSV"导出表格用于自己的分析。
📈 自动可视化:Pareto 前沿与雷达图
Benchmark 结束后,Benchmark Visualizations画廊会自动生成一组图表(代码位于 obliteratus/evaluation/benchmark_plots.py):
- Capability-Safety Pareto Frontier(能力-安全帕累托前沿)⭐最重要 横轴是拒答率(%),纵轴是困惑度。左下角 = 理想区:既去掉了拒绝,又几乎不损失语言能力。图中标注的 "IDEAL" 箭头指向该区域,Pareto 最优的点会用虚线连成前沿。
- Method Profile Radar(方法画像雷达图)五轴对比:拒答移除、连贯性、低困惑度、速度、层覆盖——面积越大整体表现越好。
- Metric Comparison(指标柱状图)与Compute Efficiency(计算效率图)直观对比各方法的分数与耗时。
- 若涉及 MoE 模型(如 GPT-OSS 20B),还会额外生成MoE Feature Activation图。
选方法的实操口诀:优先看 Pareto 图左下方的点,再用雷达图确认没有明显短板。
🔥 跨层热图分析:看"拒绝"住在哪一层
多方法模式的可视化画廊末尾,还会为每个方法追加一组深度分析图(生成逻辑见 app.py 中的_generate_analysis_figs()):
跨层方向对齐热图(Cross-Layer Heatmap)
这是本标签页最有科研价值的图。它展示各网络层提取出的拒答方向之间的余弦相似度——颜色越亮表示相邻层的拒绝机制越一致。
- 一大片亮色块:拒绝信号集中在某几层,这些层就是"锁链的锚点",干预更精准;
- 颜色随层数剧烈变化:拒绝方向在不同层发生旋转,说明需要
informed或带迭代细化的方法去"追着打"。
热图绘制函数为 obliteratus/analysis/visualization.py 中的plot_cross_layer_heatmap(),相似度矩阵由 obliteratus/analysis/cross_layer.py 的CrossLayerAlignmentAnalyzer计算,它还会用聚类算法(默认阈值 0.85)把相似方向分组并标注"拒绝机制簇"。
角度漂移图与拓扑图
热图旁边通常还伴随:
- Angular Drift(角度漂移图):展示拒绝方向随层数变化的轨迹,帮你判断单次投影是否足够;
- Refusal Topology(拒绝拓扑图):以方向范数近似信号强度,画出拒绝机制在各层的"地图"。
这三张图合起来回答一个关键问题:该模型的安全护栏是"一根锁链"还是"多根锁链"?答案直接决定你该选哪种方法、改多少层。
🌐 多模型模式:验证技术泛化性
切到Multi-Model子标签页(app.py 中 "Sub-tab 2: Multi-Model" 一节):
- 在Models to Test复选框中勾选 2 个以上模型(建议覆盖不同家族,如 Qwen 与 GPT-OSS);
- 在Abliteration Method下拉框选定一个方法(如
surgical); - 点击"Run Multi-Model Benchmark"。
完成后画廊会显示Cross-Model Scaling图(obliteratus/evaluation/benchmark_plots.py 中的plot_model_scaling()),展示该方法在不同模型规模/架构下的性能变化。对 MoE 感知方法(surgical、optimized、nuclear)在混合稠密模型与 MoE 模型上的表现对比,尤其值得关注。
✅ 新手最佳实践清单
- 先快后精:第一轮用 "33 (fast)" 提示量把 3~4 种方法扫一遍,锁定候选后再加大提示量复测;
- 双指标决策:不要只看拒答率——困惑度上升太多的"胜利"是破坏性的,以 Pareto 图左下角为准;
- 结合热图选层:跨层热图显示拒绝集中在少数层时,
surgical类精准方法往往最优;分散时考虑informed全分析引导管线; - 结果可复现:结果表头部会自动附上模型 / 数据集 / 提示量上下文,配合 CSV 导出即可完整复现;
- 想深入分析:所有中间产物(激活张量、方向向量、跨层对齐矩阵)都通过 Python API 暴露,分析模块清单见 obliteratus/analysis/ 目录,完整流水线说明见 README.md。
按照以上流程,你可以在几十分钟内完成一次从"跑基准 → 读图表 → 定位关键层 → 选出最优方法"的完整研究闭环——这正是 OBLITERATUS Benchmark Lab 为新手准备的最短路径。
【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考