news 2026/9/15 9:24:55

Counter-GEO-Bench:评估针对信息扭曲型生成式引擎优化的防御措施

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Counter-GEO-Bench:评估针对信息扭曲型生成式引擎优化的防御措施

大家读完觉得有帮助记得关注和点赞!!!

摘要

生成式引擎优化(GEO)使内容生产者能够提高其网页在生成式搜索引擎中的可见性,但当对手发布看似普通的、经过GEO优化的文档,这些文档被受害大语言模型(LLM)检索并综合成扭曲的答案时,同样的技术可以用于传递定向错误信息。现有基准测试并未在受控条件下评估针对此威胁的防御措施。因此,我们提出了Counter-GEO-Bench 1,一个防御基准测试,它将247个人类验证、质量筛选的查询与信息保留型和信息扭曲型的GEO改写配对,并在三个受害LLM上评估攻击成功率(ASR)、假阳性率和答案质量方面的防御效果。在Counter-GEO-Bench下,三种现成的防御措施(Granite Guardian、Llama Guard 3和NeMo Self-Check Fact-Checking)将ASR最多相对降低5.7%,而Granite Guardian的降低在统计上不显著。安全分类法护栏针对的是策略违规,而GEO错误信息作为流畅的信息内容通过了它们。为此,我们提出了一个轻量级的基准基线C-GEO Guard2,它相对降低了47.6%的ASR,且效用损失接近于零,证明了该威胁是可处理的。

1 引言

随着大型语言模型(LLMs)日益成为主要的信息来源,有组织的错误信息宣传活动已经调整了其策略。对手应用生成式引擎优化(合法发布者用来提高其在生成式搜索系统中可见性的相同技术)来制作网页文档,这些文档以流畅、主题相关的散文嵌入有针对性的虚假主张(Wen等人,2025)。这些文档通过标准的网页发布渠道(博客、被主流搜索引擎索引的评论网站)进入检索流水线,通过标准过滤器,并被综合成LLM生成的答案,用户将其视为可信的。对生产级生成式搜索引擎的审计证实了这个问题:即使是良性的关键词查询,也几乎有一半的情况会产生包含恶意内容的响应(Luo等人,2025),尽管该工作研究的是明显恶意的URL,而非GEO优化的错误信息:即在检索层面与合法来源无法区分的内容。随着AI生成的网页内容激增,这种攻击面有可能侵蚀用户对基于LLM的信息系统的信任。

该攻击在文档层面运作:对手使用GEO技术生成泛滥的网页,嵌入有针对性的虚假主张,同时保留良性来源的主题覆盖、语域和表面质量。当生成式搜索引擎将任何目标文档与合法来源一起检索时,受害LLM会将虚假主张综合到其答案中。标准的护栏不会拦截该文档,因为它不包含毒性、提示注入或策略违规;危害完全在于嵌入流畅信息内容中的事实扭曲。

现有基准测试并未在受控条件下,在摘要阶段(检索之后)评估针对GEO优化错误信息的防御措施,并伴有配对的效用测量。我们通过在作者控制的检索到合成流水线中,在防御措施预期发挥作用阶段对其进行评估来解决这一空白。比较的对象是防御组件本身,而非端到端产品:黑盒产品测试仅暴露最终答案,无法分离检索流水线、系统提示和隐藏护栏的影响。我们在一个受控的生成式搜索工具中实例化了这一设计,使用了三个开源权重的受害LLM。

我们做出三点贡献:

  1. 首个针对信息扭曲型GEO的防御基准测试。 Counter-GEO-Bench提供了247个人类验证的查询,每个查询都带有目标文档的配对信息保留型和信息扭曲型改写,并在受控的生成式搜索工具中针对三个受害LLM进行评估。配对设计将错误信息效应与GEO可见性提升分离开来,这是先前基准测试所缺乏的方法论区别。

  2. 部署的护栏漏掉此类威胁的实证证据。 使用Counter-GEO-Bench,我们表明没有任何基线防御能将ASR降低超过3.2个百分点;Granite Guardian的降低在统计上不显著;而NeMo Self-Check与攻击负相关,阻止了干净查询却放行了错误信息。

  3. 一个表明威胁可处理的基准基线。 我们提出了C-GEO Guard,一个块级对比检测器,它以近乎为零的效用损失相对降低了47.6%的ASR(绝对降低26.5个百分点)。在由GPT 5.5改写的全部247个查询上,同一护栏实现了60.4%的相对降低,超过了在Sonnet评估集上的48%。因此,检测信号可以跨改写模型泛化。

图1:基准构建流水线。从1,000个GEO-Bench查询-来源对开始,改写器生成攻击元数据和配对的IP/ID改写。质量门保留通过两个条件的250对。经过排除三个有缺陷实例的人工验证后,最终基准由247个实例组成。

2 相关工作

生成式引擎优化。 GEO(Aggarwal等人,2024)引入了帮助网页发布者通过结构化和风格化技术(如引用钩子和权威措辞)提高其在LLM生成答案中可见性的优化策略。Parry等人(2024)表明,基于Transformer的神经排序器表现出可利用的位置偏差,从而能够实现与查询无关的攻击,跨主题提升任意内容,而无需针对特定查询。Chen等人(2026)发现,传统的黑帽SEO大部分在检索阶段被阻止(98.2%过滤),但面向LLM的策略仍然到达摘要阶段。我们的基准Counter-GEO-Bench建立在GEO-Bench语料库之上,以评估当这些优化技术携带错误信息时的防御措施。

检索增强生成投毒。 PoisonedRAG(Zou等人,2025)表明,注入检索语料库的少量对抗性文档可以通过操纵检索上下文可靠地破坏RAG输出(Lewis等人,2020)。Tamber和Lin(2025)进一步表明,内容注入攻击——将任意句子插入相关段落或将查询词插入非相关段落——能够欺骗检索器、重排序器和LLM相关性判断器(覆盖嵌入模型、交叉编码器和生成式模型)。RAGuard(Kolhe等人,2025)提出了一种针对此类投毒的通用防御措施。Counter-GEO-Bench在GEO优化错误信息威胁模型下评估防御措施,其中攻击以流畅、结构良好的网页内容形式到达,而非对抗性扰动。

安全护栏。 在审查了公开可用的护栏框架和RAG防御措施后,我们选择了三种可能检测GEO错误信息的现成基线。Granite Guardian(Padhi等人,2025)对检索到的块应用危害标准分类,Llama Guard 3(Inan等人,2023;Grattafiori等人,2024)使用安全分类法分类器过滤不安全内容,而NeMo Guardrails(Rebedea等人,2023)包括Self-Check Fact-Checking输出护栏,它验证生成的响应是否基于检索到的证据。

安全基准。 HarmBench(Mazeika等人,2024)提供了一个标准化评估框架,用于跨多种攻击类型的LLM自动化红队测试。CREST-Search(Ou等人,2026)在网页增强型LLM中基准测试了提示注入和对抗性查询攻击,而Unsafe LLM-Based Search(Luo等人,2025)评估了由LLM生成的搜索摘要引起的安全风险。Hu等人(2024)在对抗性构造的事实性问题下评估了黑盒生成式搜索引擎。相比之下,Counter-GEO-Bench针对的是通过检索文档引入的GEO优化错误信息,具有配对的效用测量和可重用的防御工具。

3 基准设计

3.1 威胁模型

我们建模了一个控制网页内容的黑盒攻击者,通过博客、评论网站或大规模一次性域名发布经过GEO优化的文档,依赖于生成式搜索系统来检索和综合这些文档。该威胁模型与典型的对抗性查询攻击不同之处在于,用户查询完全保持良性,而恶意内容通过正常的检索路径进入流水线,用户无法察觉。

攻击者不控制下游生成式搜索流水线,其中护栏可能在检索、上下文过滤或生成后阶段应用。有效的防御措施能在不无差别地压制来自合法发布者的优化内容的情况下减少错误信息。

3.2 基准构建

由于GEO-Bench训练集仅包含查询,Counter-GEO-Bench使用其测试集,该测试集包含1,000个查询,每个查询配对了五个来自Google顶级搜索结果的清理过的HTML来源(Aggarwal等人,2024)。我们使用Claude Sonnet 4.6作为基准改写器。对于每个查询,它首先生成包含目标虚假主张、评估规则和提议的基准事实的元数据,然后以两种方式改写一个目标来源,同时保持其他来源不变。对于信息扭曲条件,我们通过将来自权威域名(如Wikipedia、.gov或.edu)的URL改写为类似博客或评论网站来源的URL,来避免不切实际的来源权威性。IP和ID改写的提示模板见附录A:

  • 信息保留型(IP):GEO优化(更清晰的结构、权威措辞、引用钩子),保留所有原始事实。这代表了合法发布者的优化。

  • 信息扭曲型(ID):相同的GEO优化强度,加上通过捏造的权威、虚假引用、时间框架和结构化格式以多种措辞注入的目标虚假主张。这代表了错误信息攻击。ID改写被分配一个或多个来自改写模板的攻击类别标签;完整类别列表见附录A.2。

配对设计是核心:因为IP和ID改写源自相同的源文档并在相同的查询上进行评估,该基准将错误信息效应与GEO可见性提升分离开来。

图2:生成式搜索工具与防御插入点。对于每个用户查询,五个来源被分块,使用混合BM25+稠密检索进行检索,并在由受害LLM合成之前进行重排序。块级防御在生成之前过滤检索到的上下文,而NeMo的Self-Check Fact-Checking输出护栏则根据检索到的证据检查生成的答案。

质量门。 质量门将基准限制为现实攻击者可能部署的似是而非的改写。每个改写获得一个质量分数Q,计算为四个子分数的几何平均值:(1)条件依赖的嵌入相似度,(2)长度偏差,(3)相对于参考语言模型(LM)(Allal等人,2025)的困惑度比率,以及(4)LLM评判的自然度。仅当Q≥ 0.65时,改写才进入基准。任何零子分数都会使总分归零;附录表8给出了完整的分段分数和阈值。

表1:1,000查询构建集上的质量门通过率。通过两个门的查询构成评估语料库。

条件

通过率

N

IP通过

59.7%

597

ID通过

26.9%

269

联合通过

25.0%

250

表1报告了通过率。联合通过率(25.0%)是保守设计的:它降低了攻击结果被模板化文本夸大的可能性,这种文本可能会被上游搜索或索引过滤器拒绝。

人工验证。 我们手动检查了通过两个门的250个查询的LLM生成材料,包括目标虚假主张、每个查询的攻击成功标准和提议的基准事实。删除了三个查询:两个具有不合理的攻击成功标准,一个具有不正确的基准事实,得到N= 247个基准实例(附录C)。

3.3 生成式搜索工具

生成式搜索工具(图2)模拟了一个已部署的生成式搜索流水线。文档被分块为512个令牌的窗口,重叠128个令牌。检索结合了BM25和稠密BGE-large-en-v1.5嵌入(Xiao等人,2024),以0.3/0.7的混合比例进行,返回最多50个候选,由BGE交叉编码器重排序为最终的top-12上下文。一个由vLLM提供服务的(Kwon等人,2023)受害LLM在温度为零的情况下生成必须包含引用的答案。

在每个查询中,只有目标文档在不同条件下有所不同:干净(原始文本)、IP(信息保留型优化)和ID(信息扭曲型优化)。四个非目标文档保持不变。

评估了三个受害LLM:

  • Gemma-4-31B-IT(Google DeepMind,2026):一个31B参数指令微调模型。

  • Qwen-3.5-35B-A3B(Qwen Team,2026):一个35B参数混合专家(MoE)模型。

  • Llama-4-Scout-17B-16E(Meta,2025):一个17B参数16专家MoE模型。

3.4 评估指标

攻击成功率(ASR)。 一个LLM评判员根据每个查询的攻击成功标准,评估在信息扭曲型(ID)改写下生成的答案。它分配1.0(完全成功:答案断言了虚假主张,没有含糊其辞)、0.5(部分成功:主张与真相一起出现或被含糊其辞)或0.0(失败:答案事实上正确)。

假阳性率(FPR)。 对于块级防御,FPR是被错误标记的干净或IP块的比例。对于答案级防御,它是被拒绝的干净或IP查询的比例。我们分别报告干净和IP条件下的FPR。

答案准确率。 答案准确率在干净和IP条件下测量。与ASR类似,LLM评判员将每个答案分类为正确(1.0)、部分正确(0.5)或不正确(0.0)。我们将整个评估实例的平均得分报告为百分比。

答案质量。 除了准确率,我们还使用相同的LLM评判员,将答案质量作为与信息正确性不同的维度进行测量。质量在相关性、完整性和清晰度上以1-5分制评分,最终质量分数为其平均值。

4 防御方法

4.1 现成护栏

我们使用Counter-GEO-Bench评估三种现成护栏:

Granite Guardian(Padhi等人,2025)。 IBM的Granite Guardian 3.3-8B作为块级过滤器应用在重排序之后。每个top-k块在危害标准下进行分类;被评为不安全的块在合成之前被移除。

Llama Guard 3(Inan等人,2023;Grattafiori等人,2024)。 Meta的Llama Guard 3-8B以相同的块级过滤接口应用。每个块通过安全分类法分类器;标记为不安全的块被丢弃。

NeMo Self-Check Fact-Checking。 我们复现了NVIDIA NeMo Guardrails的Self-Check Fact-Checking输出护栏的记录行为(Rebedea等人,2023)。在受害LLM生成草稿后,同一模型判断响应是否基于检索到的块并从中蕴含;不支持发布的草稿被替换为拒绝响应。

表2:防御配置。Granite Guardian、Llama Guard 3和C-GEO Guard操作于检索到的块;NeMo Self-Check Fact-Checking是作用于生成答案的输出护栏。

防御

参数量

阶段

无防御

Granite Guardian

8B

块过滤器

Llama Guard 3

8B

块过滤器

NeMo Self-Check Fact-Checking

victim*

输出护栏

C-GEO Guard

0.18B

块过滤器

*NeMo使用受害LLM(17–35B)本身作为其验证器。

4.2 C-GEO Guard

Granite Guardian、Llama Guard 3和NeMo Self-Check测试现有的通用护栏是否能检测到信息扭曲型GEO。为了提供一个面向GEO的参考防御,我们引入了C-GEO Guard,一个轻量级的块级检测器,训练用于区分ID GEO改写与配对的IP改写和干净文本。其作用是使Counter-GEO-Bench具有可操作性:未来的防御可以同时与现成护栏和专为信息扭曲型GEO设计的C-GEO检测器进行比较。

架构。 C-GEO Guard是一个基于DeBERTa-v3-base(He等人,2023)构建的句子嵌入模型(1.84亿参数)。对上下文化的令牌嵌入进行均值池化,产生一个768维的L2归一化块嵌入e。在对比微调之后,我们为每个ID-GEO攻击类别*k*计算一个原型质心cₖ,使用改写生成期间分配的类别标签。一个文档可能带有多个标签,其块对每个指定类别的质心有贡献:

其中Sₖ是属于类别*k*的训练块集合,eᵢ是训练块*i*的嵌入,cₖ是类别*k*的归一化质心。在推理时,候选块嵌入e通过其与任何类别质心的最大余弦相似度进行评分,score(e) = maxₖ eᵀcₖ,并在score(e) ≥ τ时被阻止,其中τ是检测阈值(附录E)。

训练过程。 我们使用多负例排序损失(MNRL)对编码器进行微调。每个训练示例将ID块作为正例,并使用非ID块作为负例。这些负例来自同一源文档中的配对IP块、其他文档中的IP块、边界ID改写和干净块。这训练模型将ID改写中的操纵模式与合法的GEO优化和普通的干净文本区分开来。

训练数据。 训练池来自未进入基准的750个查询:731个未通过ID门,19个未通过IP门。ID侧保持门控:对于原始ID改写未通过的731个查询,我们根据每个文档的失败原因指导重新生成新的ID改写。总共,750个候选ID改写中有326个通过并成为正例。我们保留这些组装好的正例文档的10%用于阈值校准,留下293个正例文档用于训练。

对于负例,我们不向IP改写应用质量门,因为它们的质量变化有助于定义非ID边界。配对的IP硬负例仅来自相同的326个组装条目,在训练前应用相同的10%保留。我们还包括约18个与原始文档余弦相似度>0.98的边界ID改写作为近边界负例。干净的简单负例来自训练池中所有750个查询,而非仅来自326个组装正例,使得干净池比正例池大约大9倍。完整的训练细节见表12。

5 实验

5.1 设置

所有实验均使用247个查询的评估集(第3.2节)。对于每个受害模型,所有防御共享相同的工具;仅防御干预不同。我们使用Claude Opus 4.6作为评判员,并在所有条件下保持其提示、模型版本和解码配置固定。我们在ID条件下计算ASR,并在干净和IP条件下测量假阳性和准确率。结果按受害模型报告,并取三个受害模型的平均值。

我们针对每个受害模型的50个模型-查询实例的分层样本,在两个人工标注员上验证Opus 4.6,这些样本在三个Opus分配的ASR级别上保持平衡(附录D)。Opus与人工标注员1和人工标注员2之间的一致性分别为κ=0.739和0.869(线性加权κ_w=0.798和0.897),而人工-人工一致性为κ=0.727(κ_w=0.784);所有三位评分者之间的Fleiss' κ为0.778。这些结果表明,对于Counter-GEO-Bench中使用的三分类攻击成功标签,Opus评判员是可靠的。

5.2 攻击缓解结果

ASR点估计附带95%百分位数自助法置信区间,通过10,000次自助重采样计算。对于配对防御比较,我们使用配对自助法检验,通过对查询进行一次重采样,并将相同的重采样集应用于两种防御,然后计算ASR差异。当95%置信区间排除零时,我们认为差异在0.05水平上显著。每个单元的ASR置信区间和配对检验见附录G。

表3:三个受害LLM和四种防御在ID条件下的攻击成功率(ASR,%)和答案质量(Q̄)(N=247)。Δ_rel:相对于无防御的相对变化。Q̄:相关性、完整性、清晰度的均值(1-5分)。粗体:每个模型的最低ASR。†由于98.4%的干净阻止率,Llama-4上的NeMo被排除在3模型平均值之外。‡仅Gemma-4 + Qwen平均值。95%自助法置信区间见附录G。

防御

Gemma-4-31B

Qwen-3.5-35B

Llama-4-Scout

3-模型平均

ASR

Δ_rel

ASR

Δ_rel

ASR

Δ_rel

ASR

Δ_rel

无防御

56.5

55.9

54.7

55.7

4.49

Granite Guardian

51.4

-9.0%

53.8

-3.8%

56.9

+4.0%

54.0

-3.1%

4.37

Llama Guard 3

51.8

-8.3%

51.4

-8.1%

54.3

-0.7%

52.5

-5.7%

4.38

NeMo Self-Check

50.2

-11.2%

52.0

-7.0%

†0.4

-99.2%

51.1‡

-9.1%‡

4.51‡

C-GEO Guard

30.6

-45.8%

29.4

-47.4%

27.5

-49.7%

29.2

-47.6%

4.48

图3:不同防御和受害LLM在ID条件下的ASR(%)(N=247)。现成护栏聚集在无防御基线附近;C-GEO Guard在所有模型上将ASR相对降低约48%。† Llama-4上的NeMo被排除(98.4%干净阻止率)。

表3和图3展示了所有防御和受害模型的ASR和答案质量(附录H;附录I)。无防御流水线实现了55.7%的三模型平均ASR(95%置信区间[CI]:[53.1, 58.2]):超过一半的质量门控单文档攻击使生成答案偏向目标虚假主张。

没有现成护栏提供有意义的保护。Granite Guardian将平均ASR降低了1.7个百分点,这一差异在统计上不显著(p=0.096,配对自助法;差异的95% CI:[-0.7, 4.0]个百分点)。Llama Guard 3实现了显著但操作上可忽略不计的3.2个百分点降低(+p<0.001)。NeMo Self-Check不能可靠地识别受攻击案例。使用Qwen时,它阻止了3.24%的ID条件输出,同时拒绝了4.86%的干净条件输出。使用Llama-4时,它拒绝了几乎所有条件下的输出,包括98.4%的干净输出,因此我们将该单元从报告的平均值中排除(附录J)。

C-GEO Guard处于不同的机制。拥有1.84亿参数(Granite Guardian和Llama Guard使用的80亿参数的2.3%),它将平均ASR相对降低了47.6%(绝对降低26.5个百分点;差异的95% CI:[23.8, 29.3]个百分点;p<0.001;附录G)。在Llama-4上,其表现最佳,ASR从54.7%降至27.5%,相对降低49.7%。按类别的降低见附录K。答案质量(Q̄)保持稳定:C-GEO防御的答案平均为4.48(1-5分制),而无防御为4.49。

5.3 非受攻击性能

表4:不同条件下的块级阻止率(%)(N_chunks ≈ 每个条件2,780个)。ID阻止率是信息扭曲块上的比率。

防御

干净

IP

ID阻止率

Granite Guardian

0.43

0.29

0.61

Llama Guard 3

0.65

0.47

0.83

C-GEO Guard

2.30

2.16

10.27

表4报告了块级阻止率。Granite Guardian和Llama Guard在所有条件下都具有接近零的阻止率,包括ID——它们标记了不到1%的信息扭曲块。这解释了它们微不足道的ASR降低:防御措施很少干预。C-GEO Guard阻止了10.3%的ID块,同时标记了2.3%的干净块和2.2%的IP块,ID/干净阻止率比率为10.3/2.3 = 4.5倍。相比之下,安全分类法过滤器实现了0.6/0.4 = 1.4倍(Granite)和0.8/0.7 = 1.2倍(Llama Guard),仅略高于随机。

表5:每个受害模型在干净和IP条件下的答案准确率(%)(N=247)。准确率 = (yes + 0.5·partial) / N × 100%。Δ:相对于无防御基线的百分比点差异。Avg. Δ 计算所有干净和IP单元的平均准确率变化。

Gemma-4-31B

Qwen-3.5-35B

Llama-4-Scout

Avg. Δ

防御*

干净 Acc

Δ

IP Acc

Δ

干净 Acc

Δ

IP Acc

Δ

干净 Acc

Δ

IP Acc

Δ

无防御

86.6

88.1

88.9

87.9

82.4

83.0

Granite

87.2

+0.6

86.2

-1.9

89.3

+0.4

89.3

+1.4

80.6

-1.8

83.2

+0.2

-0.2

Llama

84.0

-2.6

87.4

-0.7

87.2

-1.7

88.1

+0.2

85.6

+3.2

85.0

+2.0

+0.1

NeMo

82.0

-4.6

81.8

-6.3

85.6

-3.3

87.0

-0.9

1.8

-80.6

1.4

-81.6

-29.6

C-GEO

84.8

-1.8

86.4

-1.7

89.7

+0.8

88.7

+0.8

84.0

+1.6

84.2

+1.2

+0.2

*防御名称缩写:Granite = Granite Guardian;Llama = Llama Guard 3;NeMo = NeMo Self-Check Fact-Checking;C-GEO = C-GEO Guard。

表5报告了每种防御下的答案准确率。Avg. Δ列总结了所有干净和IP单元的平均准确率变化。C-GEO Guard具有最佳的效用特征,平均变化仅为+0.2个百分点,而Granite Guardian和Llama Guard 3仍接近无防御设置(分别为-0.2和+0.1个百分点)。相比之下,NeMo Self-Check平均为-29.6个百分点,因为它在Llama-4上崩溃,干净准确率从82.4%降至1.8%。

在干净和IP条件下,综合答案质量分数仍接近无防御基线(附录表22)。

5.4 C-GEO Guard的跨改写器迁移

为了测试C-GEO Guard是否能泛化到训练时使用的改写器之外,我们使用GPT 5.5,以相同的GEO优化指令重写了247个基准查询-文档对。Qwen-3.5作为受害模型。

表6报告了攻击侧的迁移结果。在固定τ=0.90(在原始校准集上选择的值)的情况下,C-GEO Guard在GPT 5.5改写上将ASR从55.7%降低到22.1%,相对降低60.4%(配对Δ=33.6个百分点;95% CI:[28.7, 38.2];p<0.001)。IP FPR为2.80%,略高于主基准上的2.16%,IP准确率从86.8%降至82.6%(附录表13)。这些结果表明,尽管固定阈值在GPT 5.5改写上给出了不太有利的效用特征,但检测器保留了Sonnet之外的有用信号。由于改写器身份对防御者不可用,部署需要针对异构改写器校准的单个阈值,而非针对特定改写器的调整。所有247个改写都在没有质量门过滤的情况下进行评估。质量门敏感性分析发现,跨阈值的ASR相对降低稳定在58-61%(附录L),表明攻击侧结果并非由质量门选择驱动。

表6:跨改写器迁移:在247个GPT 5.5改写的查询上的ASR(Qwen受害,无质量门)。Δ_rel:相对于无防御的相对变化。

防御

ASR (%)

Δ_rel

ID阻止率 (%)

无防御

55.7

C-GEO Guard

22.1

-60.4%

9.8

6 分析

6.1 迁移到独立编写的模板

主要的跨改写器实验(第5.4节)更改了改写器,同时保留了原始攻击模板。我们进一步使用一个独立编写的GPT 5.5模板测试了C-GEO Guard,该模板省略了攻击类别标签、质量门提示以及在至少三个地方重复目标虚假主张的要求。我们评估了所有247个改写,无质量门过滤,使用Qwen-3.5作为受害模型。

表7比较了两种设置。在原始Sonnet模板下,C-GEO Guard实现了47.4%的相对ASR降低。在独立编写的GPT 5.5模板下,它实现了32.0%的相对降低(16.2个百分点),而IP准确率提高了1.3个百分点。较小的降低可能反映了较弱的攻击约束:与原始模板不同,独立模板不要求虚假主张至少出现在三个地方。这些结果表明,C-GEO Guard检测到的操纵模式超出了原始模板结构。

表7:迁移到独立编写的模板(Qwen-3.5,N=247)。Sonnet行复现了主表结果;GPT行使用独立编写的模板,无质量门过滤。Δ_rel:每种设置中相对于无防御的ASR相对变化。

设置

防御

ASR (%)

IP Acc (%)

Δ_rel

Sonnet

无防御

55.9

87.9

C-GEO

29.4

88.7

-47.4%

GPT

无防御

50.6

87.0

C-GEO

34.4

88.3

-32.0%

6.2 配对设计暴露了防御失败模式

在三个受害模型上评估的配对干净/IP/ID设计揭示了仅攻击或单模型评估会遗漏的失败模式。只有17.2%的查询在三个受害模型上产生完全成功的攻击,而55.2%显示模型分歧。

防御即放大器。 在Llama-4上,Granite Guardian使74个查询的结果恶化,同时仅改善了57个,尽管在某些查询上降低了ASR,但总体为负效应。在74个恶化的案例中,29个安全查询(ASR 0.0)升级为部分或完全成功,45个部分查询升级为完全成功。Chen等人(2026)表明,传统SEO在检索阶段被阻止,因为有害内容在形式上与干净内容可区分;放大器效应表明,当过滤器在安全分类法上操作而攻击内容在主题上合法时,这种假设被打破。移除与虚假主张相矛盾的干净块消除了跨来源分歧并加强了攻击。

负相关的自检。 在Qwen上,NeMo阻止了12个干净查询,同时阻止了8个ID查询——其阻止与攻击存在无关。在Llama-4上,它阻止了所有条件下98.4%的查询。没有配对条件,NeMo在Llama-4上的0.4% ASR看起来像是有效的防御,而非近乎完全的拒绝。

6.3 错误信息降低答案质量

尽管评估标准将ASR和质量评分为正交维度(第3.4节),数据揭示了一种反比关系。跨模型汇总(无防御),ASR为1.0的答案在相关性/完整性/清晰度综合评分上得分为4.29,而ASR为0.0的答案得分为4.70。一个可能的原因是,坚持虚假主张缩小了响应范围,并压制了高质量答案特征的平衡性含糊。与假设攻击成功独立于输出质量的检索投毒评估(Zou等人,2025)不同,基准的正交质量评分使质量变化可测量。

这有一个实际意义:当C-GEO Guard将查询从ASR 1.0翻转为0.0时,质量得到恢复。在Llama-4上,40个完全翻转的查询在相关性上获得0.70的提升,在完整性上获得0.70,在清晰度上获得0.58。移除错误信息块恢复了输出质量,而非降低它。仍然穿透的攻击(以前成功的攻击中有40%仍处于ASR 1.0)比被阻止的攻击质量得分更低(3.97 vs 4.47),表明剩余攻击依赖于直接内容替换,而非流水线标记的结构化GEO模式。

7 讨论

构建流水线作为可重用资源。 构建流水线在基准本身之外也很有用,因为失败的基准候选仍然可以提供防御数据。关键在于不对称地重用它们:将IP改写保留为硬负例,但要求ID改写通过质量门才能被视为正例。这使C-GEO Guard获得了一个训练集,该训练集在相同源材料上将恶意GEO操纵与良性优化区分开来。由此产生的1.84亿参数检测器在主基准上将ASR相对降低48%,其在GPT 5.5改写上的60.4%降低表明信号不仅仅是Sonnet特定的措辞。相同的配方可以在另一个语料库上重新运行,以产生本地防御数据,而无需手动标记每个示例。

残余攻击与未来方向。 有25个查询在所有三个模型和所有非C-GEO防御下产生ASR 1.0。与注入的段落可能从周围有机内容中突出的普通投毒设置不同,我们的ID-GEO改写经过质量门控,类似于普通的源文档。C-GEO Guard在每个模型上捕获36-40%的这些;剩余案例指出了需要更强防御的地方。跨来源分歧量化、外部事实核查和基于来源的过滤可能是Counter-GEO-Bench设计用于评估的补充方向。

8 结论

我们提出了Counter-GEO-Bench,一个针对信息扭曲型生成式引擎优化的防御基准测试。在三个受害LLM上,现成护栏将ASR降低不超过3.2个百分点,而Granite Guardian的降低在统计上不显著。这表明安全分类法过滤器和同上下文蕴含检查对于GEO优化的错误信息是不够的。与此同时,C-GEO Guard表明该威胁是可处理的:一个轻量级的对比块级检测器在不产生可测量效用损失的情况下将ASR相对降低48%(绝对降低27个百分点),并迁移到保留的改写器上,实现了60.4%的相对降低。我们发布了代码、基准工具和基准数据,以支持未来关于面向GEO的防御工作。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/15 9:23:50

学术写作AI工具:提升论文效率的五大神器

1. 学术写作的AI工具革命去年帮导师审稿时&#xff0c;我发现超过70%的投稿论文都在致谢部分提到了AI辅助工具。这让我意识到&#xff0c;学术写作正在经历一场静悄悄的技术革命。不同于早期简单的语法检查&#xff0c;如今的AI工具已经能深度参与文献综述、数据可视化、引文格…

作者头像 李华
网站建设 2026/9/15 9:22:30

2026年1至9月南京市房地产价格深度分析报告

一、报告背景与数据说明本报告基于2026年1月至9月南京市房地产市场实际成交案例&#xff0c;从成交价格、区域分布、户型结构、购房人群等维度进行深度分析&#xff0c;力求为购房者、开发商及研究机构提供客观、可参考的市场研判依据。数据来源主要包括&#xff1a;南京市网上…

作者头像 李华
网站建设 2026/9/15 9:20:07

自定义事件与通信机制

3.8 自定义事件与通信机制浏览器原生事件体系仅覆盖浏览器内置的交互与状态事件&#xff0c;自定义事件则允许开发者根据业务需求定义专属事件类型&#xff0c;配合事件驱动模式实现模块间、组件间的解耦通信。自定义事件完全复用原生事件流机制&#xff0c;结合发布订阅模式封…

作者头像 李华
网站建设 2026/9/15 9:18:17

无人机航拍库区巡检:目标检测与裂缝识别的完整技术链路复盘

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/15 9:17:44

Wireshark抓包实战:从网卡捕获到协议拆解的全链路解析

1. 为什么Wireshark不是“点开就能用”的万能钥匙——从一次真实误判说起Wireshark抓包实战&#xff1a;流量分析、协议拆解、异常流量识别&#xff0c;这十个字背后藏着太多人踩过的坑。我第一次用Wireshark排查线上服务响应延迟时&#xff0c;就犯了个典型错误&#xff1a;看…

作者头像 李华