news 2026/9/28 19:47:07

检索索引也能自我进化?三星延世等提出SELF-INDEX

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
检索索引也能自我进化?三星延世等提出SELF-INDEX

Self-Evolving Search Index

作者:Sangam Lee, Wonjae Lee, Sunghwan Kim, Deogyong Kim, Jaehoon Kim, Daye Nam, SeongKu Kang, Dongha Lee
核心发表机构:Yonsei University、Samsung Research、University of California, Irvine、Korea University
论文链接:arXiv:2609.19656v1
发布于:arXiv 预印本(cs.IR)

|—|—😐—😐
| Sparse BM25 | BM25 | 14.5 | 0.0% |
| | +Doc2Query | 14.6 | +1.0% |
| | +SPIKE | 15.1 | +4.2% |
| | +RL-Index | 15.8 | +9.2% |
| |+Self-Index|20.4|+40.4%|
| Dense BGE | BGE | 13.9 | 0.0% |
| | +Doc2Query | 13.0 | -6.2% |
| | +SPIKE | 15.3 | +9.8% |
| | +RL-Index | 15.4 | +10.4% |
| |+Self-Index|21.8|+57.0%|
| Qwen3-Emb-8B | 基础索引 | 18.8 | 0.0% |
| | +Doc2Query | 19.2 | +1.9% |
| | +SPIKE | 21.2 | +12.8% |
| | +RL-Index | 20.5 | +9.1% |
| |+Self-Index|26.1|+38.8%|

关键观察有三点。其一,Self-Index 在每一种检索器上都取得最高平均分,提升幅度相对于竞争方法有量级上的差别:BM25 上从 +9.2% 提升到 +40.4%,BGE 上从 +10.4% 提升到 +57.0%。其二,Self-Index 在三种语料类型(自然语言、代码、数学)下也都是最高分,这与动机部分的论断一致——固定策略无法在多样环境中一致有效,而针对环境进化的索引可以。其三,竞争方法的表现模式恰恰印证了"环境依赖":Doc2Query 在 BM25 表格检索上大幅提升,但在代码语料上下降;在 BGE 上甚至整体低于基础索引(-6.2%)。这类"在某些环境有效、在另一些环境有害"的现象,正是需要自进化的直接证据。

表格检索。表 2 报告三个数据集上的平均 nDCG@10 与相对提升。

检索器方法Avg.Improv.
Sparse BM25BM2533.2-
+Doc2Query45.5+37.2%
+SPIKE37.0+11.6%
+EnrichIndex47.2+42.4%
+Self-Index49.5+49.1%
Dense BGEBGE45.1-
+Doc2Query43.6-3.2%
+SPIKE49.0+8.7%
+EnrichIndex51.1+13.3%
+Self-Index53.1+17.9%
Qwen3-Emb-8B基础索引49.0-
+Doc2Query45.5-7.1%
+SPIKE50.1+2.2%
+EnrichIndex54.5+11.2%
+Self-Index57.0+16.2%

在表格这一结构化内容形态上,Self-Index 同样在所有数据集与所有检索器上取得最高平均分,且持续超过最强基线 EnrichIndex。值得注意的是 Doc2Query 的行为反转:在稀疏检索下它带来 +37.2% 的大幅提升,但在密集检索与 Qwen3-Emb-8B 下反而造成下降,这再次说明"伪查询拼接"这类固定策略对环境的敏感性。

搜索智能体端到端性能。在 BrowseComp-Plus 上,比较三种索引条件(基础索引、Self-Index 演化索引、SPIKE 构建索引),并参考无索引的 DCI 方法。代表性答案准确率结果如下:GPT-OSS-120B + BM25 上基础索引为 31.08、SPIKE 为 43.37(+39.54%)、Self-Index 为 58.92(+89.53%);GPT-5.4-nano + BM25 上为 36.51 / 47.59(+30.35%)/ 64.94(+77.87%);Kimi-K2.5 + BM25 上为 50.96 / 62.17(+22.00%)/ 71.93(+41.13%)。在稠密检索下提升幅度收窄但不改方向:GPT-5.4-nano + Qwen3-Emb-8B 上 SPIKE 与基础索引持平(52.17,0.00%),Self-Index 为 59.28(+13.63%);Gemini-3.7-Flash 与 Kimi-K2.5 配稠密检索时,SPIKE 甚至略低于基础索引(-1.58%、-1.40%),而 Self-Index 仍为正增益。除准确率外,Self-Index 在所有设置下都取得最高证据召回,通常降低校准误差,并一致减少搜索调用次数;SPIKE 则会在部分情况下增加搜索调用。例如 GPT-OSS-120B + BM25 上,搜索调用从基础的 21.16 降到 SPIKE 的 17.78(-15.97%)与 Self-Index 的 16.62(-21.46%),校准误差从 42.05 降到 40.00(-4.88%)与 26.20(-37.69%)。

在线成本效率。论文依据 token 使用量与 backbone 特定 API 价格估算在线成本。

该图展示了在 BrowseComp-Plus 全部评测集上的答案准确率与估计 API 成本之间的关系:使用 Self-Index 的搜索智能体在提高准确率的同时降低在线成本,甚至可以以较弱的 backbone 达到使用更强 backbone 加基础索引的智能体相当的准确率。具体地,GPT-5.4-nano + BM25 + Self-Index 达到与使用相同 backbone 的 DCI 相当的准确率而在线成本更低。论文进一步指出,基于索引的搜索智能体通常在线成本低于 DCI,但任务性能较低;Self-Index 缓解了这一权衡,在任务性能接近的同时强化了成本优势,这一点也与搜索调用次数的下降相互印证。

语料规模鲁棒性。遵循 DCI 的语料扩展设置,把 BrowseComp-Plus 语料扩展到 100K、200K、400K 文档,每个规模下用 GPT-5.4-nano 搜索智能体 + BM25 比较 Self-Index 与 SPIKE,并与 DCI 参照对比。趋势是:Self-Index 的答案准确率随语料扩大保持稳定,每查询在线成本相对 100K 基线略微降低;SPIKE 的准确率低于其自身基线,在线成本随语料增大而上升;DCI 的准确率急剧下降、成本大幅上升,对语料增长的敏感度明显高于两种基于索引的方法。需要说明的是,该分析的图报告的是相对各方法自身 100K 基线的相对百分比变化(准确率变化是相对百分比而非百分点差),且由于 DCI 的规模结果取自其原文、使用不同的智能体配置与不同的问题子集,该分析只比较各方法相对自身基线的变化,不比较跨方法的绝对准确率或成本。

智能体记忆利用率。表 4 在 LongMemEval-V2 上比较三种检索式记忆系统在替换索引前后的表现。

方法StaticDynamicWorkflowGotchasOverallImprov.
Query → Slice0.5600.5230.5540.2760.415-
+Self-Index0.6120.6400.6620.2410.472+13.9%
Query → Slice+Notes0.6040.5810.6350.3100.448-
+Self-Index0.6490.6510.7160.3100.503+12.4%
AgentRunbook-R0.7310.7330.6350.2760.532-
+Self-Index0.7840.7440.7840.2760.581+9.2%

由于实验只演化检索键、不改动存储的记忆内容,且使用相同的 LLM reader 基于检索到的记忆条目生成答案,所以这一提升可以归因于检索过程能否浮现已存于记忆条目中的信息,而不是记忆内容被改写。提升一致出现在 Static、Dynamic、Workflow 三类能力上;Gotchas 提升不明显,论文的解释是 Gotchas 更依赖记忆系统如何把过去交互处理成有用的记忆内容,而非检索能否找到它。因为 Self-Index 只修改检索键,它与记忆如何构建和组织基本正交,可以叠加到不同的记忆设计之上。

4.3 消融实验 / Ablation Study

Optimizer 组件消融。表 5 在 BRIGHT 上按语料类型报告 nDCG@10,每个语料类型的 Avg. 是三种检索器分数的等权平均,Δ \DeltaΔ为相对完整框架的变化(单位为点)。所有消融都独立施加于完整框架,验证类消融保留 Self-Diagnosis 与 Self-Revision 的指令与输入构造(包括共检索画像),只在"是否接受一次修订的验证检查"上不同。

配置NL Avg.Δ \DeltaΔCode Avg.Δ \DeltaΔMath Avg.Δ \DeltaΔ
Self-Index(完整)26.6—22.1—17.2—
w/oC k \mathcal{C}_kCk​19.7-6.916.7-5.415.9-1.3
w/o Validation16.1-10.513.0-9.111.9-5.3
w/o Faithfulness21.0-5.618.1-4.015.6-1.7
w/o Specificity20.6-6.016.1-6.113.0-4.3
w/o Separation23.9-2.716.8-5.312.1-5.1
w/o Dissimilarity22.2-4.418.5-3.614.8-2.4

这张表提供了四条结论。第一,去掉 Self-Diagnosis 中的共检索画像C k \mathcal{C}_kCk​(同时移除 Self-Revision 输入侧的 competing-key 上下文,但保留验证侧所需的画像),所有语料类型的平均 nDCG@10 都持续下降,说明有效的索引优化不能只看目标文档及其当前键,还必须看这些键在索引中与其他键一起被检索的方式。第二,三条验证准则中任意去掉一条都会在所有三种语料类型上造成下降,说明每一条都有独立贡献:Faithfulness 在代码与自然语言上损失较大,Specificity 损失最为均匀,Separation 在数学与代码上损失突出。第三,完全去掉验证阶段、接受所有提出的修订时,下降最为严重(NL -10.5、Code -9.1、Math -5.3),并且在每种语料类型上都低于基础索引——这意味着不加验证的"自我修订"会主动破坏索引,验证不是锦上添花而是避免退化的必要环节。第四,去掉 Self-Exploration 中的 Dissimilarity 过滤也会一致降低平均 nDCG@10,说明持续探索彼此不同的新检索需求对索引演化有实际价值;需要注意的是,该变体与完整框架使用相同数量的查询、batch size 与优化预算,但"匹配被接受查询的预算"并不等于"模拟成本相同",因此论文把生成成本与过滤成本分开记账。

查询来源对比。Optimizer 也可以使用用户交互或既有训练数据中的查询来进化索引。论文用 ReasonIR HQ 的预生成合成查询整体替换 Query Simulator,这些查询由 BRIGHT 语料生成,属于语料接地查询源,且不施加 Answerability 检查与 Dissimilarity 过滤,完整 Optimizer 与三条验证准则全部保留;两种条件下批大小均为 128,每数据集最多使用 2,560 条查询。结果显示:使用 ReasonIR 查询时,同一个 Optimizer 在三种检索器下都把整体 nDCG@10 相对基础索引提升,说明索引演化确实可以由独立于本文 Query Simulator 的语料接地查询驱动;但 Query Simulator 提供的查询在每个领域、每种检索器上都取得更高分数。论文对此的解释是,Optimizer 是反应式地改进索引,其演化方向上受所接收查询揭示的检索需求限制,因此查询供给过程本身会影响同一优化器所能获得的增益上限。

分数聚合的对照。Self-Index 在原文键与生成键之间取最大相关性分数,因而不需要分数合并权重;SPIKE 虽然也对 scenario 分数取最大,但会把该最大值与原文分数做加权和(原文档权重 0.7、最高 scenario 权重 0.3)。为了排除"增益只是来自不同的最终评分规则"这一可能解释,论文让 SPIKE 也改用同样的最大分数聚合进行评估,结果 Self-Index 在三种检索器上仍然持续取得更高的平均 nDCG@10,说明其优势并非仅由聚合规则造成。

4.4 索引演化动态与案例研究

逐迭代的演化轨迹。论文在 BRIGHT 中为每种语料类型选一个代表性数据集(Biology、Robotics、TheoremQA-Theorem),用 BGE-Large 在固定测试查询集上评估迭代 0、5、10、15、20 的 checkpoint。结论是 Self-Index 在早期迭代就已超过 SPIKE,并且此后还能继续获得增益,而 SPIKE 在早期迭代后趋于平台。这一差异直接支持了"需要让索引演化超出固定优化策略"的论点:一个策略一旦固定,其收益就有上限;而一个能自主诊断并修订的循环可以持续发现新的短板。评估查询在索引演化期间不可见,且不决定停止点;源文档、相关性判断、排序流程与优化骨干在 checkpoint 之间保持固定。

单文档键集合的演化机理。案例研究追踪了一个金标文档的键集合在迭代中的变化,其典型模式是:金标文档确实包含能解决测试查询信息需求的知识,但该知识嵌入在更宽泛的内容中。迭代 0 时以完整文档文本作为唯一的初始键(K 0 ( d ) = { d } \mathcal{K}_0(d) = \{d\}K0​(d)={d}),检索器难以捕捉相关性,因为其他细节分散了注意力,文档排名靠后;早期迭代把宽泛内容组织为若干独立键,每个键突出不同侧面,文档排名上升,但与查询信息需求相关的知识在这些键中仍是隐式的,排名依然相对靠后;后续迭代中,某个修订后的键更显式地表征了与查询信息需求相关的知识,文档排名接近榜首。

该图给出的正是一个来自 BRIGHT 的生物学案例。测试查询(已压缩)问的是"为什么无名指不能独立移动、为什么小指必须随它一起动",金标文档是描述伸指肌腱的解剖学段落,其源段落只陈述手指肌腱由两条斜行带连接这一结构事实。迭代 0 直接引用该段落,文档排名 63;迭代 6 的键改写为"使伸指肌腱保持在掌骨头正上方以保证杠杆效率的结构组件",排名升到 40;迭代 10 的键变成"手中哪些具体的附着结构造成了外侧手指运动自由度的差异",排名升到第 2 并保持到迭代 20。这个案例清楚展示了 Self-Index 所做事情的实质:它把"源文档所做的事"翻译成"用户所问的需求",把解剖学描述与手指独立运动这一问题连接起来。

12 个案例的共同模式。论文共考察 12 个成功案例,覆盖技术散文、代码、数学、表模式以及先前交互,说明修订后的索引键通过改善文档排名、在 agentic search 中更早定位来源、复用既往经验三种方式,把既有证据所支持的任务暴露出来。除上述生物学案例外,还有若干具有代表性的模式:Robotics 案例中,原始段落只描述"给对象应用纹理",与"在 Gazebo Classic 中加入 ArUco marker 以测试机器人识别"这一任务错配,迭代 12 虽提到 Gazebo 但内容讲墙面纹理模糊,仅平台重叠不足以解决问题,迭代 13 引入 ArUco marker 模型,迭代 15 把"Gazebo"与"ArUco markers"放入机器人应用语境,排名从 84 到 41 再到第 1;另一个 Robotics 案例中,原始代码键从迭代 0 到 13 都在 200 名之外,迭代 14 的键改用"lambda capture 绑定 this 指针以向回调传递额外参数"这一编程概念表达相关性,排名直接跃至第 1。数学案例中,Ramsey 定理的通用定义在迭代 0 到 12 都排不进前 200,迭代 13 的键加入"最小阶数"“2-着色”“4 阶单色完全子图"这三个约束后排名升到第 2;鸽巢原理案例则揭示了一个更微妙的观察——保留原始索引键并不能保证文档在其他键演化时保持相对排名,该文档在迭代 1–5 掉出前 200,直到迭代 6 的新键(直接把"13 个人”“至少两人”“同一个月生日"写入)把它推到第 1 并保持。表格检索案例中,Firebase 分区表从 1,224 名升到第 1(键把表名翻译成"2018 年 9 月用户留存报告"与"由 first-touch 时间戳派生的获取日期”),BEAVER 的keystone#sep#group表从 93 名升到第 1(键改写为user_directory#sep#security_groups,把问题中的两个实体带入表描述)。搜索智能体案例中,在一个需要串联多条传记线索才能识别的电影问题上,使用原索引的智能体 20 次搜索都未检索到金标文档并最终失败,而使用 Self-Index 演化索引的智能体在第 1 次搜索就以第 5 名检索到该文档文档,并在 2 次搜索内正确回答。

需要强调这些案例的分析口径:案例解释的是个体轨迹,总体有效性由主实验评估;索引演化使用 Query Simulator 的查询且不观察评估查询;源文档与存储的记忆内容保持不变;问题在未标注 “full” 时都经过压缩,展示的键是节选,与问题的对应关系以粗体标出,而这些节选不能单独分离出某一条键的贡献。此外,多个案例存在明确的边界条件:某案例检索到的段落支持的是反射性晕厥机制而非低血糖特异性的因果解释;某案例的示例代码并未显式实现所要求的额外参数;Firebase 案例的 Rank 1 只是让相关分区可被取到,完整分析仍需所请求的日期范围;BEAVER 案例的 Rank 1 只提供组属性,确定用户属于哪些组仍需成员关系表。这些边界说明索引优化的目标是让正确的证据变得可检索,而不是替代下游推理或补全缺失的数据关系。

离线效率。论文把每个优化 checkpoint 与其累积 LLM 成本配对,并与 SPIKE 的全语料索引构建成本比较。结果是 Self-Index 在索引演化过程中超过 SPIKE,同时在三个数据集上累积优化成本都更低;在最终 checkpoint,其检索性能更高且累积成本更低。这一成本优势与 Self-Index 的选择性一致:它只修订被识别出检索短板的文档键集合,而 SPIKE 需要为每个文档生成 scenario。成本核算的边界也需说明:离线成本由记录的输入/输出 token 用量估算,包含查询模拟、诊断、修订、验证以及被拒绝的提案与被过滤掉的查询,但不含本地 GPU 的购置与托管成本;在线成本汇总所有智能体调用的输入与输出 token,缓存输入 token 计入输入总量并按 cache-read 费率计费,覆盖范围不含离线索引优化、检索器服务与答案评测。论文还明确指出,搜索调用次数本身并不能决定成本,因为上下文长度、输出长度以及输入 token 的缓存占比在不同运行间会变化。

五、相关工作 / Related Work

索引优化。这一方向可分为两个范式。早期范式依赖人工预定义的策略来扩展或重构文档表示,包括伪查询、摘要、关键短语、命题、多语义视角以及场景化画像等。这类方法的共同弱点是一旦策略对某语料或某检索器不佳,就必须人工重新设计策略。近期范式转向从标注数据中学习策略,减少了人工策略设计,但仍有两个残留缺陷:当某些检索需求支撑不足时,仍需要人提供额外的相关性标注并重跑策略学习;修订后的策略会在全语料上广泛施加,即使只有一小部分索引表示真的需要改进。Self-Index 的差异在于,它直接从检索结果进化索引键,既不需要人工改写策略,也不需要相关性标注,并且选择性只修订与已观测缺陷相关的键。具体到基线层面,Doc2Query 用文档可能回答的预测查询增强表示;SPIKE 把"可能的信息需求"与"文档如何满足该需求的解释"表示为 scenarios 并按权重合并分数;RL-Index 训练一个基于检索强化学习目标的 rationale 生成器;EnrichIndex 构造互补表示并合并检索分数。它们的共同点是策略或权重是预先确定或调优的,而 Self-Index 把"如何表示文档"这一决策本身交给一个能观察到检索后果的循环来处理。

自进化框架。自进化的定义是模型或智能体通过自生成的监督信号与自我交互来改进自身、减少对人的依赖,已在推理模型与智能体系统中被广泛研究。但已有工作聚焦于进化模型或智能体,把自进化应用于索引优化基本未被探索。Self-Index 的定位正是填补这一空白:把自进化范式扩展到索引优化,让索引自身改进其表示。就机制而言,Self-Diagnosis 借用了伪相关反馈"用检索结果作为反馈、无需相关性标注"的思想,但把这一思想从"扩充查询表示"迁移到了"诊断索引键的表征短板"上;Self-Validation 的三条准则则分别对应信息检索中对表示忠实性、文档特异性与键间可区分性的经典要求。

检索增强的智能体与智能体记忆。搜索智能体依赖检索来获取外部证据,其端到端表现受检索质量直接制约;智能体记忆系统同样依赖检索从过往交互中取出有用信息。本文通过 BrowseComp-Plus 与 LongMemEval-V2 两个下游评测,把索引优化与这两类应用连接起来,并特别强调 Self-Index 只修改检索键、不改动存储内容,因而与记忆的构建与组织方式正交。在与无索引方法 DCI 的对照中,论文指出 DCI 此前在 BrowseComp-Plus 上优于现有基于索引的搜索智能体,而 Self-Index 使基于索引的智能体达到与 DCI 相当的任务性能且在线成本更低;在语料规模扩展时,DCI 的准确率急剧下降、成本大幅上升,而 Self-Index 保持稳定。

六、局限性与展望 / Limitations & Future Work

论文以诚实的方式标出了若干结论的适用边界,这些边界本身也指向后续工作空间。

第一,覆盖率扩张与反复精修的效应未被分离。在索引演化分析中,作者明确说明没有在固定覆盖率下做对比,因此该分析不能分离"更多文档被纳入修订"与"同一批文档被反复精修"各自的贡献。要回答"Self-Index 的收益主要来自覆盖面还是来自深度",需要在固定累积覆盖率的条件下重做对照实验。

第二,优化查询供给是性能上限的直接约束。Optimizer 是反应式地改进索引,能否发现某个检索需求,取决于它收到的查询是否揭示了这一需求。查询来源对比显示,ReasonIR HQ 查询虽然也能带来相对基础索引的提升,但 Query Simulator 的查询在每个领域、每种检索器上都更好。这说明"如何生成既语料接地、又与已有需求不重复的查询"仍是一个有优化空间的问题;同时该对比评估的是整个模拟器对一个已有查询源,模拟器内部 Dissimilarity 过滤的贡献只能由单独消融来考察。

第三,验证环节高度依赖同源 LLM judge。Faithfulness 与 Answerability 都使用与 Optimizer 相同的 backbone LLM 做判断,阈值为 0–3 量表中的 2 分。这种设计保持了低人工干预,但也把判断质量与 judge 的能力绑定在一起;消融结果显示验证不可或缺(去掉后性能甚至低于基础索引),这意味着验证环节的可靠性对整个框架至关重要,而这方面的敏感性分析在现有材料中并未展开。

第四,下游收益在不同能力维度上并不均等。在 LongMemEval-V2 上,Static、Dynamic、Workflow 三类能力一致提升,但 Gotchas 提升不明显。论文的解释是 Gotchas 更依赖记忆系统如何把过去交互处理成有用的记忆内容,而非检索能否浮现它。这提示 Self-Index 的适用边界:它能改善"信息已在存储中、只是检索不到"的情形,但无法改善"信息根本没有被正确构建成可检索内容"的情形。

第五,成本核算存在明确的排除项。离线成本估算不含本地 GPU 的购置与托管成本;在线成本覆盖智能体的 LLM 调用,但不含离线索引优化、检索器服务与答案评测开销。此外,搜索调用次数与成本之间没有简单的单调关系,因为上下文长度、输出长度与缓存命中占比都会变化。因此"Self-Index 更便宜"这一结论应被理解为在给定计费口径下的结论,而不是全生命周期成本的结论。

第六,部分对照不可直接横向比较。DCI 的语料规模结果取自其原文,使用不同智能体配置与不同问题子集,因此规模分析只做各方法相对自身基线的变化对比,不比较跨方法的绝对准确率或成本。RL-Index 因本设置下没有可用的表格检索训练数据而被排除在表格检索比较之外。EnrichIndex 的分数合并系数在各数据集验证集上调参,评测查询被排除在调参之外,这一点保证了公平性但也意味着基线享有一定的调参优势。

第七,案例研究的解释力是定性而非定量的。12 个案例解释的是个体轨迹,展示的键是节选,不能单独分离出某一条键的贡献;部分案例存在明确的边界条件(如检索到的段落支持的是邻近机制而非问题所问的特异性因果解释、示例代码并未真正实现所要求的功能、排名第一只代表相关表或分区可被取到而完整分析仍需其他数据)。这提醒读者不要把案例读成"索引优化可以替代下游推理"。

在这些边界之外,论文的方向性意义是清楚的:如果索引的表示方式必须随检索环境而变,那么把"选择何种表示"这一决策持续交给一个能观察检索后果、能自我诊断并自我验证的循环,比固化任何一种策略都更有前途。可继续推进的方向包括:设计不依赖评测查询的、可用于判断何时停止演化的稳定准则;把框架扩展到更多内容形态与更多模态的记忆与语料;让验证阶段的判断能力与优化器解耦以提升可靠性;以及在固定覆盖率等受控条件下厘清各类收益的来源。

七、总结 / Conclusion

本文提出 Self-Index,一个使索引能够自我演化的框架。它把索引优化中原本由人承担的"诊断失败、精化策略、重处理索引"循环,替换为 Optimizer 自主执行的"自诊断、自修订、自验证"三阶段闭环:Self-Diagnosis 借助共检索画像从检索结果中识别表征短板并给出修订指引而不直接生成键,Self-Revision 以文档键集合为单位整体提出一次修订从而避免同集合内的冗余表示且不依赖任何预定义策略,Self-Validation 用 Faithfulness、Specificity、Separation 三条准则逐键把关,确保只有真正忠于源文档、具有文档特异性且与竞争键保持区分度的生成键才会被写入索引。在此之上,Query Simulator 通过 Self-Exploration 主动构造新的检索需求,并用 Answerability 与 Dissimilarity 双重过滤保证查询可被语料回答且彼此不重复,使索引的进化超出已有可用查询所覆盖的范围,从反应式进化为主动式。

在 BRIGHT 的自然语言、代码、数学三组语料上,以及 Spider 2.0、FIBEN、BEAVER 三个表格检索数据集上,Self-Index 在 BM25、BGE-Large、Qwen3-Embedding-8B 三种检索器下均取得最高平均 nDCG@10,相对基础索引的提升显著高于 Doc2Query、SPIKE、RL-Index 与 EnrichIndex,而后者只在部分环境有效、在另一些环境甚至造成下降。消融实验进一步表明,共检索画像、三条验证准则与不相似性过滤各自都有独立且一致的贡献,其中去掉整个验证阶段会使性能低于基础索引,说明"自验证"是自进化索引不发生退化的必要机制;查询来源对比显示,即便换成外部的语料接地查询,同一个 Optimizer 也能带来提升,但 Query Simulator 的查询供给在每个领域与每种检索器上都更好。在索引演化过程中,Self-Index 在早期迭代即超过 SPIKE,此后仍持续获得增益,同时以更低的累积优化成本完成演化——这与它只修订被诊断出短板的文档键集合这一选择性设计一致。最后,收益可迁移到下游:在 BrowseComp-Plus 上,Self-Index 同时提高搜索智能体的答案准确率与证据召回、减少搜索调用并降低校准误差,在语料规模从 100K 扩展到 400K 时保持准确率稳定与成本效率;在 LongMemEval-V2 上,仅演化检索键就能稳定提升记忆系统的整体准确率,说明该框架与记忆如何构建和组织基本正交。综合来看,这项工作最重要的启示并不在于某个具体的修订模板,而在于证明了"让索引自己决定如何表示文档"是一条可以在多样检索环境中稳定兑现收益的路径。

原文摘要:Information retrieval is increasingly important as LLM agents tackle complex tasks involving diverse information needs. Because retrieval relies on an index that represents each document through index keys, retrieval quality depends heavily on how effectively these keys expose the knowledge contained in each document. However, effective index representations vary across retrieval environments, making it difficult for any fixed optimization strategy to perform consistently. Yet evolving an index to its retrieval environment remains largely human-driven, requiring humans to diagnose retrieval failures, refine the optimization strategy, and reprocess the index accordingly. We propose SELF-INDEX, a framework that enables an index to self-evolve without human intervention. Its Optimizer autonomously diagnoses retrieval shortfalls, selectively revises the responsible index keys, and validates each revision before updating the index. Beyond reacting to observed retrieval demands, SELF-INDEX proactively explores additional demands through a Query Simulator, allowing the index to evolve beyond the queries already available for optimization. Across diverse corpora and retrievers, SELF-INDEX consistently improves retrieval performance while outperforming existing index optimization methods. We further show that these benefits extend to downstream applications, improving the effectiveness and efficiency of search agents and helping agent memory systems retrieve useful past interactions.

PDF链接:https://arxiv.org/pdf/2609.19656v1

部分平台可能图片显示异常,请以我的博客内容为准

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/28 19:47:01

STM32C5 SPI驱动IIS2ICLX加速度计:从配置到DMA采集实战

1. 项目缘起与整体方案拆解1.1 为什么选IIS2ICLX这颗加速度计IIS2ICLX是ST自家出的超低噪声两轴数字加速度计,量程可配2g/4g,内置温度补偿和FIFO,噪声密度低到25 g/√Hz这个级别,在倾角测量、结构健康监测、工业平台调平这类场景里…

作者头像 李华
网站建设 2026/9/28 19:46:20

UltraEdit 配置 Objective-C 高亮显示:TaoToken 辅助的语法着色方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/28 19:45:42

嵌入式配置范式升级:从寄存器编程到语义驱动开发

1. 这不是营销话术,是嵌入式工程师熬了三年夜才等来的实打实改进“嵌入式开发者的福音”——看到这标题,我下意识摸了摸自己右眼角那道浅浅的细纹。不是夸张,去年做一款工业温控模块时,光是调试UART波特率漂移问题就连续改了17版固…

作者头像 李华
网站建设 2026/9/28 19:45:32

BLE5.4与私有2.4G双模SoC OM6625A:架构、低功耗与量产避坑指南

最近在评估一颗2.4G频段的无线SoC:OM6625A,宣传点是BLE5.4和私有2.4G双模。很多朋友一听“蓝牙SoC”就觉得没什么好聊的,但真正做产品的人都知道,双模这两个字才是值钱的地方。做低功耗无线方案的人普遍都有一种纠结:想…

作者头像 李华