大家读完觉得有帮助记得关注和点赞!!!
摘要
现有的基于贪婪周边无状态路由(GPSR)的飞行自组网(FANET)协议难以在高度动态的环境下自适应调整路由参数,例如Hello间隔、多路径数量和贪婪转发权重。作为一种新兴的人工智能技术,大语言模型(LLM)显示出在智能决策方面的潜力,为自适应调整GPSR参数以提升网络性能提供了新的机遇。然而,由于不相关的经验检索和缺乏协议约束,将LLM应用于GPSR仍然充满挑战。为解决这些问题,我们提出了一种用于自适应GPSR优化的参数特定多索引检索与知识引导推理框架(PMKR-GPSR),这是一个基于LLM的框架,能够实现符合协议规范的路由参数自适应。我们设计了一种参数特定的多索引检索机制,为LLM提供与参数相关的经验,同时减少不相关信息的干扰。我们进一步构建了一个知识引导的约束图,以确保路由参数满足依赖规则和优化约束。仿真结果表明,在高动态FANET环境下,PMKR-GPSR实现了更高的分组投递率和更低的端到端延迟。
索引术语: 飞行自组网,贪婪周边无状态路由,大语言模型,参数特定检索,知识引导推理。
I. 引言
飞行自组网(FANET)因其快速部署能力和灵活拓扑结构而备受关注。与传统移动自组网相比,FANET的特点是拓扑结构快速变化和无线链路不稳定,这极大地增加了路由决策的复杂性[8]。因此,设计能够维持可靠通信的自适应路由机制仍然是一个关键挑战。
在现有的地理路由协议中,贪婪周边无状态路由(GPSR)因其低计算复杂度和本地化转发策略而被广泛采用。然而,传统的GPSR采用固定的转发策略。在高度动态的FANET中,固定的路由参数难以适应多样的通信场景,导致次优的转发决策、不稳定的路由以及降级的分组投递性能[3]。
为了提高GPSR的适应性,人们提出了许多优化方法。一些研究通过考虑多个路由度量来增强贪婪转发,从而实现对转发节点的更全面评估,提高转发可靠性[9]。其他方法采用强化学习(RL),通过与网络环境的持续交互来学习自适应路由策略[7]。然而,基于RL的方法通常需要大量的探索和精心设计的奖励函数才能实现稳定收敛[6]。随着网络拓扑的演变,先前学习到的策略可能变得次优,需要在高度动态的场景中进行额外的适应以维持路由性能。
最近,大语言模型(LLM)因其知识利用和推理能力,在无线通信的智能决策方面展现出潜力[10]。然而,现有研究表明,缺乏显式知识约束和相关经验的LLM可能会产生幻觉或不切实际的输出[11]。
因此,直接将LLM应用于GPSR优化仍然具有挑战性。首先,不同的路由参数,如Hello间隔、多路径数量和贪婪转发权重,对不同网络特征具有异质性依赖关系,导致不相关信息干扰LLM的推理。其次,缺乏协议知识约束使得LLM无法理解网络状况、路由参数和性能目标之间的关系,这可能导致不合理的参数调整,违反GPSR原则并恶化路由性能。
为了应对这些挑战,我们提出了一种用于自适应GPSR优化的参数特定多索引检索与知识引导推理框架(PMKR-GPSR)。首先,为了解决不同路由参数的异质性特征依赖以及统一经验检索带来的干扰问题,我们设计了一种参数特定的多索引检索机制。提取网络特征以查询相应的参数特定索引,为LLM提供用于路由参数生成的相关经验。其次,为了解决缺乏协议知识约束的问题,我们构建了一个知识引导的约束图。该图包含了用于LLM推理的参数依赖规则和优化约束,指导路由参数的生成。仿真结果表明,在高动态FANET场景下,PMKR-GPSR实现了更高的分组投递率(PDR)和更低的端到端(E2E)延迟,验证了其在动态网络环境中增强路由适应性和鲁棒性的有效性。
图1:提出的PMKR-GPSR框架架构
II. 问题建模
II-A UAV网络模型
我们考虑一个高度动态的无人机自组网,建模为一个无向图 G=(U,L),其中 U={ui∣1≤i≤N} 表示 N 架无人机的集合,L⊆U×U 表示在传输范围内相邻无人机之间建立的通信链路。
II-B GPSR路由协议
所提出的框架建立在GPSR协议之上[5]。每个节点定期广播Hello报文,并通过接收一跳邻居的Hello报文来更新其邻居表。基于邻居表,转发节点选择距离目的节点最近的邻居进行分组转发。
借鉴现有关于GPSR优化的研究,本工作采用自适应Hello策略和多路径转发策略来提高分组传输过程中的传输可靠性[8]。此外,采用多参数贪婪转发策略以提高下一跳选择的准确性[3]。邻居节点 uj 的转发优先级计算如下:
其中 D^j, L^j, V^j 和 N^j 分别表示候选节点 uj 到目的地的归一化距离、链路生存时间、相对速度和邻居度数,其对应的权重 wd, wl, wv 和 wn 满足 wi≥0,∑iwi=1。
表 I:自适应GPSR优化的参数依赖规则
路由参数 | 场景特征 | 关键指标 | 理由 |
|---|---|---|---|
Hello间隔 | 相对移动性 | vself, μ(vrel), σ(vrel) | 高移动性导致的拓扑变化需要更短的Hello间隔。 |
能量状况 | e | 低能量节点应减少Hello开销以延长网络寿命。 | |
路径数量 | 转发候选 | cc | 充足的转发候选节点可以实现更多不相交路径。 |
链路稳定性 | th∗, μ(th), σ(th) | 频繁的链路故障需要更多路径来提高可靠性。 | |
网络拥塞 | qself, qmin, μ(q) | 拥塞节点应限制路径数量以减少开销。 | |
转发权重 | 地理位置进展 | rp∗, μ(rp) | 最大化朝向目的地的地理进展。 |
相对移动性 | μ(vrel), σ(vrel) | 在高移动性下关注相对速度和链路生存时间。 | |
邻居连通性 | nc, μ(nc) | 邻居集合可减轻稀疏区域出现的路由空洞风险。 |
III. 提出的PMKR-GPSR框架
图1展示了PMKR-GPSR的整体框架。在离线阶段,路由经验被组织成参数特定的检索索引,领域知识被编码成一个知识引导的约束图。在在线优化过程中,该框架检索相关经验,执行知识引导的推理,生成自适应路由参数,并通过反馈更新经验。所提出的框架增强了LLM的推理过程,而不是微调其模型参数。这种设计避免了对大规模路由特定训练的需求,同时使其能够适应未见过的网络场景。此外,PMKR-GPSR将协议知识显式地融入推理过程,从而提高了生成的路由决策的可靠性和可解释性。
III-A 离线知识构建
III-A1 领域专家知识
领域专家知识表示为 K=(KD,KC),其中 KD 表示参数依赖规则,KC 表示优化约束。参数依赖规则指定了与每个路由参数相关的场景特征。形式上,KD={(pk,Fk)∣pk∈P},其中 P={H,M,w} 表示路由参数的集合,H 代表Hello间隔,M 代表路径数量,w=[wd,wl,wv,wn] 表示公式(1)中多参数贪婪转发策略的权重向量。Fk 表示与路由参数 pk 优化相关的场景特征子集,根据表I总结的参数依赖规则确定。
表I总结了路由参数优化的参数依赖规则。Hello间隔由相对移动性和能量状况决定,以平衡邻居新鲜度和通信开销[1]。转发路径的数量与转发候选、链路稳定性和网络拥塞相关联,以提高路由可靠性,同时限制不必要的传输[2]。转发权重主要取决于地理位置进展、相对移动性和邻居连通性,使协议能够在不同网络条件下平衡转发效率、链路稳定性和鲁棒性[4]。
优化约束规定了可行的参数自适应规则。它们表示为 KC={ψj}j=1Nc,其中 Nc 表示约束规则的数量。每个约束被公式化为 ψj:Γj→Δj,其中 Γj 表示基于场景特征定义的网络状态条件,Δj 表示可执行的参数自适应约束,包括允许范围和调整方向。约束知识用于在线优化过程中的知识引导推理。
III-A2 离线经验表示
本文从仿真记录中构建了一个离线经验数据库 D:D={Ei}i=1N,其中 N 表示经验的总数,i 是经验索引。每个经验表示为 E=(F,P,Y),其中 F=[Fs,Fn]⊤ 表示场景特征表示。Fs 表示自身节点信息,包括节点速度 vself、候选计数 cc、队列长度 qself 和能量 e。这里,候选节点指的是在地理位置上比当前节点更靠近目的节点的邻居节点。Fn 描述了邻居节点信息,包括邻居数量 nc、地理进展比 rp、相对速度 vrel、链路生存时间 th 和邻居队列长度 q。地理进展比 rp 表示候选转发节点朝向目的地取得的地理进展的相对百分比。为了解决邻居节点数量可变的问题并获得邻居节点信息的固定维度表示,每个邻居属性都使用统计描述符进行汇总。根据属性特征,采用最佳候选(*)、最小值(min)、均值(μ)和标准差(σ)的不同组合。性能向量定义为 Y={y1,y2,y3,y4},包括分组投递率、平均端到端延迟、控制开销和能量消耗。
由于 F 具有异质尺度,我们在索引构建之前应用Z-score归一化。归一化统计量 {μlnorm,σlnorm} 是从离线数据集中计算得出的,并在在线推理期间保持不变。每个特征维度归一化为:
其中 xl 表示第 l 个特征的原始值,μlnorm 和 σlnorm 分别表示第 l 个特征的离线均值和标准差。归一化后的特征记为 F^。
III-B 参数特定多索引检索
由于路由参数和网络状态之间存在异质性依赖关系,统一检索可能会引入不相关的干扰并降低经验匹配度。因此,基于参数依赖规则 KD 构建参数特定的检索索引,以提高检索相关性。
具体来说,应用特征映射函数 Φk(⋅) 从场景特征向量中提取参数特定的特征表示:Φk(F^i)=F^i,Fk,其中 F^i,Fk 表示根据 KD 选择的特征子集。提取的表示与相应的经验 Ei 一起存储,以构建参数特定的检索索引:
其中 Sk 表示参数 pk 的检索索引。
在在线优化过程中,观测模块在时间 t 监控当前的网络状态 Et 并构建场景表示 Ft。经过公式(2)的归一化后,F^t 通过 Φk(⋅) 投影以获得查询表示 Qk=Φk(F^t)。查询表示 Qk 与相应参数特定检索索引 Sk 中每个投影特征表示之间的相似度计算如下:
其中 dk(⋅,⋅) 表示相似度函数。检索到的经验集定义为具有最高相似度分数的 Top-M 个经验:
其中 Ak⊆D 包含用于优化参数 pk 的 Top-M 个最相似的历史经验。这里,TopM(Sk,dk(Qk,⋅)) 选择 Sk 中通过公式(4)计算的相似度分数最高的 M 个检索条目。
检索到的经验集为推理和路由参数优化提供了参数特定的知识。
III-C 知识引导的约束推理
尽管多索引检索提供了与参数相关的经验,但它缺乏显式的协议约束。因此,将领域专家知识 K 编码成一个知识引导的约束图,以指导LLM的推理。
约束图被建模为一个有向异构图,形式化表示为 G=(V,E,R)。节点集 V=Vs∪Vpr∪Vp∪Vm 包含网络状态、路由原理、路由参数和性能度量实体。KD 中的依赖规则和 KC 中的约束被映射为两种语义关系类型:影响 (rI) 和约束 (rC),定义了关系集 R={rI,rC}。相应地,边集表示为 E=EI∪EC,其中 EI 和 EC 分别表示由影响关系和约束关系实例化的边的集合。每条语义边被公式化为一个关系三元组 e=(vi,r,vj),其中 e∈E,vi,vj∈V,且 r∈R。
在约束图中,每种关系类型由一个邻接矩阵表示:A(r)∈{0,1}∣V∣×∣V∣,其中 Aij(r)=1 表示从 vi 到 vj 存在关系 r。
在在线优化过程中,通过从目标参数实体 vpk 遍历约束图来提取参数特定的子图。对于每种关系类型 r,相邻实体获取如下:
参数特定子图的节点集为:
相应的边集定义为 Ek={(vi,r,vj)∈E∣vi,vj∈Vk}。因此,检索到的子图表示为 Gk=(Vk,Ek)。
LLM基于一个集成的推理上下文执行路由优化:C={Et,Ak,Gk}。将集成的推理上下文提供给LLM,LLM执行约束推理以生成路由参数:P(0)=LLM(C),其中 P(0) 表示生成初始路由参数。在迭代细化过程中,P(l) 表示第 l 次迭代时的路由参数集。
激活的约束集获取如下:
一致性得分定义为:
其中 I(⋅) 指示生成的配置是否满足相应的约束。其定义为:
如果 Ω(P(l),KCact)<1,则将违反的约束汇总到一个违规集 Kvio={ψj∈KCact∣P(l)⊨ψj}。Kvio 被纳入交互历史,并作为额外的推理上下文提供给LLM进行迭代细化:
直到所有激活的约束得到满足或达到最大迭代次数 Lmax。最终的路由参数获取为:Pt⋆=P(l)。
因此,推理过程被约束为符合协议规范的路由配置,提高了自适应路由决策的可靠性。
III-D 自适应行动与经验更新
在知识引导的约束推理之后,优化的路由参数 Pt∗ 被采纳为自适应行动。监控随后的网络响应以形成新的经验:Et+1。
为了在经验数据库 D 中保持高质量的经验,基于随后的路由性能 Yt+1 评估新优化的路由参数。如果性能有所提升,则保留由先前归一化的场景表示 F^t、优化配置 Pt∗ 和性能 Yt+1 生成的经验:
具体来说,使用投影算子 Φk(⋅) 提取参数特定的特征,并使用新经验更新相应的检索索引:
否则,如果没有观察到性能提升,则丢弃新配置,或者系统回滚到先前的路由参数。最新的状态、行动和性能存储在交互历史中,以为未来的优化决策提供时序上下文,而不是作为一个额外的推理循环。
IV. 性能评估
所提出的框架使用NS-3.34网络模拟器进行评估。一个包含200架无人机的三维FANET部署在 2000×2000×200 m3 的区域,通信范围设置为250米。无人机移动性遵循高斯-马尔可夫移动模型,节点速度在10到80米/秒之间变化。每次仿真持续600秒。业务模型为恒定比特率模型(CBR),比特率等于2 Mbps,每个数据包大小为1024字节。所提出的优化框架每10秒在源节点和转发节点上触发一次。离线经验数据库包含 N=16,800 条路由经验,其中 M=5 条检索经验,最大LLM细化迭代次数 Lmax=3。
将所提出的框架与GPSR(原始地理协议)[5]、CF-GPSR(多度量地理协议)[9]和QLGR(基于强化学习的协议)[7]进行比较。为了评估各组件的贡献,评估了完整模型和四个消融变体:w/o Multi-Index、w/o KG、w/o Multi-Index & KG 和 LLM-only。具体来说,w/o Multi-Index 用统一索引替换了参数特定的检索索引;w/o KG 移除了知识引导的约束图;w/o Multi-Index & KG 从单索引检索中移除了知识引导的约束;LLM-only 直接使用LLM生成路由参数,无需检索或知识约束。
表II评估了在无人机速度为40米/秒的情况下,不同Qwen2.5-Instruct模型规模的推理延迟和路由性能。结果表明,较小的模型(0.5B和1.5B)在分析路由参数依赖关系和协议约束方面表现出有限的推理能力,导致优化效果不足,性能接近原始的GPSR。尽管3B和7B模型实现了更好的路由性能,但7B模型引入了明显更高的推理延迟,而性能提升有限。考虑到推理能力和计算开销之间的权衡,选择Qwen2.5-3B-Instruct作为仿真模型。
表 II:不同模型规模的性能评估
模型规模 | 0.5B | 1.5B | 3B | 7B |
|---|---|---|---|---|
PDR (%) | 35.6101 | 37.4435 | 67.8925 | 68.4435 |
延迟 (ms) | 326.8720 | 277.3431 | 232.1994 | 238.2675 |
推理延迟 (ms) | 1838.770 | 2126.063 | 2661.467 | 3664.793 |
图2:PDR:基线。
图3:延迟:基线。
图4:PDR:消融。
图5:延迟:消融。
图5说明,随着移动性的增加,所有协议的PDR都下降了。特别是,当速度达到80米/秒时,基线协议的PDR经历了显著的下降。相比之下,PMKR-GPSR保持了相对稳定的PDR。这种改进得益于参数特定的检索机制和知识引导的推理策略,它们使路由参数适应网络状态,并减少了快速拓扑变化的影响。CF-GPSR通过整合多个转发度量以实现更全面的邻居评估,从而获得了比GPSR更好的稳定性。QLGR通过强化学习改进了路由决策,但其性能受到交互和策略收敛要求的制约。GPSR表现出最显著的性能下降,因为它主要依赖地理距离,而没有考虑动态链路特性。
如图5所示,所有协议的E2E延迟都随着移动性的增加而增加。由于环境复杂性的增加和频繁的拓扑变化,其他协议遭受了更显著的性能下降。PMKR-GPSR通过利用知识引导的推理和参数特定的检索,在高移动性场景下实现了最低的延迟。PMKR-GPSR能够识别出更能匹配当前网络状态的路由策略,并避免不当的转发决策。因此,它在动态条件下减少了路由失败、重传和低效的转发操作。
图5和图5分别展示了不同消融变体的PDR和E2E延迟性能。与LLM-only相比,w/o Multi-Index & KG实现了改进的性能,这表明检索到的路由经验提供了超越单纯LLM推理的有用指导。w/o Multi-Index和PMKR-GPSR之间的比较表明,参数特定的检索为每个路由参数提供了更相关的经验,减少了不相关信息的干扰,并提高了优化精度。与w/o KG相比,PMKR-GPSR实现了更好的性能,这表明知识引导的推理将路由约束纳入了优化过程,并防止了不合理的参数配置。这些结果验证了所提出框架的必要性,该框架集成了参数特定的检索和知识引导的推理,以实现在高度动态网络条件下的自适应路由优化。
V. 结论
本文提出了PMKR-GPSR,一个基于LLM的GPSR优化框架。开发了一种参数特定的多索引检索机制以提高检索到的路由经验的相关性,并引入了一个知识引导的约束图来规范路由参数的优化。仿真结果表明,在高移动性场景下,PMKR-GPSR比现有方法实现了更高的PDR和更低的E2E延迟。这些结果表明,所提出的框架能够有效地感知动态网络变化并及时调整路由策略,在高度动态的FANET环境中选择更合适的转发方案。