这项由北京邮电大学牵头,联合湖南师范大学与清华大学的研究团队共同完成的工作,以预印本形式发布于2026年7月,编号为arXiv:2607.12477,感兴趣的读者可通过该编号查阅完整论文。
当你用手机地图导航时,地图不仅需要知道路上有什么,还需要知道"你在哪里、你在朝哪个方向走、你刚才转了几个弯"。这两件事缺一不可。然而,当我们把这套逻辑搬到无人机身上,目前市面上几乎所有顶尖的AI大模型,都只做好了前半件事——认识周围的世界,却几乎完全忽略了后半件事——理解无人机自身在做什么。这个盲区,正是本研究想要正面解决的问题。
研究团队将这一核心命题称为"自我与空间"(Self in Space):一架真正智能的无人机,不仅要看懂它飞过的城市,还要清楚地知道自己正在做什么、刚才做了什么、接下来该怎么做。为此,他们构建了一套名为SIS-Bench的评测基准,并专门设计了一种结合光流信息的运动感知模型SIS-Motion,用严格的实验数据揭示了当前AI的核心短板,同时也验证了改进方向的可行性。
一、无人机的"导航难题":只认识世界,却不认识自己
以一位经验丰富的快递骑手为例。他骑着电动车穿梭在城市里,不仅需要认出路口的便利店和医院,还需要时刻清楚自己刚才是向左转了弯、还是直行穿过了一条隧道,以及如果接下来再右转会到哪里。前者是"认识世界的能力",后者是"认识自己的能力",两者缺一不可才能安全送达。
现实中的无人机AI面临的正是这个困境。过去几年,多模态大语言模型(简单理解为:能同时看图、看视频和理解文字的超级AI)被广泛引入无人机系统,让无人机拥有了识别地面建筑、判断目标位置、理解飞行指令的能力。然而,研究人员发现,几乎所有已有的研究和评测系统,都只关注无人机对"外部世界"的理解,对于无人机自身的飞行状态、运动历史和行为预测,却少有系统性的考量。
这不是小问题。在实际飞行中,无人机的每一次姿态变化都会改变它看到的画面——向左偏转时,右边的建筑会慢慢进入视野;向下俯冲时,地面会快速放大。如果AI不理解这些变化是"自己在动"造成的,而不是"世界在动",就会产生严重的认知混乱,导致判断失误。正因如此,研究团队认为,无人机智能的真正瓶颈,在于如何同时理解"外部世界"与"自身状态",也就是"自我与空间"的统一建模。
二、SIS-Bench:给无人机AI设计的"驾照考试"
为了系统地衡量AI在这两方面的能力,研究团队从零开始设计了SIS-Bench这套评测基准。它就像是一套专门为无人机AI设计的"驾照考试题库",考题不仅测试你认不认识路,还要测试你记不记得自己刚才怎么走的、能不能规划下一步怎么走。
整个题库从两个维度展开。第一个维度是"空间认知",考查AI对外部环境的理解能力,包括识别地面上的物体、判断建筑物的颜色属性、辨别两个地标的相对位置关系等。第二个维度是"自我感知",考查AI对无人机自身行为的理解能力,包括识别无人机当前正在执行的飞行动作、记住一段飞行过程中的动作顺序、预测执行某个动作后会到达哪里等。
在这两个维度内部,研究团队还按照认知难度设计了三个递进层次。第一层叫"感知",对应的是最直接的即时观察,就像你看一眼窗外就能判断今天是晴天还是阴天,不需要任何回忆或推理。第二层叫"记忆",要求AI能够在时间轴上保存和提取信息,就像你需要回想起"刚才经过的那个路口旁边有一家蓝色招牌的药店"。第三层叫"推理",是难度最高的层次,需要AI把对空间的理解和对自身行为的理解整合在一起,做出复杂的判断,就像你能在脑海中构建一张地图,然后规划从A点到B点的最优路线。
在题目类型上,SIS-Bench共覆盖13种具体任务。空间认知方面,感知层包含"物体存在性判断"(这段视频里有没有蓝色自行车?)、"物体属性识别"(停在电线杆下的车是什么颜色?)和"相对方向判断"(停车标志的后方是什么物体?)三类题目;记忆层包含"地标顺序回忆"(这几个地标按什么顺序出现?)、"地标回溯"(玻璃幕墙大楼的前一个地标是什么?)和"位置关系记忆"(第四段视频里白色高层右侧是什么?)三类题目;推理层则包含"空间一致性"(假设我悬停在红顶亭子上方,面向圆形蓝色喷泉,我的右手边是什么?)和"时空一致性"(从游泳池出发,正确的地标经过顺序是什么?)两类题目。
自我感知方面,感知层对应"动作识别"(无人机当前在执行什么飞行动作?);记忆层对应"动作序列回忆"(这段拼接视频中无人机依次执行了哪些动作?)和"动作回溯"(第二段视频里无人机在做什么?);推理层则包含"动作预测"(从红色网球场上方出发,执行这串动作序列后会到哪里?)和"路径规划"(从红色网球场出发,要到达蓝色地板的篮球场,应该执行怎样的动作序列?)两类最高难度的题目。
为了让这些题目尽可能接近真实飞行场景,研究团队对视频素材也做了精心设计,定义了四种不同的视频格式。单段视频保留一个完整的短片段,用于感知层测试;拼接视频将2到4个短片段连接在一起,用于记忆层测试;长视频保留完整的长时飞行轨迹,用于推理层测试;打乱视频则将一段长视频切成若干片段后随机重排,强迫AI从混乱的时间顺序中还原出真实的空间结构,这也是难度最高的推理场景。
SIS-Bench的数据来源于三个公开的无人机数据集:AirScape、UrbanVideo-Bench和VisDrone,覆盖城市街道、住宅小区、工业园区、自然景观等多种环境,总计1646段真实无人机视频,累计时长约14.9小时。所有题目均由两位专家独立审核,只有双方都认可的题目才能进入最终题库。最终,SIS-Bench共包含4856道多项选择题,其中感知层占36.3%,记忆层占43.7%,推理层占20.0%。
三、AI现在的真实成绩:人类91.7%,最强AI模型71.6%
有了考卷,接下来就是摸底考试。研究团队将当前业界最强的26个视频多模态大模型一一送上考场,其中包括6个闭源商业模型(Gemini 3 Flash、GPT-5.4、Kimi-2.5、Doubao-Seed-1.8、Doubao-Seed-1.6-Vision、Qwen3.5-Plus)和20个开源模型。同时,他们还招募了6位具有硕士学历的人类专家参加同样的考试,作为成绩上限的参照。
结果出人意料,却又在情理之中。人类专家的平均正确率达到91.7%,而表现最好的AI模型Gemini 3 Flash仅取得71.6%的正确率,两者之间相差超过20个百分点。这说明SIS-Bench并不是一套过于容易的题目,当前的AI距离人类水平还有相当大的差距。
更值得关注的是成绩背后的结构性规律。研究人员发现了两个非常一致、跨越所有模型都成立的现象。
第一个现象是"重空间、轻自我"的系统性偏差。几乎所有被测试的模型,在空间认知类题目上的得分都明显高于在自我感知类题目上的得分。换句话说,这些AI更擅长理解无人机看到的外部世界,却不擅长理解无人机自身在做什么。以Gemini 3 Flash为例,它的空间认知平均分为83.7%,而自我感知平均分仅为58.6%,差距超过25个百分点。这种系统性偏差在所有26个模型中几乎无一例外。
第二个现象是"感知好、记忆差、推理更差"的认知层次衰减。随着题目从感知层上升到记忆层,再上升到推理层,几乎所有模型的成绩都呈现出明显的下降趋势。这种衰减在闭源商业模型和开源模型中都同样存在。直接看一眼就能回答的题目,AI表现尚可;但需要在时间轴上保存信息再提取的题目,成绩就开始下滑;而需要整合空间知识与动作历史才能完成的复杂推理题,成绩下降得最为明显。
研究团队还专门做了一系列对照实验,验证这些规律不是由题目设计本身造成的。他们测试了不同的视频采样策略,发现结果几乎没有变化;他们对打乱视频重复三次随机排列取平均,结论也依然稳定;他们给模型加上"思维链提示"(让AI在回答之前先把推理过程写出来)和"思维树提示"(让AI探索多条推理路径),发现这些技巧对整体结论影响甚微,有的任务甚至会因为提示词变化而成绩下降;而人类专家在面对相同的拼接视频、长视频和打乱视频时,依然能保持接近90%的准确率。这些控制实验共同说明,观察到的模型短板是真实存在的能力缺陷,而非题目设计的偏差。
在更细致的错误分析中,研究团队对4个代表性模型的7987条错误回答进行了逐一标注,将错误分为8个类别。结果显示,"动作理解错误"占所有错误的33.0%,"空间推理错误"占18.2%,是两个最主要的失败原因。这意味着AI的错误并不主要来自"没看清楚",而更多来自"不理解无人机自己在动"以及"无法在脑海中构建稳定的空间关系图"。
四、三个具体失败案例:AI的盲区藏在哪里
为了让读者更直观地感受到这些局限,研究团队展示了三类典型的错误场景,每一类都揭示了不同层面的认知盲区。
第一类错误发生在夜间飞行的动作识别任务中。画面中,路灯稀少,背景昏暗,只有零星的车灯轨迹可见。正确答案是"无人机垂直下降同时向右偏转",但包括Gemini 3 Flash、GPT-5.4、Doubao-Seed-1.8和Qwen3.5-Plus在内的所有主流模型都错误地选择了"沿弧线向前飞行同时向右偏转"。原因在于,这些模型过于依赖视觉中最显眼的亮点(车灯轨迹),把亮点的移动方向理解成了自身的前进方向,而没有从整体画面变化的模式中感知到真实的下降动作。这就像你坐在一辆向后移动的火车上,看到窗外的树木向前移动,就以为自己在向前走——错误的原因不是视力问题,而是对"自己在动"这件事缺乏感知。
第二类错误发生在拼接视频的动作序列记忆任务中。视频由三段短片段拼接而成,正确的动作序列是"缓慢下降同时俯仰角下压 → 保持稳定向前飞行 → 缓慢下降同时俯仰角下压"。部分模型能正确识别前两个动作,却在第三段上判断失误,误以为最后一段是继续向前飞行。另一些模型则更早就出错,把第一段也认成了向前飞行,导致整条序列完全错误。这类错误的本质不是单段视频看不懂,而是无法在多个片段之间建立稳定的时间界限,一旦某段的判断偏差,就会连带影响整条序列的理解。这与人类在长时间工作后容易混淆事件顺序的情况有些相似,只不过AI的这种混乱即便在很短的视频里也会出现。
第三类错误发生在拼接视频的动作回溯任务中。题目要求模型识别"第三段视频里无人机在做什么",正确答案是"顺时针旋转",但几乎所有被测模型都错误地选择了"俯冲同时向前飞行"或"缓慢向前飞行"。视频中,第三段的视角确实发生了明显变化,但这种变化是机身在原地旋转导致的,而不是向前推进造成的。由于这两种运动在视觉上都会产生"场景在移动"的效果,区分它们需要精细地感知背景整体结构的变化方式,而不是简单地注意到"画面在变"。现有模型倾向于把任何明显的视角变化都解读为"向前移动"或"俯仰变化",对"原地旋转"这种更微妙的自我运动模式缺乏有效的识别能力。
五、SIS-Motion:给无人机AI装上"运动感知器"
发现问题之后,研究团队没有止步于诊断,而是进一步探索了一条改进路径。他们的核心思路是:既然AI对自身运动不够敏感,能不能专门给它加一套感知运动的"传感器"?
这个"传感器"的技术名称叫光流(Optical Flow)。光流的原理很直观:对于视频中相邻的两帧画面,你可以计算每一个像素从第一帧到第二帧移动了多少距离、朝哪个方向移动。当无人机向前飞时,画面中所有元素都会向外扩散;当无人机向右偏转时,画面整体会向左平移;当无人机原地旋转时,画面会产生一种特殊的旋转流场。这些运动模式,用人眼观察非常微妙,但用数学方法计算出来之后,会变成非常清晰的结构化信息,可以直接告诉AI"机身在以什么方式运动"。
研究团队将这套光流信息封装成一套与原有视觉特征并行的"运动编码器",嵌入到标准的视频多模态大模型中,构成了SIS-Motion框架。具体来说,原有模型会提取视频帧的视觉特征,描述场景里有什么、长什么样;新增的运动编码器则同步提取光流信息,描述每一帧到下一帧之间画面如何变化。两路信息通过一个轻量级的连接模块融合在一起,共同送入语言模型进行最终的推理和回答。
为了训练这个升级版模型,研究团队从AirScape数据集的训练集中构建了一个专门的训练语料库,命名为SIS-Motion-54K,包含54000条样本。这些样本覆盖三种形式:多项选择题格式,覆盖9个感知和记忆类任务,让模型在训练阶段就熟悉与评测相同的题目类型;开放问答格式,去掉选项,让模型直接从视频中生成回答,避免模型仅靠选项匹配取巧;描述格式,包含"运动意图描述"和"场景内容描述"两类,让模型学会同时用语言表达运动信息和环境信息。特别值得一提的是,这批训练数据严格只涵盖感知和记忆任务,没有包含任何推理类任务的样本。这样的设计是刻意为之——如果事后在推理任务上也出现了成绩提升,就能说明这种提升来自模型对底层运动信息的更好理解,而不是靠记住了推理题的答案模式。
六、实验结果:运动感知带来了什么,又没带来什么
实验结果清晰地展示了SIS-Motion的实际效果。
与同等配置下只使用视觉信息的基础微调模型相比,加入运动感知之后,空间认知的平均得分从72.0%提升到74.2%,自我感知的平均得分从60.3%提升到63.7%。这个结果很有意思:运动信息不仅帮助了自我感知(这是预期之内的),同时也帮助了空间认知(这稍微出乎意料)。原因在于,无人机的运动与它看到的环境本来就是不可分割的——当你知道无人机在向右偏转,你就更容易理解为什么画面左侧的建筑在变大、右侧的建筑在缩小,从而更准确地判断地标之间的位置关系。这正是"自我与空间"统一建模的价值体现。
具体到任务层面,提升最为明显的包括"物体属性识别"、"地标回溯"、"位置关系记忆"、"动作识别"、"动作序列回溯"和"动作记忆"等感知和记忆类任务。而在推理层的4个任务上,成绩的提升有限且不够稳定——"路径规划"任务有所改善,但"动作预测"任务没有变化。这与训练数据的设计完全吻合:模型在没有接触过推理训练数据的情况下,从改进的底层感知能力中获得了部分泛化,但高层次的复杂推理仍然是尚未攻克的难关。
研究团队还测试了四种不同的光流估计算法(RAFT、Sea-RAFT、MemFlow、MOFNet),发现所有四种算法搭配后的模型都优于纯视觉基础线,说明这套改进方案对具体光流算法的选择并不敏感,具有较强的通用性。其中,MOFNet算法的光流质量最高,最终取得了最好的综合成绩,总体正确率达到69.1%。
七、在真实导航任务中的迁移验证
为了确认这套改进不是仅在题库里有效,研究团队还在一个完全独立的下游任务上进行了验证。他们基于OpenUAV数据集构建了一个无人机路径规划测试集,包含来自22个模拟场景的3895道题目,覆盖城市街道、沙漠、森林、港口和海岛等多种地形。
在这个测试中,所有模型都采用零样本方式评测,即没有任何针对这批题目的额外训练。结果显示,SIS-Motion的正确率达到92.2%,远高于同等底座模型Qwen2.5-VL 3B在零样本状态下的71.2%,提升超过20个百分点。这说明,在SIS-Motion-54K上学到的运动感知能力,确实能够迁移到完全不同的下游飞行决策场景中,而不仅仅是在题库分布内有效。
归根结底,这项研究做了两件重要的事。第一件是照镜子——用SIS-Bench这套精心设计的评测体系,清楚地照出了当前顶尖AI模型的真实短板:它们对外部世界理解得不错,但对自身行为的感知严重不足,而且随着任务从即时感知升级到时间记忆、再升级到复杂推理,成绩会持续走低。第二件是试着补救——用SIS-Motion验证了一种思路:把光流这种能够直接描述运动的信息注入模型,可以在不大幅改动模型结构的前提下,系统性地改善感知和记忆层面的表现,并且这种改善能够迁移到实际的飞行导航决策中。
当然,研究团队也坦诚地指出了这项工作的局限。SIS-Motion在推理层任务上的改进有限,路径规划这类高层次决策任务需要更复杂的目标导向推理能力,仅靠局部运动信息并不够。此外,SIS-Bench本身的评测形式是多项选择题,更接近于对模型理解能力的间接测量,而不是对无人机真实飞行决策的直接考查。如何将这套对"自我与空间"的理解转化为可靠的闭环飞行控制,依然是一个需要进一步探索的开放问题。
对于研究人员来说,这项工作提出了一个值得深思的方向:我们是否在构建无人机AI时,太过于关注"认识世界",而忽视了"认识自己"这同样重要的能力?而对于普通大众来说,这项研究意味着,未来真正能够安全、可靠地在城市上空自主飞行的无人机,除了需要一双"看懂世界的眼睛",还需要一套"感知自身行为的内感觉"。两者缺一不可,这或许才是无人机真正走向智能化的关键一步。有兴趣深入了解这项研究的读者,可以通过arXiv编号2607.12477查阅完整论文原文。
Q&A
Q1:SIS-Bench是什么,它和普通的无人机测试有什么区别?
A:SIS-Bench是一套专门用来测评无人机AI能力的题库,包含4856道多项选择题,覆盖13种任务类型。与以往只测试无人机能否识别地面环境的评测不同,SIS-Bench同时测试两件事:一是无人机对外部世界的理解(比如识别建筑颜色、判断地标顺序),二是无人机对自身行为的理解(比如识别当前飞行动作、记忆飞行轨迹)。这种"内外兼顾"的设计,是SIS-Bench区别于以往评测的核心特点。
Q2:当前最强的AI模型在SIS-Bench上表现怎么样?
A:表现最好的商业模型Gemini 3 Flash总体正确率为71.6%,而人类专家的正确率为91.7%,差距超过20个百分点。更值得注意的是,所有模型在"自我感知"类题目上的得分都系统性地低于"空间认知"类题目,说明现有AI普遍存在"认识世界强、认识自己弱"的结构性短板。
Q3:SIS-Motion是怎么改善无人机AI对自身运动的理解的?
A:SIS-Motion通过在原有视觉模型之外增加一套光流分析模块来实现改善。光流能计算出视频相邻帧之间每个像素的移动方向和距离,把无人机的飞行动作转化为结构化的运动信息,让AI不再只依赖画面外观来猜测自身在做什么。加入这套模块后,自我感知平均得分从60.3%提升到63.7%,空间认知也同步提升,且效果可以迁移到真实无人机导航决策任务中。