news 2026/9/23 2:01:39

VSI bench介绍

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
VSI bench介绍

文章标题:Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

单位:纽约大学

团队:李飞飞,Saining Xie

文章提出了一个新的任务,就是给定一段视频,需要MLLM对该视频进行空间推理

包括:空间中的物体的距离,物体的个数,物体的尺度大小等等

文章结论证明显示的文字思维链不能提升模型效果,而隐式的cognition map可以增强模型的空间尺度理解能力

Visual-Spatial Intelligence

Visual-Spatial Intelligence -> VSI,基于视觉的空间智能

空间推理包括两个部分:第一个是视角变换,第二个是空间关系推理

VSI bench

本文提出的VSI bench 包括了5000个问题对。包含288个真实室内场景(288条video)

数据集来源为Scannet,Scannet++和ARKitScenes

ARKitScenes 150 samples

ScanNet++ 50 samples

ScanNet 88 samples

数据集被划分为了3个不同的任务种类,包括了8种不同的任务

1,空间布局:包括相对方向,相对距离,物体计数,路径规划

2,空间测量:物体的大小,房间的大小,绝对距离

3,时空理解: 需要知道物体出现的相对顺序

8种问题的模板:

数据集视频的时间在1分钟到5分钟不等,但对于大部分方法实际上只会使用抽取其中的32帧

评估方式

在VSI bench数据集中,问题的回答只有两种:选择题或者数字填空题:Multiple-Choice Answer (MCA) or Numerical Answer (NA) format

对于数字的回答,使用Mean Relative Accuracy (MRA)

VSI bench还有一个tiny的版本

a subset of 400 questions (50 per task)

benchmark:

实验

作者让Gemini-1.5 Pro通过文字的方式输出cognitive maps,来判断模型的mental representation。但这只是让模型显式的输出这个cognitive map,其实模型在推理时应该是在内部具备这个建模能力的。(思考:是否可以先显式的训练这部分的建模能力,然后再变成隐式的推理?

实验证明通过prompt Gemini-1.5 Pro在回答问题之前先generate cognitive map可以提升模型的性能

然而,如下表所示,在7B的模型上加入了cognitive map反而会掉点

虽然论文说的是输入video,但实际上处理时还是截取的其中的32帧(或者其他数量的帧数)

对于某些任务,输入vision和不输入vision基本上没有区别,说明数据集存在一定的局限性

把问题放到视频的前面会掉点。

在问题后面再次加入一次video会涨点,这说明模型还是需要推理能力的,而不是把视频看完一遍就直接输出答案

This finding suggests that, despite its remarkable capabilities, a powerful MLLM like Gemini still has suboptimal reasoning processes for Video QA.

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 22:11:02

TFTP(简单文件传输协议)

一、协议概述 TFTP(Trivial File Transfer Protocol) 是一种基于UDP协议设计的极简文件传输协议,主要用于无盘工作站或嵌入式设备的系统引导过程。与功能完整的FTP相比,TFTP具有以下显著特点: 核心特性 协议简单&…

作者头像 李华
网站建设 2026/9/19 22:11:30

为什么说队列是万能药?

【说在前面的话】有人说,世间问题再多,无非就是时间和空间的问题。每每看到这类说法,都不禁会让我想起小时候看的《天龙八部》中的一处情节:彼时彼刻,少林寺正在被江湖歹人围攻,方丈情急之下问虚竹外面有多…

作者头像 李华
网站建设 2026/9/21 6:03:32

咸鱼流出可上DDR3内存的NAS妖板,支持4K解析,高达9个SATA接口,带MSATA扩展,还带双千兆网口,适合做多盘位NAS或软路由!

如今内存的价位暴涨,DDR4以及DDR5内存都是在顶峰,甚至价位还在上升的趋势下,无论个人DIY装机,还是某些特殊领域需求,即使是性能不高的软路由或者NAS,个人配齐整机成本都是极高的。与之相对的是同比价位上涨…

作者头像 李华
网站建设 2026/9/8 6:22:40

保姆级教程|用Snakemake一键跑通RNA-seq数据分析流程

之不可乎骤得 托遗响于悲风 ❝ RNA-seq转录组分析是生信分析的高频需求,但手动敲命令不仅繁琐易出错,还难复现、难扩展。今天分享一套基于Snakemake的自动化RNA-seq流程,涵盖「质控→比对→定量」全核心步骤,代码可直接复用&#…

作者头像 李华
网站建设 2026/9/21 6:03:39

从“有数据”到“用数据”,再到“用 AI 做更好的决策”

AI+Python 如何助力公共政策优化 从“有数据”到“用数据”,再到“用 AI 做更好的决策” 作者:Echo_Wish 说到公共政策优化,很多人脑子里第一个画面可能是这样的: “政府发布一堆数据,然后专家来分析,最后出一份建议报告。” 这是过去的流程。而现在,有了 AI + Pyth…

作者头像 李华