news 2026/8/30 6:40:17

MOSS-VL Technical Report——MOSS-VL 技术报告

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MOSS-VL Technical Report——MOSS-VL 技术报告

一、研究定位与核心目标

核心定位:MOSS-VL是一个开源的视觉-语言模型家族,首创性地将“实时交互”作为一等公民能力——即模型能够在生成文本的同时持续感知新到达的视觉帧,并在证据变化时动态修正或打断自己的回复。

关键突破:它跨越了传统流式模型(L2-L4层级,回复时“失明”)与真正的实时交互(L5层级,生成时持续感知)之间的鸿沟。

二、技术架构创新(三大支柱)

创新点技术细节设计意图
门控交叉注意力仅在12层(每4层)引入交叉注意力;视觉令牌通过tanh门控以键值形式接入,从不进入解码序列;门控零初始化保证语言骨干完整实现“边生成边感知”,新帧仅追加到缓存,无需重算
XRoPE位置编码首创为交叉注意力通道设计的三轴坐标编码 (t, h, w);文本与视觉共享统一时间线;64对旋转频率按(24,20,20)分配赋予视觉流位置信息,使时序关系可被模型理解
绝对时间戳令牌每帧前插入<|time_start|>X.X秒<|time_end|>让模型直接读取挂钟时间,而非从位置推断,适应可变帧率

参数规模:总计113亿参数(语言骨干约82亿 + 交叉注意力约23亿 + 视觉编码器/投影约8亿)。

三、训练课程设计(六阶段递进)

阶段名称令牌数最大序列可训练模块学习率
1视觉-语言对齐1503亿8K仅投影+交叉注意力2×10⁻⁴
2大规模多模态预训练2030亿64K全模型5×10⁻⁵
3高质量多模态预训练4590亿128K全模型1×10⁻⁵
4退火+长上下文4501亿256K全模型1×10⁻⁵
SFT监督微调(离线)1028亿128K全模型1×10⁻⁵
Realtime-SFT实时交互微调348亿256K全模型4×10⁻⁵

关键策略:

  • 大规模数据合成贯穿全程(描述、OCR、指代定位、时间定位四类合成数据支撑感知基础)

  • 所有实时特定设计集中在最后轻量阶段,占总训练令牌<3%

  • Realtime-SFT仅新增两个状态令牌(<|silence|>、<|response|>)

四、Realtime-SFT的核心机制

交互范式:每帧后跟决策槽位,模型在三种状态中选择——

  1. <\|silence\|>— 继续观看,不发言

  2. <\|response\|>+ 文本 — 开始/继续发言

  3. 文本 +<\|silence\|>— 发言结束

数据特征:56万样本(约348亿令牌),包含:

  • 必须恰好触发一次的常驻指令

  • 答案需随场景更新的驻留问题

  • 持续实时评论

  • 5.1%样本中目标事件从不发生,正确行为是全程沉默

训练目标创新:

  • 焦点损失 + 逆频率类别加权平衡沉默/发言两类(发言极少见)

  • 排除助手的轮次结束令牌,防止模型因新用户消息而机械结束回复(该技巧单独使发言频率↑39%,回复长度↑68%)

五、离线性能表现(MOSS-VL-Instruct)

在39个基准上对比Qwen3-VL-8B、Qwen2.5-VL-7B、LLaVA-OV-2-8B、Gemma-4-12B-IT:

能力域主要成果
多模态感知最强板块,拿下12项中5项第一(MMBench 88.1,POPE 89.4,V* 89.0,BLINK和MME-RealWorld以8.9+点优势领先)
视频理解在时序推理集上领先——Minerva 40.5,TOMATO 39.5,VideoMME-Logical 17.1,均超第二名4.9+点
指代定位Ref-Adv对抗性定位领先7.7点(57.0)
文档/OCROmniDocBench领先4.0点(88.9)
推理VisuLogic 27.5第一,ERQA 45.8并列第一

主要短板:MMMU(51.1,远低于Qwen3-VL的69.6)、文档理解、标准指代定位(RefCOCO-REC)——源于无思考模式、训练优化偏向实时视频而非考试式推理。

六、流式性能表现(MOSS-VL-Realtime)

在4个流式基准上对比AURA、M4、ROMA、JoyAI-VL-Interaction、VideoChat3-4B、VisPeak-7B、MMDuet系列等:

基准MOSS-VL得分最佳基线排名
OVO-Bench70.265.3第1
OmniMMI32.725.4第1
ProactiveVideoQA47.242.7第1
StreamingBench(视觉平均)69.771.1第2

关键发现——主动行为子集横扫:

子集MOSS-VL最佳基线优势
Proactive Alerting (OmniMMI)66.037.5+28.5点
Proactive Output (StreamingBench)60.053.2+6.8点
Forward Active Responding (OVO-Bench)62.155.8+6.3点
Backward Tracing (OVO-Bench)72.660.4+12.2点

结论:胜利集中在“测试何时说话”的子集上,这正是Realtime-SFT直接监督的行为;而纯感知问答子集上AURA仍保持优势。

七、推理效率

共享同一Qwen3-8B语言骨干的Qwen3-VL-8B对比(隔离架构影响):

场景视觉上下文增长时
TTFT(首令牌时间)优势从2.8倍扩大到5.1倍
端到端延迟优势从1.9倍扩大到4.3倍
同视频同分辨率MOSS-VL无时间压缩(承载约2倍视觉令牌),仍不落后,且优势随流增长扩大

效率来源:视觉令牌不在解码序列中,新帧仅追加到交叉注意力缓存,KV缓存可增量更新。

八、发布内容

类别内容
检查点(5个)Base-0708、Instruct-0708、Realtime、Base-0408、Instruct-0408
训练课程完整的6阶段数据配比与超参数
推理代码Transformers参考实现 + SGLang集成(已合入上游)
FlashAttention扩展cross_kv_boundary接口,支持变长可见性模式
现场演示实时视频分析demo(条件触发、持续解说等场景)

九、局限与未来方向

局限未来计划
MMMU、文档理解等离线和基准落后于最强模型增加强化学习后训练(已在公开路线图上)
L5层级(生成时感知并修正)仅有定性验证构建L5行为专用基准(目前领域空白)
无“思考”模式后续版本考虑引入推理增强

MOSS-VL的核心贡献在于“全栈协同设计”而非单一组件突破

  • 架构让视觉感知与文本生成自然并行

  • 数据教会模型响应时机(何时说、何时等、何时改)

  • 课程将实时能力植入一个轻量级最终阶段,而非重构整个训练

它是一个为“正在发生”的世界设计的模型,而非为“已经结束”的视频设计的模型。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

官方项目主页地址在这里,如下所示:

项目地址在这里,如下所示:

预训练模型发布地址在这里,如下所示:

摘要

我们提出了 MOSS-VL,一个开源的视觉-语言模型家族,它将实时交互——在说话的同时进行感知——作为一等公民能力。我们通过全栈协同设计来实现这一能力:语言解码器仅通过门控交叉注意力来关注视觉信息,因此模型能够在生成文本的同时自然地接收传入的帧;一个合成的交互语料库监督模型何时该说话、何时保持沉默以及何时修正回复;一个分阶段的课程将所有的实时特定训练集中在一个轻量级的最后阶段,并构建在强大的离线基础之上。在离线场景下,MOSS-VL-Instruct 在相似规模模型中具有竞争力,并在时间推理视频集上领先。在四个流式基准测试中,MOSS-VL-Realtime 在开源流式模型中取得了三个最佳平均分(在第四个上排名第二),并横扫了三个直接测试主动行为的子集——在 OmniMMI 的主动警报任务上达到 66.0 分,对比最佳基线的 37.5 分。尽管拥有 113 亿参数,但视觉令牌位于解码序列之外,随着视觉上下文的增长,MOSS-VL 相对于使用相同骨干网络的 Qwen3-VL-8B 的首令牌时间优势从 2.8 倍扩大到 5.1 倍。

1 引言

大多数开源的视觉-语言模型以离线方式理解视频:给定一个已完成的片段,它们从头到尾读取它,然后回答关于它的问题 [3, 4, 14]。然而,视频理解最重要的应用场景并不会等待片段结束。一个实时助手观察着一个仍在展开的场景,自行判断何时有值得说的事情,并且必须在说话的同时继续观察。表 1 将此能力空间组织为五个层级。L1 是离线模式。L2-L4 构成了流式模式,由近期的流式模型 [11, 24, 41, 47] 占据:输入持续到达,主动沉默和持久查询开始发挥作用,但模型在每次回复期间保持“失明”。L5 增加了将实时交互与以下所有层级区分开来的能力:在生成的同时进行感知,因此当证据发生变化的那一刻,回复可以被修正或截断。

MOSS-VL 是一个开源的视觉-语言模型家族,它将实时交互视为一等公民能力,并通过协同设计而非任何单一组件来实现这一能力。架构赋予了这种行为:语言解码器仅通过门控交叉注意力来关注视觉信息,因此视觉令牌永远不会进入解码序列,新到达的帧仅需追加到交叉注意力缓存中——模型在生成时自然地保持感知(第 2 节)。XRoPE 将文本和视觉沿一个共享时间线排序,绝对时间戳令牌使挂钟时间显式化。数据注入了这种行为:

在离线场景下,MOSS-VL-Instruct 与相似规模的开源模型具有竞争力,并在时间推理视频集 Minerva、TOMATO 和 VideoMME-Logical 上领先(第 6.1 节)。在流式模式下,胜利恰好落在测试时机的基准上:在四个流式基准测试中,MOSS-VL-Realtime 在三个基准上取得了最佳平均分(在第四个上排名第二),并横扫了三个直接测试主动行为的子集——在 OmniMMI 的主动警报任务上达到 66.0 分,对比 37.5 分(第 6.2 节)。效率提升同样源于相同设计:与基于相同 Qwen3-8B 语言骨干网络的 Qwen3-VL-8B 相比,随着视觉上下文增长,首令牌时间差距从 2.8 倍扩大到 5.1 倍(第 6.3 节)。L5 行为本身通过现场演示和发布的实时推理代码进行了定性展示(第 6.4 节);定量验证覆盖了 L2-L4 层级,这些层级存在公共基准。

图 1 结果概览。(a) 在四个流式基准测试中,与开源流式基线模型的平均分对比(详细信息见表 6;StreamingBench 的平均分覆盖其视觉组,第 6.2 节)。(b) MOSS-VL 在主动流式子集上与最佳竞争模型的对比——PA(主动警报,OmniMMI)、PO(主动输出,StreamingBench)和 FAR(前向主动响应,OVO-Bench),这些子集均测试模型是否在正确时机主动发言——以及在选定的离线优势上的对比(详细信息见表 5 和表 6)。绿色 = MOSS-VL;灰色 = 标注的竞争者。

表 1 视频理解层级,从离线到实时。每个层级点亮一个额外的能力轴;流式模式(L2-L4)与实时模式(L5)之间的分界线在于模型是否在生成的同时保持感知——L2-L4 模型在回复期间是“失明”的,而 L5 模型则不是。MOSS-VL-Realtime 实现了 L5 行为,并通过现场演示和发布的实时推理代码进行了展示,并在四个流式基准测试中于 L2-L4 层级进行了定量验证;针对 L5 行为的专用基准测试仍然是一个悬而未决的问题。

总之,我们的主要贡献是:

  • 为实时交互协同设计的全栈方案。架构使其成为可能——带有 XRoPE 和绝对时间戳的门控交叉注意力让模型在生成时自然地接收新帧;数据注入了它——合成的流数据监督响应时机;训练策略保持其稳定——语言骨干网络在零初始化的门控后保持完整。

  • Realtime-SFT,一个轻量级阶段的交互范式。两个新增状态令牌、一个共享系统提示和重新加权的下一个令牌预测损失——占总训练令牌的不到 3%——教会模型何时说话、何时保持沉默以及何时修正回复,在四个流式基准测试中的三个取得最佳平均分,并实现了上述主动行为任务的全面胜利。

  • 时序理解在离线场景中同样显现。未经实时语料库训练的 MOSS-VL-Instruct,在我们的对比中领先于时间推理视频集——Minerva、TOMATO、VideoMME-Logical——这印证了预训练阶段奠定的感知和时序理解基础。

  • 更多参数,更快服务。MOSS-VL 拥有 113 亿参数,但视觉令牌保持在解码序列之外,因此服务延迟随视觉上下文增长的速度慢于其使用相同骨干网络的交错式对应模型——在 SGLang 上实测,而非估算。我们发布了完整的训练课程和全部五个检查点。

2 架构

MOSS-VL 将一个原生分辨率视觉编码器与一个从 Qwen3-8B [49] 初始化的语言解码器配对,两者仅通过门控交叉注意力交互(图 2)。视觉令牌永远不会进入解码序列:

图 2 MOSS-VL 架构。图像和视频帧由 27 层视觉编码器以原生动态分辨率编码,然后进行 2x2 池化并投影为视觉令牌;文本同时进行令牌化。LLM 解码器(48 层,从 Qwen3-8B 初始化)仅通过 12 个带有 tanh 门控的交叉注意力层(门控交叉注意力,右侧插图)关注视觉令牌,每四层中有一层;其他 36 层自注意力层仅处理文本序列,因此视觉令牌永远不会加入解码序列。交叉注意力查询携带文本位置,键携带三轴 XRoPE 坐标 (t, h, w)。门控是零初始化的标量,因此训练从完整的语言骨干网络开始。

每个帧向文本流贡献几个时间戳令牌和一个占位符令牌,而其图像块令牌则作为交叉注意力的键和值被消费。表 2 列出了配置详情。

2.1 组件与参数统计

视觉编码器是一个 27 层 Transformer,从 Qwen3-VL 视觉编码器 [4] 初始化;它以原生分辨率处理图像和帧,范围从 4,096 到 16.8M 像素,从三个中间层和最后一层提取特征。投影模块合并每个 2x2 的块组,并将其映射到解码器的隐藏空间。解码器堆叠了 48 层:从 Qwen3-8B 继承的 36 层自注意力层,以及 12 个门控交叉注意力层,每四层放置一个。在总共 113 亿参数中,约 82 亿构成语言骨干网络,23 亿构成交叉注意力堆栈,8 亿构成视觉编码器和投影模块。

2.2 门控交叉注意力

每个交叉注意力层遵循 Flamingo [2] 的门控设计——查询来自文本隐藏状态,键和值来自视觉令牌——此处使用分组查询注意力(32 个查询头 / 8 个键值头)和 QK-RMSNorm 实现。该层将其注意力和前馈路径包裹在 tanh 门控中,这些门控的标量是零初始化的,因此训练从完整的语言骨干网络开始(第 3 节)。36 个自注意力层从不接触视觉令牌。

2.3 XRoPE

据我们所知,XRoPE(交叉注意力旋转位置编码)是首个为视觉-语言架构的交叉注意力通道引入的位置编码:它赋予了这个通道原本缺乏的视觉流位置信息。XRoPE 将文本令牌和视觉块放置在一个三轴坐标空间 (t, h, w) 中,按其逻辑流位置排序(图 3)。一个文本令牌沿所有三个轴一起前进,坐标为 (x, x, x)。一个合并后块网格为 h′ x w′ 的帧,在紧随前面文本的坐标 t 处锚定,其块排列为:

p_{a,b} = (t, t + a, t + b), 0 ≤ a < h′, 0 ≤ b < w′, (1)

因此高度和宽度偏移量搭载在共享的时间锚点上。在视觉侧关闭该帧的分隔符令牌和文本流中该帧的占位符令牌都采用 (x, x, x),其中 x = max(t + h′, t + w′),下一个文本令牌从 x + 1 继续:两个通道沿单一时间线前进。64 对旋转频率对在 (t, h, w) 上按 (24, 20, 20) 分配,旋转在交叉注意力中相遇前应用于文本侧的查询和视觉侧的键。t 轴是相对序列坐标,而非挂钟时间;真实时间通过第 2.4 节的时间戳令牌进入。

图 3 XRoPE,交叉注意力通道的位置编码。文本令牌和视觉块共享一个三轴坐标空间 (t, h, w),按其逻辑流位置排序:一个文本令牌沿所有三个轴一起前进,而锚定在坐标 t 处的帧,其块从左上角的 (t, t, t) 平铺到右下角的 (t, t + h - 1, t + w - 1)。在视觉侧关闭每个帧的分隔符令牌和文本流中该帧的占位符令牌接收相同的坐标,因此两个通道沿单一共享时间线前进。旋转在交叉注意力中相遇前,应用于文本侧的查询和视觉侧的键。

2.4 绝对时间戳

位置信息本身并不能说明挂钟时间,且帧率各异:MOSS-VL 以 1-16 fps 采样视频,采用运动自适应方式(表 2)。因此,每个帧在文本流中之前都有一个绝对时间戳 <|time_start|>X.X seconds<|time_end|>,以便模型直接从令牌中读取真实时间,而不是从位置推断,从而在任何采样率下时间都保持显式。

2.5 实时性源于设计

当新帧到达时,仅对该帧进行编码;其键和值被追加到交叉注意力缓存中,之前的帧既不会被重新编码,其键和值也不会被重新计算。解码序列仅增加该帧的时间戳令牌和一个占位符令牌——图像块令牌保持在视觉侧——因此新到达的流不会破坏解码状态,下一个生成的令牌已经通过门控层关注到更新后的缓存。第 6 节量化了这在推理时带来的效率(图 4)。

2.6 发布模型

我们发布了同一架构的五个检查点(表 3)。0708 运行——MOSS-VL-Base、MOSS-VL-Instruct、MOSS-VL-Realtime——是本报告的主题;0408 对是同一架构的早期独立训练运行,为研究连续性而发布。

表 2 MOSS-VL 配置,所有发布检查点相同。视频输入范围反映了原生训练设置;发布的处理器默认为 1 fps 和 256 帧,我们的评估保持 1 fps,并将上限提高到 768 帧(第 6 节)。

3 预训练

MOSS-VL 采用四个阶段进行预训练:视觉-语言对齐、大规模多模态预训练、高质量多模态预训练,以及最后的退火和长上下文训练阶段。表 4 列出了每个阶段的令牌预算、样本数量、最大序列长度、可训练模块和峰值学习率,包括第 4 节中的两个后训练阶段。该表展示了课程的形状:最大序列长度从 8K 增长到 256K 个令牌,且令牌预算向后阶段倾斜,同时样本数量下降了数个数量级——早期是大量短样本,后期是数量少得多但更长、更密集的样本。整个过程中,数据已针对我们的评估套件进行去污处理。

此次训练运行的一个决定性特征是我们数据合成的规模。除了从现有语料库收集和重组的数据外,我们在整个课程中大规模合成了高质量的描述、OCR、指代定位和时间定位数据。这四种类型涵盖了视觉-语言模型的感知基础——描述场景、读取嵌入文本、定位对象和在时间上锚定事件——这一合成核心支撑了发布模型强大的感知和时序理解基础。

3.1 阶段 1:视觉-语言对齐

阶段 1 连接两个预训练组件。仅更新新引入的参数——投影模块和交叉注意力层——而视觉编码器和语言模型保持冻结;表 4 中的高峰值学习率仅适用于这些新模块。数据包括两类:图像描述和 OCR,序列保持在 8K 个令牌的短长度。

表 3 发布的 MOSS-VL 检查点。0708 运行是本报告的主题:MOSS-VL-Base 是预训练模型,MOSS-VL-Instruct 是其指令微调后继版本,MOSS-VL-Realtime 则从 MOSS-VL-Instruct 开始使用 Realtime-SFT 继续训练。0408 检查点是同一架构的早期独立训练运行,为研究连续性而一同发布。全部五个均可在 HuggingFace 上的 OpenMOSS-Team 组织下获取。

3.2 阶段 2:大规模多模态预训练

连接器对齐后,阶段 2 解冻整个模型并提供广度。数据混合包括图像和视频描述、OCR、指代定位、交错图像-文本文档和纯文本预训练语料库,以及涵盖单图像、多图像集、视频和纯文本跨不同领域的多模态理解数据,还有推理数据。上下文窗口扩展到 64K 个令牌,以容纳长交错文档和视频。

3.3 阶段 3:高质量多模态预训练

阶段 3 投入了课程中最大的令牌预算(表 4)用于其最高质量的数据。混合保持了阶段 2 的类别,但重新平衡:描述减少,多模态理解和推理数据占比增大,并引入了数学、知识密集型数据和时间定位数据。序列扩展到 128K 个令牌。

3.4 阶段 4:退火与长上下文训练

最后阶段结合了长上下文训练和高质量退火。一个数据分支由长视频描述、长视频问答和长视频时间定位,以及长文档和长文本数据组成,并与少量常规类别数据混合,将序列扩展到 256K 个令牌。另一个是退火混合,重新加权偏向数学、知识密集型数据和指令调优及问答数据,并包含身份数据。此课程产出 MOSS-VL-Base,这是后训练的起点(第 4 节)。

4 后训练

后训练分为两个有监督阶段(表 4);两者均不使用强化学习或“思考”模式。标准的监督微调(SFT)将 MOSS-VL-Base 转变为 MOSS-VL-Instruct,一个离线指令跟随者。Realtime-SFT 则从 MOSS-VL-Instruct(表 3)继续,并植入实时交互范式:在每一帧决定是否说话,在无需发言时保持沉默,并在场景推翻先前的答案时进行修正。MOSS-VL 中每个实时特定的设计选择都存在于这最后一个阶段,该阶段占总训练令牌的不到 3%。

4.1 监督微调

我们在 760 万个指令样本(1028 亿个令牌)上,使用标准的助手回复下一个令牌交叉熵损失对 MOSS-VL-Base 进行微调,序列长度可达 128K 个令牌(表 4)。样本结合了从现有语料库收集和重组的数据以及内部合成的数据,所有数据在进入混合之前都经过过滤、去重、针对评估套件的去污处理和质量筛选。混合覆盖了基于单图像、多图像集、视频和纯文本的通用问答;感知中心任务,包括 OCR、文档理解以及空间和时间定位;图像和视频描述;以及推理中心任务,涵盖多模态推理、数学和其他学科、代码和知识密集型问答,以及身份数据。

4.2 Realtime-SFT:学习何时说话

Realtime-SFT 教会模型将传入的视频视为一系列决策,而非一个已完成的成品。训练样本按到达顺序交错文本和帧:每个帧后跟一个决策槽位,每个槽位采用三种形式之一——<|silence|>(继续观看)、<|response|> 后跟文本(现在说话),或一个以 <|silence|> 结尾的回复(结束发言)。一个回复按帧逐帧分布在连续的槽位上,模拟速率受限的实时输出,并且单个用户轮次可能包含若干次独立的发言。实现这一功能仅需增加两个新的词表条目——两个状态令牌,从语义相关的现有令牌嵌入初始化。发言或等待的决策本身是普通的下一令牌预测:每当最可能的下一令牌是 <|silence|> 时,模型等待下一帧;否则它解码一个回复。没有附加专用的决策头。

数据特征。Realtime-SFT 语料库(56 万个样本,约 3480 亿个令牌;表 4)的独特之处在于,每个样本都将模型置于一个明确的交互角色,而非普通的问答角色:必须在其条件满足时恰好触发一次的常驻指令;答案必须随证据积累而更新的驻留问题;持续的实时评论;跨流累积的计数;判断当前是否是说话时机的探针;以及保持身份一致性的独立于视频的对话。此外,一部分离线问答和通用多模态数据用于保持离线能力。

数据构建。语料库有两个来源。我们首先收集用于流式视频理解的开源数据集,并对其进行严格过滤和重新标注。然而,更重要的是我们自行合成的数据,针对现有数据集很少或根本不提供的行为:保持沉默直到证据出现,随着场景演变修正答案,以及当新事件中途打断回复时进行恢复。合成遵循 MOSS-Video-Preview [39] 中引入的描述驱动流程:分层的、时间密集锚定的描述被挖掘用于目标对象的状态转换;每个转换产生一个问题、一个立即可回答的回复和一个更新轨迹;回复被锚定到视觉时刻,在帧间布局,其间穿插沉默,并进行质量过滤。本轮升级了该流程四个阶段中的三个。时间锚定现在逐帧对照实际镜头进行验证:每个回复被分配其证据变得可见的时刻和其停止有效的时刻。交接更自然:被新事件推翻的回复被重写为平实的语言自我修正,而非用专用的中断令牌标记。最后,质量门检查每个样本与其帧的对应关系,仅保留那些回复在发出时基于可见内容的样本。

语料库统计。交互优先的侧重点在数据中显而易见。在整个语料库中,模型被监督了 220 万次发言决策,其中 58.7% 是自定时的,而非由新的用户问题提示;在 5.1% 的样本中,目标事件从未发生,正确的行为是全程保持沉默。流以 1 fps 运行,每个窗口最多 768 帧(约 12.8 分钟)。语料库已针对评估套件进行去污处理:基准视频通过预留列表排除。

4.3 模式控制与训练目标

MOSS-VL 中的模式控制仅需一条系统提示。流式和实时模式共享一条提示——实时操作是流式的特例——而离线推理不使用任何提示。因此,一套权重可在三种推理模式下运行,架构零更改。提示重现如下;完整的对话模板,包括帧和时间戳的交错方式,在附录 A.1 中给出。

共享的流式/实时系统提示

你是一名擅长实时视频分析的人工智能助手。视频逐帧流式传输给你。在每一帧,你都独立决定是回复还是保持沉默——当没有相关事件发生时输出 <|silence|>,当视觉内容值得回复时进行回复。

监督仅覆盖助手的可控部分:回复文本和两个状态令牌。系统和用户轮次以及扩展的视觉令牌被排除在损失之外。核心困难在于不平衡:沉默槽位远超发言决策,在统一权重下,模型只会学习保持沉默。因此,我们使用焦点因子和逆频率类别系数对两个状态令牌进行重新加权,并在每一步计算全局批次上的类别统计,这使得类别系数在数据并行的各个 ranks 上保持一致:

还有一个掩码选择在流式场景中尤为重要。在离线聊天中,关闭助手轮次的令牌标志着交流结束;在流式中,轮次边界通常意味着用户插话,而世界——以及对话——仍在继续。因此,我们也从监督中排除助手的轮次结束令牌,使模型永远不会仅仅因为新的用户轮次出现而学习结束回复。在一个受控的单变量对比中,此掩码将发言频率提高了 39%,平均回复长度提高了 68%。

这里植入的行为在第 6 节中通过四个流式基准进行了定量评估,并在图 5 中进行了定性展示。

5 基础设施

MOSS-VL 在 Megatron-LM 堆栈 [35] 上训练,该堆栈结合了数据、张量、序列和上下文并行性,以承载从 8K 到 256K 令牌序列的课程(表 4)。变长多模态样本被打包成完整序列,使批次在混合的图像、视频和文本数据中保持密集。

用于交叉注意力的 FlashAttention。第 2.2 节中的门控交叉注意力具有一种可见性模式,现成的注意力内核无法满足:每个文本查询关注流中其之前每个帧的视觉令牌(第 2.5 节)。因此,可见性是键值序列的每个查询前缀,逐帧增长。

图 4 MOSS-VL 与 Qwen3-VL-8B 的实测服务延迟对比——两者使用相同的 Qwen3-8B 语言骨干网络,隔离了视觉集成架构。两个模型均使用 SGLang 在单张 H200(TP=1,BF16,相同引擎版本)上进行离线服务,并设置了相同的生成长度上限,所有运行均达到该上限;每个点是五次独立冷启动的平均值(误差线:样本标准差)。(a, c) 在 ViT 输出匹配的情况下,首令牌时间(TTFT)差距随视觉上下文增长从 2.8 倍扩大到 5.1 倍,端到端延迟从 1.9 倍扩大到 4.3 倍。(b, d) 在相同视频、相同分辨率和帧数下:Qwen3-VL 在时间轴上压缩 2 倍,而 MOSS-VL 放弃时间压缩以便每帧到达时立即编码——在相同输入上承载约两倍的视觉令牌——但它的速度从未落后,且其领先优势随流长度增长而扩大。延迟增长更慢源于仅追加的交叉注意力设计:视觉令牌从不进入解码序列(第 2 节)。

FlashAttention 暴露了因果或窗口掩码,而将该模式实现为密集交叉注意力掩码则会消耗与文本和视觉序列长度乘积成正比的存储和带宽。因此,我们将 FlashAttention-3 [33] 扩展了一个紧凑接口 cross_kv_boundary,它将每个查询行的可见前缀编码为一个 32 位整数,并通过算子模式、调度器和 CUDA 前向及反向内核传递。超过行边界的键值块被裁剪掉,而非计算和掩码,因此内核成本与可见性成比例。后端覆盖了密集、变长和 KV 缓存执行路径——这使其与打包训练兼容——并作为上游实现的衍生版本随模型一起发布。

服务与发布。我们对 MOSS-VL 的 SGLang [56] 集成已合并到上游,第 6 节(图 4)中的离线服务测量在此堆栈上运行。实时交互作为 Transformers 参考实现单独提供,与模型权重一起在 GitHub 和 HuggingFace 上发布。

6 评估

我们根据每个模型的构建目标进行评估:MOSS-VL-Instruct 在涵盖五个能力域的 39 个离线基准套件上进行评估(表 5),而 MOSS-VL-Realtime 在四个流式基准——OVO-Bench [20]、OmniMMI [44]、StreamingBench [21] 和 ProactiveVideoQA [43]——上进行评估,这些基准共同覆盖了表 1 中能力层级的 L2-L4。

表 5 离线结果:MOSS-VL-Instruct(0708 版本)与相似规模的开源模型对比,按能力域分组。粗体 = 最佳,下划线 = 次佳,"-" = 未报告;LLaVA-OV-2 = LLaVA-OneVision-2-8B。评估协议和基线来源详见第 6.1 节。

6.1 离线结果

表 5 将 MOSS-VL-Instruct 与相似规模的开源模型——Qwen3-VL-8B [4]、Qwen2.5-VL-7B [5]、LLaVA-OneVision-2-8B [3] 和 Gemma-4-12B-IT [14]——在多种模态感知、视频理解、指代定位、文档/OCR 和推理方面进行了比较。MOSS-VL 结果以 1 fps 采样视频,最多 768 帧,遵循基准的官方协议(如有规定);DocVQA 和 InfoVQA 使用验证集。基线数据取自各自的官方报告,反映了作者们的推理设置,可能与我们的不同,特别是在视频帧数方面。例外情况是 Gemma-4-12B-IT 列,我们自己在与 MOSS-VL 相同的协议下进行了评估,以及 Qwen3-VL 在 OmniDocBench (v1.6) 上的条目,使用官方 Qwen3-VL 食谱中的 Markdown 提示进行评估;其余 OmniDocBench 基线被省略,因为它们的官方数据在指标上不可比。

感知是最强的板块:MOSS-VL-Instruct 在十二行中取得了五个最佳——MMBench-EN (88.1)、POPE (89.4)、V* (89.0),以及 MME-RealWorld (66.3) 和 BLINK (78.0),后者领先 8.9 个百分点。在视频方面,它领先于时间推理集——Minerva (40.5)、TOMATO (39.5) 和 VideoMME-Logical (17.1),每个至少领先 4.9 分——以及 EgoSchema (67.0),这与第 3 节中构建的感知和时间理解基础一致。优势还延伸到其他领域:对抗性的 Ref-Adv 指代定位集由 MOSS-VL-Instruct 以 7.7 个百分点领先 (57.0),文档解析 OmniDocBench 领先 4.0 分 (88.9),推理方面它拿下了 VisuLogic (27.5) 并共享了最高的 ERQA 分数 (45.8)。主要差距在于 MMMU、文档理解和标准指代定位(RefCOCO-REC)以及时间定位(TimeLens);前两个我们将在第 7 节中讨论。

6.2 流式基准测试

表 6 报告了四个流式基准测试的子集级别结果。基线是开源流式模型——AURA [24]、M4(随 OmniMMI 一同发布)[44]、ROMA [36]、JoyAI-VL-Interaction [51]、VideoChat3-4B [18]、VisPeak-7B [11] 和 MMDuet 系列 [41-43];该面板遵循每个基准的已发布覆盖范围,因此在四个基准中有所不同。基线数据取自各自的官方报告,但 MMDuet 在 OmniMMI 上的条目除外,其自身报告未覆盖,取自 ROMA 报告;MOSS-VL-Realtime 数据来自我们在每个基准官方协议下的评估。MOSS-VL-Realtime 运行一个 82 亿参数的语言骨干网络,与 7-8B 级别的基线相当;其额外参数位于解码序列之外,即视觉编码器和交叉注意力堆栈中(第 2 节)。

每个基准都在子集级别报告。OVO-Bench 区分前向主动响应(FAR)、后向追踪(BT)和实时视觉感知(RTVP)。OmniMMI 覆盖主动警报(PA)、动态状态定位(SG)、多轮依赖(MD)、动作预测(AP)和说话人识别(SI);其 Avg 是五个子集的平均值,仅对报告了全部五个子集的模型显示。StreamingBench 分组为实时视觉理解(RT)和上下文理解(CTX),其中主动输出(PO)和顺序问答(SQA)作为 CTX 的子集,为主动性分析单独列出;Avg(视觉)是 RT 和 CTX 组得分的平均值——MOSS-VL 不接受音频输入,因此不评估依赖音频的 Omni-Source 组,也不报告官方总体得分。ProactiveVideoQA 按视频来源分为网络(WEB)、自我中心(EGO)和电视剧(TV)视频问答,以及视频异常检测(VAD)。

MOSS-VL-Realtime 在四个基准中的三个上取得了最佳平均分——OVO-Bench (70.2 vs. 次佳 65.3)、OmniMMI (32.7 vs. 25.4) 和 ProactiveVideoQA (47.2 vs. 42.7)——并在 StreamingBench 的视觉平均分上排名第二 (69.7 vs. AURA 的 71.1)。

子集模式比平均值更能说明问题。三个直接测试主动行为——在正确时机主动发言——的子集全部由 MOSS-VL-Realtime 拿下:OmniMMI 上的主动警报 (66.0 vs. 37.5)、StreamingBench 上的主动输出 (60.0 vs. 53.2) 和 OVO-Bench 上的前向主动响应 (62.1 vs. 55.8)。ProactiveVideoQA 的每个子集都是主动的,总体上跟随此趋势,而 OVO-Bench 上的后向追踪 (72.6 vs. 60.4) 表明累积的流历史仍然可用。这些胜利集中在响应时间是被测试技能的地方——这正是 Realtime-SFT 直接监督的行为(第 4.2 节);当子集简化为对当前场景的感知问答时,AURA 保持领先。

表 6 流式基准测试结果:MOSS-VL-Realtime 与开源流式基线模型在子集级别的对比。粗体 = 最佳,下划线 = 次佳;"-" = 该模型官方报告中未报告该子集。子集缩写、每个基准的 Avg 约定和数据来源详见第 6.2 节。

6.3 推理效率

图 4 测量了与 Qwen3-VL-8B 的服务延迟对比,后者共享 Qwen3-8B 语言骨干网络 [49];因此比较隔离了视觉集成架构。两个模型都在单张 H200 上运行离线 SGLang 服务(第 5 节)。在 ViT 输出匹配的情况下,首令牌时间差距随视觉上下文增长从 2.8 倍扩大到 5.1 倍,端到端延迟从 1.9 倍扩大到 4.3 倍。同一视频的比较对我们更严格:MOSS-VL 放弃时间压缩以便每帧到达时立即编码(第 2.5 节),因此在相同输入上承载约 Qwen3-VL 两倍的视觉令牌——但在所有测量点上它都从未落后。优势随视觉上下文增长而扩大,这正是实时助手所处的模式:视觉历史按分钟累积,而回复必须按时到达。

6.4 定性结果

图5展示了已植入的行为在实时运行中的表现,截取自发布版演示的两个会话。在常驻条件指令下,模型在整个视频流中保持沉默,并在四次目标接触时恰好触发,且仅在这四个时刻触发;在单条解说指令下,模型在一秒内开始输出,并跟踪一个任意球序列——从哨声、射门、庆祝到比分更新——贯穿整个过程。这两个会话在真实世界的时序条件下,分别践行了Realtime-SFT语料库(第4.2节)中的核心交互角色——一个必须在其条件满足时恰好触发一次的常驻指令,以及持续的实时解说。

7 讨论

总体来看,评估显示了一种模式而非单一分数。流式方面的胜利集中在测试“何时说话”的子集;服务优势恰好随视觉历史累积而扩大;离线优势则集中在时间推理视频集上。没有任何单一组件能解释这种形态。这正是从外部看到的协同设计的样子:一个让感知与生成自然并行的架构,一个监督响应时机的语料库,以及一个在构建基础后通过一个轻量级最终阶段使其具备交互性的课程。我们将整个系统,而不仅仅是权重,视为发布内容:随五个检查点一同发布的是分阶段训练课程(表 4)、完整的 Realtime-SFT 对话模板(附录 A.1)、实时推理实现、扩展的 FlashAttention-3 后端(第 5 节)以及第 6.4 节中录制的现场会话。

局限性同样明显。MOSS-VL-Instruct 在 MMMU 等重推理套件和以文档为中心的基准上落后于同规模的最强开源模型(表 5):MOSS-VL 未配备“思考”模式,其训练针对实时视频而非应试式推理进行了优化。本报告围绕的核心能力在其最高层级上仍是通过定性方式证明的:定量验证止于 L2-L4,因为公开的流式基准止步于此,尚无现有基准衡量生成过程中的感知——即模型是否在场景逆转的瞬间修正或截断自己的回复。

这两个局限性标志着近期议程:针对 MOSS-VL 系列的强化学习后训练已在我们的公开路线图上,以及一个针对 L5 行为的专用基准,该领域目前仍缺乏。

8 结论

MOSS-VL 使实时交互成为开源视觉-语言模型家族的一等公民能力。它是内建的,而非外挂的:带有 XRoPE 的门控交叉注意力允许在生成文本时接收帧,合成的交互数据教会模型何时说话、何时等待以及何时修正,分阶段课程将所有实时特定选择限制在一个轻量级最终阶段。在评估中,MOSS-VL-Instruct 在离线场景表现强劲,尤其是在时间推理任务上;MOSS-VL-Realtime 在测试响应时机的流式基准上领先;服务延迟随视觉上下文增长的速度慢于交错式同行。权重、课程和代码均已开源。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/30 6:38:49

ISM330DHCX自检失败排查:从硬件到寄存器的完整指南

很多玩过ST六轴IMU的工程师&#xff0c;第一次在板子上读到ISM330DHCX返回“Self-test failed”时&#xff0c;第一反应基本都是“芯片是不是坏了”。我也一样&#xff0c;几年前第一次在项目里用这颗料&#xff0c;自检一失败就开始怀疑采购渠道、怀疑焊接、怀疑人生&#xff…

作者头像 李华
网站建设 2026/8/30 6:37:15

大模型后训练与RLVR:用可验证奖励实现稳定推理

大模型后训练&#xff08;post-training&#xff09;和可验证强化学习&#xff08;RLVR&#xff0c;Reinforcement Learning with Verifiable Rewards&#xff09;是当前从“模型会生成”走向“模型能稳定解决问题”的关键环节。斯坦福大模型开发课 EP16 把这条链路单独拎出来讲…

作者头像 李华
网站建设 2026/8/30 6:37:01

TS3312AMR车规级AMR磁传感器:选型、电路设计与验证要点

1. TS3312AMR到底是什么&#xff1a;先拆型号&#xff0c;再谈车规最近做汽车门模块传感器选型时&#xff0c;我在BOM表里看到了“TS3312AMR_ Automotive Grade”这个写法。第一反应是&#xff1a;这应该就是一颗AMR磁传感器&#xff0c;加了个车规后缀。但真正把资料翻完&…

作者头像 李华
网站建设 2026/8/30 6:35:13

告别照抄代码:三步读懂、拆解、改写训练法

这次我们不聊新模型&#xff0c;也不聊新框架&#xff0c;聊聊一个几乎每个程序员都遇到过的问题&#xff1a;为什么收藏了几百个“代码大全”&#xff0c;真到自己写需求的时候&#xff0c;还是两眼一抹黑&#xff1f;原因其实很扎心&#xff1a;很多人一直处于“照抄代码式学…

作者头像 李华
网站建设 2026/8/30 6:34:34

字节跳动2018 iOS校招第四批真题解析:从weak到Runloop

字节跳动2018校招iOS方向&#xff08;第四批&#xff09;这套题&#xff0c;我在准备校招时翻了不下五遍。它不像有些公司的题库那样纯粹堆概念&#xff0c;而是从内存管理、多线程、Runtime、UI布局、签名上架这些真正影响线上质量的点里挑问题&#xff0c;每一道都能往下追问…

作者头像 李华
网站建设 2026/8/30 6:32:35

轻量级CAD图纸查看工具实战:CadInspector如何简化看图流程

CAD 图纸处理&#xff0c;一直有个容易被低估的环节&#xff1a;查看。很多人的流程是&#xff0c;电脑里装一个完整版 CAD&#xff0c;日常打开图纸、核对尺寸、截图发群、偶尔标记修改意见。这个流程本身没什么问题&#xff0c;但一旦图纸数量变多&#xff0c;或者只是需要快…

作者头像 李华