InternVideo3智能体多模态推理详解:M^2LA潜在注意力与长视频闭环探索全拆解
【免费下载链接】InternVideo[ECCV2024] Video Foundation Models & Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo
🎬InternVideo3是上海AI Lab开源的最新一代视频多模态基础模型,它把视频理解从"看一遍就回答"升级为闭环智能体推理:通过M^2LA(Multimodal Multi-head Latent Attention,多模态多头潜在注意力)大幅压缩长视频 KV 缓存,配合MCR(多模态上下文推理)让模型像 Agent 一样反复"观察—思考—调用工具—验证"。本文面向新手,用 5 分钟拆解它的架构、原理与实战效果。
一图看懂 InternVideo3 架构
从上图中可以看到 InternVideo3 的两层结构:
- 底部:Vision Encoder(视觉编码器),负责把长文档、高清图、短视频、长视频统一转换成视觉 Token,原生支持多分辨率输入;
- 顶部:LLM 主干(Qwen3),在中间某些 Transformer 块中嵌入M^2LA 块(图中虚线框),将完整的 Key/Value 状态压缩为紧凑的"潜在状态(Compressed KV)",需要时再动态重建出各注意力头所需的 Key/Value。
这种设计让模型在理解384K Token 级超长视频上下文时不再被显存"卡脖子"。
什么是 M^2LA?潜在注意力为什么能省显存 🚀
传统 Transformer 每生成一个新 Token,都要把前面所有 Token 的 Key/Value 缓存(KV-Cache)在显存里,视频越长、帧数越多,缓存越大——这正是长视频大模型的"头号成本"。
M^2LA 的核心思路:不存全量 KV,只存压缩后的潜在状态。
- 把每个注意力头对应的 Key/Value 投影进一个低维潜在空间(latent);
- 解码时只把这份压缩 KV 缓存放进显存;
- 每次计算注意力时,按需重建(recover)出各个头专属的 Key 和 Value,再走 Softmax 注意力。
一句话总结:牺牲一点算力,换来大幅显存节省,且完整的多模态 Token 流一个不丢。
💡 实测效果(论文单卡 H200 数据):
| Prefill 长度 | 解码吞吐提升 |
|---|---|
| 32K Token | 1.84× |
| 128K Token | 4.12× |
| 256K Token | 4.77× |
| 384K Token | 5.01× |
更关键的是:原始 Qwen3-VL 主干在512K prefill时直接爆显存(OOM),而 M^2LA 改造版依然能稳定运行并完成 16K Token 解码。训练框架中对应的注意力实现位于 mla.py(MultiLatentAttention/MLAConfig),Qwen3 主干的 MHA→MLA 改造逻辑见 qwen3.py。
MCR 多模态上下文推理:让模型"闭环探索"长视频 🔍
如果说 M^2LA 解决了"看得下"的问题,MCR(Multimodal Contextual Reasoning,多模态上下文推理)解决的则是"想得对"的问题。
MCR 把观察、指令、中间推理、工具动作、反馈和记忆统一放进同一个持续演化的上下文中,模型不再是单次前向就给出答案,而是执行一个循环:
🔄观察 → 推理 → 调用工具 → 接收反馈 → 更新信念 → 再观察
配套的智能体视频探索工具箱包括:
- Segmentation(分段):把长视频切块处理
- ASR(语音识别):提取对白作为证据
- Temporal Grounding(时间定位):锁定事件发生的时间段
- Search / Summarization(检索与摘要):跨片段查找并汇总
- Verification(验证):对结论做二次核对
论文中的定性案例展示了它的真实威力:远处场景间的逻辑关联、事件归属判断、装备关系推理、甚至从叙事氛围推断隐含情绪——这些都是"看一遍"式模型很难做到的。
四阶段训练配方:从压缩注意力到智能体能力 📚
M^2LA 改造会暂时损伤模型原有能力,InternVideo3 用了一套分阶段训练配方逐步恢复并强化:
| 阶段 | 内容 | 数据规模 |
|---|---|---|
| 1️⃣ 继续预训练 CPT | 稳定 M^2LA 改造后的主干,恢复语言与多模态能力 | 16M 样本 / 约 13.5B Token |
| 2️⃣ 短到长 SFT | 短视频 → 长视频渐进式监督微调 | 7.2M 样本,含 37.9 万条长视频(平均 15.8 分钟)+ 100 万+ 合成 QA |
| 3️⃣ 规则强化学习 | 用 IoU/正确率奖励训练可验证的时间定位与选择题 | 可验证数据 |
| 4️⃣ 在策略蒸馏 | 强教师模型提供更完整、更扎实推理行为的蒸馏 | 推理密集型视频 QA |
长视频监督重点覆盖:感知识别、时空理解、事件与动作推理、整体语义概括。SFT 训练配置可参考 internvideo3_sft_long.py(视觉编码器 InternVideoNext + 潜在注意力投影器 + Qwen3-8B 语言模型),训练入口脚本见 train.sh。
基准成绩一览:开源模型第一梯队 🏆
从上表可以看到,InternVideo3(8B 开源权重)在Video-MME(73.8)、MLVU(77.3)、VRBench(69.4)、EgoSchema(76.6)等长视频基准上取得同规模开源模型最佳成绩,短视频 QA 平均分也位居前列,时空智能(QVHighlights、Charades-STA、ActivityNet)全面领先。对比数据由仓库内的 gen_card.py 从论文表格自动生成。
快速上手:3 步跑通长视频理解 💻
依赖安装:
pip install "transformers>=4.57.3" torch qwen-vl-utils加载模型并进行视频理解(完整代码见 README):
messages = [{ "role": "user", "content": [ {"type": "video", "video": "your_video.mp4", "fps": 4, "min_pixels": 128*2*32*32, "max_pixels": 256*2*32*32}, {"type": "text", "text": "请详细描述这个视频。"}, ], }]官方提供的评测脚本覆盖 Video-MME、MLVU、LongVideoBench、MVBench 等 20+ 基准,例如 eval_videomme.sh、eval_mlvu.sh、eval_grounding.py。
写在最后
InternVideo3 展示了多模态模型的一条清晰演进路线:
- M^2LA 潜在注意力→ 让长视频"放得下"(显存与吞吐)
- MCR 闭环推理→ 让长视频"答得准"(证据积累与验证)
- 分阶段训练配方→ 让能力"稳得住"(恢复 + 专精)
如果你正在做长视频理解、视频 Agent 或多模态推理方向的探索,这个开源仓库的 InternVideo3/ 目录值得完整读一遍 🌟
【免费下载链接】InternVideo[ECCV2024] Video Foundation Models & Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考