如何快速上手InternVL3_5-4B-HF:从模型下载到首次图文对话的完整新手教程
【免费下载链接】InternVL3_5-4B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF
InternVL3_5-4B-HF是上海AI Lab开源的InternVL3.5 系列多模态大模型的 HuggingFace 标准格式版本(总参数 4.7B)。它原生支持图文对话、视频理解与思维模式推理,无需自定义代码,用官方 transformers 即可直接加载推理,是新手入门开源多模态大模型(MLLM)的理想选择。本教程带你从零开始:下载权重 → 配置环境 → 完成第一次图文对话,全程约 15 分钟 ⏱️。
一、模型亮点:为什么选 InternVL3_5-4B-HF
InternVL3.5 采用"ViT–MLP–LLM"架构,视觉编码器为 InternViT-300M,语言模型基于Qwen3-4B。相比前代 InternVL3,推理性能最高提升 16%,推理速度提升 4.05 倍,并新增 GUI 交互、具身智能等能力。
| 项目 | 说明 |
|---|---|
| 参数量 | 视觉 0.3B + 语言 4.4B(共 4.7B) |
| 上下文长度 | 32K(最大 40960 token) |
| 精度 | bfloat16(原生) |
| 格式 | HuggingFace 标准格式,transformers 直接加载 |
| 授权 | Apache-2.0,可免费商用 |
| 硬件需求 | 单张 12GB 以上显卡即可(8GB 显卡可 8-bit 量化运行) |
💡 HF 格式是官方 Transformers 标准,API 与社区生态完全兼容,后续可无缝接入 LMDeploy、vLLM 部署。
二、模型下载:一条命令获取完整权重
在目标目录下执行以下命令,即可下载全部模型权重(约 10GB):
git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF下载完成后,目录中的关键文件如下,建议对照检查是否完整 ✅:
| 文件 | 作用 |
|---|---|
model-00001-of-00002.safetensors、model-00002-of-00002.safetensors | 模型权重(分两个分片存储) |
model.safetensors.index.json | 权重分片索引 |
config.json | 模型结构配置(视觉/语言双编码器参数) |
tokenizer.json、vocab.json、merges.txt | 分词器与词表 |
preprocessor_config.json | 图像预处理配置(动态高分辨率切片参数) |
video_preprocessor_config.json | 视频帧预处理配置 |
chat_template.jinja | 对话模板,图文消息自动拼接 |
generation_config.json | 默认生成参数(bos/eos token) |
examples/ | 官方示例素材:image1.jpg、image2.jpg、red-panda.mp4 |
三、环境准备:最快配置方法
只需安装 PyTorch 与 transformers,无需任何自定义代码库:
pip install torch transformers>=4.52.1⚠️ 版本要求:请确保
transformers >= 4.52.1(模型自带配置为 4.55.0),版本过低会直接报错无法加载。
显卡建议:
- 12GB 及以上显存:直接以 bfloat16 精度加载,效果最佳;
- 8GB 显存:加载时加
load_in_8bit=True做 8-bit 量化,显存占用约减半; - 显存不够/多卡:加
device_map="auto"自动切分到多张卡。
四、首次图文对话:描述官方示例中的小熊猫
仓库自带的examples/image1.jpg是一张官方示例图,正好用来做第一次图文对话:
完整推理代码如下(加载模型 + 图文对话,共 20 行以内):
import torch from PIL import Image from transformers import AutoProcessor, AutoModelForImageTextToText model_path = "InternVL3_5-4B-HF" # clone 得到的目录 processor = AutoProcessor.from_pretrained(model_path) model = AutoModelForImageTextToText.from_pretrained( model_path, torch_dtype=torch.bfloat16, low_cpu_mem_usage=True, device_map="auto", # 显存不足时保留,显存充足可删除 ).eval() messages = [{ "role": "user", "content": [ {"type": "image", "image": Image.open("examples/image1.jpg")}, {"type": "text", "text": "请描述一下这张图片,并说出图中的动物"}, ], }] conversation = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=False) inputs = processor([conversation], images=[Image.open("examples/image1.jpg")], return_tensors="pt").to(model.device) output = model.generate(**inputs, max_new_tokens=512, do_sample=False) print(processor.decode(output[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))运行后,模型会识别出图中的红熊猫(小熊猫),并描述它趴在木板上、背景是树木枝叶的场景 🐾。
验证成功的 3 个信号:
- 终端出现下载权重后的加载进度,无
KeyError/ImportError; - 输出一段连贯的中文(或英文)图像描述;
- 描述中准确提到"小熊猫/红熊猫"及木桌等关键物体。
五、进阶玩法:思维模式与视频理解
1. 开启思维模式(Thinking Mode)
InternVL3.5 支持"先思考、后回答"的深度推理。只需在对话中加一条 system 消息,引导模型在think标签内逐步分析,并建议设置do_sample=True, temperature=0.6避免输出重复:
messages = [ {"role": "system", "content": [ {"type": "text", "text": "You are an AI assistant that rigorously follows this response protocol: ...(官方 R1_SYSTEM_PROMPT)"}]}, {"role": "user", "content": [ {"type": "image", "image": img}, {"type": "text", "text": "这张图里的动物有几只?"}]}, ]2. 视频理解
examples/red-panda.mp4配合同目录的video_preprocessor_config.json即可让模型"看视频"。将消息中的type: "image"换成type: "video",传入视频帧序列,模型即可回答视频内容相关问题(对话模板chat_template.jinja已内置<video>占位符,无需手写)。
六、新手常见问题(FAQ)
Q1:加载时报错Image file 'config.json' cannot be found或架构不识别?A:transformers 版本过低,升级到pip install -U transformers(≥ 4.52.1)即可。
Q2:显存不足,OOM 了怎么办?A:三招任选——① 加load_in_8bit=True(需安装bitsandbytes);② 显存充足时去掉device_map="auto"让模型完整进 GPU;③ 输入图片分辨率调低(preprocessor_config.json中min_patches=1、max_patches=12,动态高分辨率会自动控制 token 数量,一般无需手动干预)。
Q3:可以商用吗?A:可以。项目采用 Apache-2.0 协议,模型组件 Qwen3 同为 Apache-2.0。
Q4:之后想部署成在线服务?A:权重为 HF 标准格式,可直接用 LMDeploy(pip install lmdeploy>=0.9.1)或 vLLM 一键部署为兼容 OpenAI 接口的 API 服务;4B 版本单卡 A100/4090 即可承载。
七、总结
用3 步你就完成了 InternVL3_5-4B-HF 的从零上手:
- 下载:
git clone拿到完整权重(约 10GB); - 环境:
transformers >= 4.52.1+ PyTorch,无需自定义代码; - 对话:
AutoProcessor+AutoModelForImageTextToText加载,即可描述图片、理解视频、开启思维模式。
接下来可以试试:多轮图像对话、把examples/image2.jpg加进同一轮对话做多图比较,或用 LMDeploy 把它部署成 OpenAI 兼容的 API 服务。祝玩得开心 🎉
【免费下载链接】InternVL3_5-4B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考