news 2026/10/11 11:01:25

Meta 双响炮:SAM3 与 SAM 3D 同日发布,『分割一切』正式进入 3D 时代

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Meta 双响炮:SAM3 与 SAM 3D 同日发布,『分割一切』正式进入 3D 时代

Meta 双响炮:SAM3 与 SAM 3D 同日发布,『分割一切』正式进入 3D 时代

【免费下载链接】sam3项目地址: https://ai.gitcode.com/hf_mirrors/facebook/sam3

2023 年,Meta 用一张 1100 万图像、11 亿掩码的巨型数据引擎,把「Segment Anything」变成了 CV 社区的口号;两年后,这个口号开始从 2D 平面向 3D 空间迁移。2025 年 11 月,Meta 同日放出两枚重磅:第三代可提示分割基础模型SAM 3(Segment Anything with Concepts),以及把分割能力直接扩展到三维世界的SAM 3D。前者让「分割一切」从"框一个物体"进化到"描述一个概念、找齐所有实例",后者则让图像分割结果可以直接"立"起来成为 3D 表达——社区媒体用「效果逆天」来形容这次发布,智源社区的标题则直接点明了行业情绪:「『分割一切』正式进入 3D 时代」。

本文结合社区公开情报与本仓库(hf_mirrors/facebook/sam3)的真实模型文件,从时间线、技术架构、数据引擎到部署落地,拆解这枚"双响炮"到底改变了什么。

同日发布:一次针对「分割」能力的重新定义

先看时间线与产品定位。SAM 3 于 2025 年 11 月发布,官方定位是图像与视频统一的、可提示分割基础模型(unified foundation model for promptable segmentation in images and videos)。与前辈 SAM 2 相比,最本质的变化写在仓库 README.md 的第一段:

SAM 3 introduces the ability to exhaustively segment all instances of an open-vocabulary concept specified by a short text phrase or exemplars.

即:给定一句短文本(如"黄色校车")或若干示例图像,SAM 3 能把画面中所有匹配该概念的实例全部找出来并分割——这在官方术语里叫Promptable Concept Segmentation(PCS,可提示概念分割),是一个全新任务范式。作为对照,SAM/SAM 2 时代的视觉提示(点、框、掩码)一次只能锁定单个物体实例。

而同日发布的 SAM 3D 则把这条能力线延伸到空间维度。根据智源社区等媒体的报道,其核心看点是图像分割结果可以直接产出 3D 表达,并且对遮挡区域具备复原能力。两枚产品一"文"一"武":SAM 3 负责把"识别概念"的能力做深,SAM 3D 负责把"分割结果"的维度做宽。

从「分割实例」到「理解概念」:SAM 3 的技术内核

社区里最热闹的讨论集中在 SAM 3 的 PCS 能力上——正如 CSDN 上一篇高阅读量文章所说,SAM 3 的意义"不止分割一切,它开始理解世界了"。这种"理解"体现在三层。

架构:检测器 + 跟踪器,共用一个视觉主干

从本仓库 config.json 可以直接读到 SAM 3 的完整配置:model_type为sam3_video,由detector_config与tracker_config两大部分组成。

  • 检测器(Detector):基于 DETR 的架构。detr_decoder_config中num_queries为 200,use_presence_token为 true——这正是 SAM 3 论文中强调的存在性预测头(presence head):用一个全局学习令牌先判断"目标概念是否出现在画面中",把"识别(是什么)"与"定位(在哪里)"解耦,从而避免两类目标互相冲突。Ultralytics 的消融数据显示,加上存在性分支后 CGF1 从 57.6 提升到 63.3。
  • 文本编码器:text_config直接复用 CLIP 的文本分支(clip_text_model,24 层 Transformer,隐藏维度 1024,词表 49408),tokenizer 也在仓库中(tokenizer_config.json 标明CLIPTokenizer,max_length为 32)。这意味着开放词汇能力来自 CLIP 对齐的语义空间。
  • 视觉主干:vision_config中的sam3_vit_model是一个 32 层 ViT,输入分辨率 1008×1008,patch size 14,在 7/15/23/31 层做全局注意力,并带 3 级 FPN 特征金字塔(num_feature_levels: 3)。
  • 跟踪器(Tracker):继承 SAM 2 的 memory-based 视频分割体系,memory_attention_*、mask_decoder_config、prompt_encoder_config一应俱全,并显式开启enable_occlusion_spatial_embedding与enable_temporal_pos_encoding_for_object_pointers——这两项正是视频场景下处理遮挡、拥挤与跟踪丢失的关键机制,配合hotstart_*系列启发式参数完成时间维度的消歧。

数据:SA-CO,比现有基准多 50 倍的概念集

PCS 能力不是凭空长出来的,靠的是新的数据引擎。README 中给出了两个关键数字:

  • 新的SA-CO benchmark包含270K 个独特概念,是现有基准(如 LVIS 约 4K 概念)的50 倍以上;
  • SAM 3 在该基准上达到人类表现的 75%–80%(Ultralytics 文档进一步给出:达人类标注下界的 88%)。

训练侧,SA-CO 由 520 万张人工标注图像(SA-Co/HQ)、14 亿个 AI 合成掩码(SA-Co/SYN)与 5.25 万段视频(SA-Co/VIDEO)构成,AI 标注器基于 Llama 提出名词短语、多模态 LLM 做质量验证、主动挖掘把人力集中在失败案例上——这套"人机协同数据引擎"把标注吞吐量提升了约 2 倍。

性能:30ms 处理 100 个检测对象

社区情报中反复出现的一个数字是"30 毫秒处理 100 个检测对象,性能提升 2 倍"。这与 Ultralytics 公布的基准一致:在 H200 GPU 上,SAM 3 单张图像推理约 30ms 即可检出 100+ 物体;LVIS 零样本掩码 AP 达 47.0(此前最佳 38.5,提升约 22%);视频侧 MOSEv2 基准 J&F 60.1,比 SAM 2.1 高 25.5%。这也是为什么 CSDN 教程社区能在发布后不到一个月内就涌现大量"文本提示分割"实战文章——零样本、开放词汇、多实例,这三个点对工程落地太有吸引力了。

仓库实证:一个 3.4GB 的统一模型

本仓库即 SAM 3 的 Hugging Face 镜像,其文件结构本身就能说明问题:

  • config.json 声明的唯一架构是Sam3VideoModel——图像、视频、PCS、PVS 全部收敛进一个模型;
  • model.safetensors 的 LFS 指针显示权重约 3.44GB(对应约 4.7 亿参数,Ultralytics 标注为 3.45GB / 473.6M),远大于 SAM 2 base 的 162MB;
  • processor_config.json 同时包含Sam3ImageProcessorFast(图像 1008×1008、掩码 288×288)与Sam2VideoVideoProcessor(视频采样),印证"图像+视频统一"的定位;
  • configuration.json 标注任务为mask-generation,框架 PyTorch。

用 Transformers 跑一次文本提示分割,官方在 README.md 里给出的路径非常干净:

from transformers import Sam3Processor, Sam3Model import torch from PIL import Image import requests model = Sam3Model.from_pretrained("facebook/sam3").to("cuda") processor = Sam3Processor.from_pretrained("facebook/sam3") image = Image.open(requests.get("http://images.cocodataset.org/val2017/000000077595.jpg", stream=True).raw).convert("RGB") # 文本提示:"ear" —— 分割图中所有耳朵实例 inputs = processor(images=image, text="ear", return_tensors="pt").to("cuda") with torch.no_grad(): outputs = model(**inputs) results = processor.post_process_instance_segmentation( outputs, threshold=0.5, mask_threshold=0.5, target_sizes=inputs.get("original_sizes").tolist() )[0] print(f"Found {len(results['masks'])} objects")

注意最后一行:不再是一个掩码,而是Found N objects——一段文本提示会返回所有匹配实例的掩码、边界框与置信度。README 还演示了正/负框示例、文本+负框组合、批量混合提示等交互式细化玩法,这正是"示例提示比视觉提示收敛快得多"的工程基础(Ultralytics 数据显示仅文本 46.4 CGF1,加 3 个示例即到 65.0)。

图像分割结果直出 3D,有遮挡也能复原

回到标题中的另一半——SAM 3D。智源社区的报道标题用了两个关键词:"图像分割结果直出3D"与"有遮挡也能复原"。翻译成技术语言:

  • 直出 3D:传统 3D 重建流水线通常需要"先分割、再立体匹配/重建"的两段式处理,且 2D 分割误差会逐级传导。SAM 3D 的思路是把分割与 3D 表达统一在一个模型里,让"这张图里有什么"和"它在空间里长什么样"共享同一套表征,图像分割结果直接成为 3D 输出的中间表示。
  • 遮挡复原:这是 3D 理解最难啃的骨头之一——现实场景中物体互相遮挡,单视角信息天然缺失。社区报道所称的"有遮挡也能复原",意味着模型不再满足于"只分割可见部分",而是能基于对概念的语义理解推断被遮挡区域的几何,这与 SAM 3 的"概念理解"能力一脉相承:只有当模型"知道"这是一把椅子,它才可能补全被桌子挡住的椅腿。

需要说明的是,SAM 3D 目前更多以研究性成果与演示形态出现,其公开资料详于效果展示、略于完整技术细节;但把它与 SAM 3 放在同一天发布,Meta 的意图相当明确——2D 的概念分割与 3D 的空间理解,正在被拼进同一块"感知底座"。

3D 时代对机器人、XR 场景的想象力

社区对这次发布的高频讨论场景集中在两个方向。

机器人:机器人的操作闭环里,抓取、避障、位姿估计都依赖"准确知道物体边界及其空间位置"。过去一个常见的工程痛苦是:2D 分割模型质量很高,但拿到三维空间还要再走一遍点云配准、深度估计、占用栅格等手工管线,且遮挡场景下 2D 掩码本身就不可靠。SAM 3 把"用一句话圈定所有实例"变成零样本能力,SAM 3D 又承诺"直出 3D、遮挡可复原",意味着机器人的"看见"环节可能从"分割+重建"的流水线,收缩为"一句话 + 一个模型"。这对仓储分拣、家庭服务、自动驾驶的视觉栈都是结构性变化。

XR(扩展现实):空间计算最缺的从来不是算力,而是"理解房间的能力"。Meta 自家 Ray-Ban 智能眼镜和 Quest 生态,本质上都是"为物理世界建立可交互副本"。SAM 3D 让开发者可以用自然语言在真实场景里圈出物体并拿到其 3D 形态,AR 叠加、场景编辑、虚拟道具锚定这些玩法将大幅降低对标注数据和手工建模的依赖。智源社区报道中将此形容为"分割一切的 3D 时代",很大程度上正是因为 XR 是这条能力最直接、最性感的落地场景。

落地与冷思考:3.4GB 的模型,不是所有场景都扛得住

热度之下,社区的技术文章也在密集讨论工程侧的代价。梳理 CSDN 上的部署实战内容,可以得到一份清醒的清单:

  • 体积与速度:SAM 3 权重约 3.4GB、473.6M 参数,端到端推理(Ultralytics 实测)约 2921ms/图,相比 YOLO 系分割模型是数量级的差距。30ms 的亮眼数字来自 H200 高端卡 + 检测器路径,不代表普通边缘设备体验。
  • 优化三板斧:社区文章反复出现 ONNX 导出、FP16/8bit 量化、TensorRT 加速、批处理与图像嵌入缓存——这些是把它压进生产环境的常规手段;也有 C# 开发者用 OnnxRuntime 完成 C# 侧部署,说明生态接入已经走到 .NET 栈。
  • 中文提示与词汇边界:SAM 3 的开放词汇对齐的是 CLIP 语义空间,社区教程普遍提示"英文 Prompt 效果更稳",且模型擅长简单名词短语,复杂指代与组合推理(如"离镜头最近、没戴项圈的狗")需要外挂多模态大模型做 SAM 3 Agent 才能完成。
  • 与 SAM 2 的关系:SAM 3 完整保留了点/框/掩码视觉提示能力,接口与 SAM 2 兼容,可作为 SAM 2 工作流的 drop-in 升级——这也是官方 README 中明确承诺的兼容策略,降低了存量项目的迁移成本。

从 2023 年的"分割一切",到 2025 年底的"理解概念 + 直出 3D",SAM 系列完成了一次范式跃迁。SAM 3 与 SAM 3D 的同日发布,与其说是两篇新论文,不如说是 Meta 对外宣布的一条产品路线:分割不再是 2D 平面的终点,而是通往 3D 空间理解与具身智能的起点。对开发者而言,仓库里那份 3.4GB 的权重文件,就是这张路线图的入口——剩下的问题只有一个:你的场景,扛不扛得住这份算力账单。

【免费下载链接】sam3项目地址: https://ai.gitcode.com/hf_mirrors/facebook/sam3

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/11 10:59:08

糖尿病足溃疡风险评分:基于深度学习的CNN模型与PyTorch实现

简介:这是一份基于深度学习构建的糖尿病足溃疡(DFU)风险评分系统完整代码包,面向医学图像分析、AI辅助诊断方向的开发者与研究者,也适合作为深度学习的课程设计或毕业设计参考。压缩包共54个文件,以24个Pyt…

作者头像 李华
网站建设 2026/10/11 10:56:37

HarmonyOS 7 SpatialRecon:3DGS切场加载租约与迟到节点隔离【鸿蒙心迹】

一个3DGS预览页最容易被误判的状态,不是“加载失败”,而是“页面上出现了一个早已不属于当前选择的场景”。用户连续点了两次展厅,前一次模型大、后一次模型小,后发起的加载反而先结束。假如代码在每次 await 返回后都无条件更新当…

作者头像 李华
网站建设 2026/10/11 10:56:00

从零搭建JavaWeb登录注册项目:Servlet+JSP+JDBC实战

简介:面向Java Web初学者与在校学生的完整入门项目,整合用户登录、注册、信息修改与删除等常见模块,覆盖从表单到后台的完整请求链路,帮助理解Servlet、JSP、DAO分层与JDBC数据库操作流程。压缩包共89个文件,包含14个J…

作者头像 李华
网站建设 2026/10/11 10:55:43

【Linux】Shell 命令以及运行原理+权限管理

本文面向 Linux 初学者,系统讲解 Shell 命令执行原理与 Linux 权限体系两大核心主题。全文目录如下:Shell 基础、命令分类、运行原理、PATH 环境变量、权限管理、chmod/chown/chgrp 修改权限、umask 文件掩码、粘滞位。建议按顺序阅读,并结合…

作者头像 李华
网站建设 2026/10/11 10:55:43

Python卷积神经网络实现人脸表情识别:从数据集到实时摄像头

简介:这份资源面向计算机相关专业正在做毕业设计的学生,以及需要项目实战练习的学习者,提供了一套基于卷积神经网络的人脸表情识别系统完整方案。内容涵盖源代码、数据集、论文与训练好的模型,项目经导师指导并通过评审&#xff0…

作者头像 李华
网站建设 2026/10/11 10:55:40

Windows 变慢排查实战:识别软件后台小动作,清理启动项与右键菜单

地址 https://freedw.com/archives/7987 电脑装的软件一多,常见的不适感主要有三种:开机等待时间变长、右键菜单展开变慢、空闲时磁盘和 CPU 占用偏高。这三种现象往往对应不同的藏身位置,按位置逐项排查,比反复卸载重装更有效。…

作者头像 李华