SAM 3。找到物体。

了解 Meta 的 Segment Anything Model 3:概念提示、交互式蒙版,以及与早期 SAM 模型的公开对比。

本指南由 Segmentit 独立编写。SAM 3 和 SAM 3D 由 Meta 开发;Segmentit 与 Meta 无关联。

什么是 SAM 3?

SAM 3(也常以 SAM3 搜索)是 Meta 用于查找和分割图像及视频中物体的模型。简短的概念提示(如“红色椅子”)可以识别匹配的实例;视觉提示则帮助引导选择。其输出为蒙版,即属于某个主体的像素。

Meta · SAM 3 ↗

SAM 3

图像 → 2D 蒙版

SAM 3D Objects

图像 + 蒙版 → 3D 物体

精确选区与立体重建解决不同需求。先选择正确的主体,再处理形状、纹理与场景构图。 探索 SAM 3D.

参与比较的模型

组织及合作团队所在的国家。每个模型均链接至官方项目。

SAM 3 能做什么?

文字提示

查找概念

描述“红色椅子”等主体,以查找匹配物体。

视觉提示

引导蒙版

使用点、框或图像示例指定要选择的内容。

视频分割

跟踪主体

研究模型结合检测与跨帧跟踪。

选择你的创作流程

为构图提取产品,准备透明抠图,或选择想转换为 3D 物体的主体。导出前请检查细节。

SAM 3如何运作?

描述或点选

文字指定概念,点和框提供视觉引导。

检测与分割

检测器识别匹配实例并预测其蒙版。共享的视觉骨干网络支持检测和视频跟踪。

细化蒙版

正向与负向提示帮助调整目标。该研究模型还可在视频帧之间保持物体身份一致。

研究模型架构。应用中提供的视频功能、表示形式和工具可能有所不同。 官方代码 ↗

SAM 1、SAM 2.1 与 SAM 3 对比

SA-37 · 交互式图像分割 · 平均 mIoU · 越高越好

SAM 1 HSAM 2.1 LSAM 3
不同点击次数下的精度SAM 1 H、SAM 2.1 L 和 SAM 3 在 SA-37 上的表现。纵轴范围为 0 至 100 mIoU。数值见表格。 0255075100 mIoU 1 次点击3 次点击5 次点击 SAM 1 H: 58.5 mIoUSAM 1 H: 77.0 mIoUSAM 1 H: 82.1 mIoUSAM 2.1 L: 66.4 mIoUSAM 2.1 L: 80.3 mIoUSAM 2.1 L: 84.3 mIoUSAM 3: 66.1 mIoUSAM 3: 81.3 mIoUSAM 3: 85.1 mIoU
数据与指标
SA-37 · Table 6
模型1 次点击3 次点击5 次点击
SAM 1 H58.577.082.1
SAM 2.1 L66.480.384.3
SAM 366.181.385.1

mIoU:预测蒙版与参考蒙版的平均交并比。测试了三种点击次数;连线仅连接观测值,不表示对中间结果的估计。

来源: Carion et al. · SAM 3 · Table 6 · arXiv v1 (2025) ↗

点击五次时,SAM 3 达到 85.1 mIoU,SAM 2.1 L 为 84.3。点击一次时,SAM 2.1 L 略领先:66.4 对 66.1。提升幅度取决于交互设置。

解读结果

对 2025 年论文中评估版本的历史比较,复核于 2026 年 10 月 7 日。数据集、提示和指标决定了衡量内容。这些分数既不能预测生成时间,也不能保证每张照片在 Segmentit 中的质量。

从研究,到你的下一个创作。

在 Segmentit 中,选择是创作的第一步:选取物体,细化轮廓,然后保存透明 PNG 或继续创建 3D。更清晰的蒙版能帮助你保留真正需要的主体。

关于SAM 3的问题

SAM 3 会创建 3D 模型吗?

SAM 3 创建分割蒙版。SAM 3D Objects 负责 3D 重建。它们用于图像转 3D 流程中的不同阶段。

与 SAM 2 相比有什么变化?

概念提示允许你通过文字或示例搜索匹配物体。上方图表则单独比较了使用点击进行交互式分割的表现。

在哪里可以找到模型?

Meta 在下方链接的官方 SAM 3 仓库中提供代码、模型权重获取说明和笔记本。如需可视化操作流程,可打开 Segmentit 工作室。

来源与文档

已复核 · Segmentit 编辑团队

欢迎使用 Segmentit

让照片拥有新维度。

使用 Google 继续
或