什么是 SAM 3?
SAM 3(也常以 SAM3 搜索)是 Meta 用于查找和分割图像及视频中物体的模型。简短的概念提示(如“红色椅子”)可以识别匹配的实例;视觉提示则帮助引导选择。其输出为蒙版,即属于某个主体的像素。
Meta · SAM 3 ↗SAM 3
图像 → 2D 蒙版
SAM 3D Objects
图像 + 蒙版 → 3D 物体
精确选区与立体重建解决不同需求。先选择正确的主体,再处理形状、纹理与场景构图。 探索 SAM 3D.
SAM 3 能做什么?
文字提示
描述“红色椅子”等主体,以查找匹配物体。
视觉提示
使用点、框或图像示例指定要选择的内容。
视频分割
研究模型结合检测与跨帧跟踪。
选择你的创作流程
为构图提取产品,准备透明抠图,或选择想转换为 3D 物体的主体。导出前请检查细节。
SAM 3如何运作?
描述或点选
文字指定概念,点和框提供视觉引导。
检测与分割
检测器识别匹配实例并预测其蒙版。共享的视觉骨干网络支持检测和视频跟踪。
细化蒙版
正向与负向提示帮助调整目标。该研究模型还可在视频帧之间保持物体身份一致。
研究模型架构。应用中提供的视频功能、表示形式和工具可能有所不同。 官方代码 ↗
SAM 1、SAM 2.1 与 SAM 3 对比
SA-37 · 交互式图像分割 · 平均 mIoU · 越高越好
数据与指标
| 模型 | 1 次点击 | 3 次点击 | 5 次点击 |
|---|---|---|---|
| SAM 1 H | 58.5 | 77.0 | 82.1 |
| SAM 2.1 L | 66.4 | 80.3 | 84.3 |
| SAM 3 | 66.1 | 81.3 | 85.1 |
mIoU:预测蒙版与参考蒙版的平均交并比。测试了三种点击次数;连线仅连接观测值,不表示对中间结果的估计。
来源: Carion et al. · SAM 3 · Table 6 · arXiv v1 (2025) ↗
点击五次时,SAM 3 达到 85.1 mIoU,SAM 2.1 L 为 84.3。点击一次时,SAM 2.1 L 略领先:66.4 对 66.1。提升幅度取决于交互设置。
交互式分割速度
论文评估设置下表 6 报告的吞吐量,并非工作室延迟。
- SAM 1 H
- 41.0
- SAM 2.1 L
- 93.0
- SAM 3
- 43.5
视频:SA-V 跟踪
视频帧中的蒙版与边界质量。越高越好。研究模型对比。
- SAM 2.1 L
- 78.4
- SAM 3
- 84.4
解读结果
对 2025 年论文中评估版本的历史比较,复核于 2026 年 10 月 7 日。数据集、提示和指标决定了衡量内容。这些分数既不能预测生成时间,也不能保证每张照片在 Segmentit 中的质量。
从研究,到你的下一个创作。
在 Segmentit 中,选择是创作的第一步:选取物体,细化轮廓,然后保存透明 PNG 或继续创建 3D。更清晰的蒙版能帮助你保留真正需要的主体。
关于SAM 3的问题
SAM 3 会创建 3D 模型吗?
SAM 3 创建分割蒙版。SAM 3D Objects 负责 3D 重建。它们用于图像转 3D 流程中的不同阶段。
与 SAM 2 相比有什么变化?
概念提示允许你通过文字或示例搜索匹配物体。上方图表则单独比较了使用点击进行交互式分割的表现。
在哪里可以找到模型?
Meta 在下方链接的官方 SAM 3 仓库中提供代码、模型权重获取说明和笔记本。如需可视化操作流程,可打开 Segmentit 工作室。
来源与文档
已复核 · Segmentit 编辑团队
