O que é SAM 3?
SAM 3, também pesquisado como SAM3, é o modelo da Meta para encontrar e segmentar objetos em imagens e vídeos. Um conceito curto, como “cadeira vermelha”, pode identificar instâncias correspondentes; instruções visuais ajudam a orientar a seleção. A saída é uma máscara: os pixels que pertencem a um objeto.
Meta · SAM 3 ↗SAM 3
Imagem → máscara 2D
SAM 3D Objects
Imagem + máscara → objeto 3D
Uma seleção precisa e uma reconstrução em volume atendem a necessidades diferentes. Escolher o objeto certo vem antes da forma, da textura e da composição da cena. Explorar SAM 3D.
Os modelos comparados
Países das organizações e colaborações. Cada modelo leva ao seu projeto oficial.
O que SAM 3 pode fazer?
Instruções de texto
Nomeie um objeto, como “cadeira vermelha”, para encontrar correspondências.
Instruções visuais
Use pontos, caixas ou uma imagem de exemplo para indicar o que quer selecionar.
Segmentação de vídeo
O modelo de pesquisa combina detecção e rastreamento entre quadros.
Escolha seu fluxo criativo
Isole um produto para uma composição, prepare um recorte transparente ou selecione o objeto que quer transformar em 3D. Confira os pequenos detalhes antes de exportar.
Como funciona SAM 3?
Descreva ou aponte
O texto nomeia o conceito; pontos e caixas fornecem orientação visual.
Detecte e segmente
Um detector identifica instâncias correspondentes e prevê suas máscaras. Uma base visual compartilhada dá suporte à detecção e ao rastreamento em vídeo.
Refine a máscara
Instruções positivas e negativas ajudam a ajustar o alvo. O modelo de pesquisa também mantém a identidade dos objetos entre os quadros de um vídeo.
Arquitetura do modelo de pesquisa. Recursos de vídeo, representações e ferramentas disponíveis em um aplicativo podem variar. Código oficial ↗
SAM 1 vs. SAM 2.1 vs. SAM 3
SA-37 · Segmentação interativa de imagens · mIoU média · Quanto maior, melhor
Dados e métricas
| Modelo | 1 clique | 3 cliques | 5 cliques |
|---|---|---|---|
| SAM 1 H | 58,5 | 77,0 | 82,1 |
| SAM 2.1 L | 66,4 | 80,3 | 84,3 |
| SAM 3 | 66,1 | 81,3 | 85,1 |
mIoU: média da interseção sobre união entre máscaras previstas e de referência. Três quantidades de cliques avaliadas; as linhas conectam as observações sem estimar resultados intermediários.
Fonte: Carion et al. · SAM 3 · Table 6 · arXiv v1 (2025) ↗
Com cinco cliques, SAM 3 atinge 85,1 de mIoU, contra 84,3 do SAM 2.1 L. Com um clique, SAM 2.1 L fica ligeiramente à frente: 66,4 contra 66,1. O ganho depende da configuração de interação.
Velocidade da segmentação interativa
Taxa de processamento relatada na Tabela 6, nas condições de avaliação do artigo. Não representa a latência do Studio.
- SAM 1 H
- 41,0
- SAM 2.1 L
- 93,0
- SAM 3
- 43,5
Vídeo: rastreamento no SA-V
Qualidade da máscara e dos contornos ao longo dos quadros do vídeo. Quanto maior, melhor. Comparação de modelos de pesquisa.
- SAM 2.1 L
- 78,4
- SAM 3
- 84,4
Como interpretar os resultados
Uma comparação histórica das versões avaliadas nas publicações de 2025, revisada em 7 de outubro de 2026. Conjuntos de dados, instruções e métricas determinam o que é medido. Essas pontuações não preveem o tempo de geração nem a qualidade de cada foto no Segmentit.
Da pesquisa à sua próxima criação.
No Segmentit, selecionar é o primeiro passo criativo: escolha um objeto, refine o contorno e salve um PNG transparente ou siga para o 3D. Uma máscara mais precisa ajuda a manter o objeto que você realmente quer.
Perguntas sobre SAM 3
SAM 3 cria modelos 3D?
SAM 3 cria máscaras de segmentação. SAM 3D Objects faz a reconstrução 3D. Eles atuam em etapas diferentes do fluxo de imagem para 3D.
O que mudou em relação ao SAM 2?
As instruções por conceito permitem buscar objetos correspondentes usando texto ou exemplos. O gráfico acima compara separadamente a segmentação interativa por cliques.
Onde encontro o modelo?
A Meta publica o código, as instruções de acesso aos checkpoints e os notebooks no repositório oficial do SAM 3, no link abaixo. Para um fluxo visual, abra o Segmentit Studio.
Fontes e documentação
Revisado · Redação do Segmentit
