- 이미지와 영상에서 텍스트·예시 이미지·시각적 프롬프트로 원하는 개체를 찾고 분할하고 추적하는 SAM 3 공개
- 모델 체크포인트, 평가 데이터셋, 파인튜닝 코드와 함께 Segment Anything Playground를 통해 누구나 쉽게 실험할 수 있는 환경 제공
- SA-Co라는 새로운 대규모 개념 분할 벤치마크와 SAM 3D 공개로 2D·3D 전반을 포괄하는 개념 분할 생태계 확장
- Marketplace·Instagram Edits·Meta AI 등 메타 서비스 전반에서 개체 분할 기반의 새로운 미디어 생성·편집 기능이 적용되고 있음
- 텍스트·예시 기반의 개념 분할을 통합한 모델로서, 다양한 연구·산업·보전·로보틱스 분야에서 범용 인식 기반 도구로 활용 가능성이 커짐
SAM 3 개요
-
텍스트·이미지 예시·마스크·박스·포인트 등 다양한 프롬프트를 받아 이미지·영상에서 개념을 탐지·분할·추적하는 통합 모델임
- 짧은 명사구 기반의 오픈 보캐불러리 분할을 기본 지원
- “people sitting down but not holding a gift box” 같은 복합 프롬프트는 MLLM과 결합해 처리 가능함
- 기존 SAM이 정해진 라벨 세트에 묶였던 한계를 벗어나, 임의 개념(promptable concept) 분할로 확장됨
- 새로운 벤치마크 SA-Co(Segment Anything with Concepts) 로 이미지·영상에서 대규모 개념 인식 성능 측정
주요 기능
- 텍스트 프롬프트 기반 개념 탐지 및 모든 인스턴스 분할 지원
- “striped red umbrella” 같은 세부 묘사도 처리
- 이미지 예시(exemplar)를 통해 실물 기반의 개념 정의 가능
- SAM 1·2에서 제공하던 박스/포인트/마스크 프롬프트 유지
- MLLM을 도구처럼 활용해 복잡한 질의에 대한 반복적 탐색(SAM 3 Agent) 수행
데이터 엔진
- SAM 3 + 사람 + AI anotator(Llama 3.2v 기반)이 결합된 하이브리드 데이터 제작 파이프라인 구축
- 자동 캡셔닝 → 텍스트 라벨 생성 → 초기 마스크 생성 → AI/사람 검증
- 부정 프롬프트(없는 개념)에서 5배 빠른 처리, 긍정 프롬프트에서도 36% 속도 향상
- 4백만 개 이상의 고유 개념을 포함한 대규모 훈련 세트 구축
- 위키 기반의 개념 온톨로지로 희귀 개념 커버리지 확장
모델 아키텍처
- 텍스트/이미지 인코더는 Meta Perception Encoder 기반
- 객체 감지는 DETR, 추적은 SAM 2의 memory bank + tracker 구성 활용
- 여러 작업(탐지·추적·분할)을 하나의 모델에서 수행하기 위한 충돌 방지 학습 레시피 설계가 핵심
성능
- 이미지·영상에서 기존 모델 대비 cgF1 2배 향상
- Gemini 2.5 Pro, GLEE, OWLv2, LLMDet 등 전문 모델 대비 우수한 결과
- 사용자 선호도 평가에서 SAM 3 결과가 3:1 비율로 우세
- 단일 이미지 30ms, 영상에서도 객체 5개 기준 거의 실시간 처리
- zero-shot LVIS·CountBench 등에서도 개선 성능 확인
과학 및 실사용 사례
- SA-FARI: 100종 이상·1만 개 이상의 야생동물 카메라 트랩 영상을 포함한 공개 데이터셋
- FathomNet: 해양 생물 인스턴스 분할을 위한 새로운 벤치마크 제공
- Marketplace “View in Room”: 조명·가구 등 실내 배치 시각화를 SAM 3·SAM 3D로 구현
- Instagram Edits·Meta AI 앱·meta.ai 등에서 개체 기반 영상 효과 적용 기능 예정
SAM 3D
- 단일 이미지에서의 3D 객체·사람 재구성을 위한 모델·코드·데이터 공개
- 실제 공간 맥락을 고려한 grounded reconstruction 제공
한계 및 앞으로의 과제
-
세밀한 전문 분야 개념(platelet 등) 에 대한 zero-shot 일반화는 제한적
- 적은 양의 데이터로 파인튜닝하면 빠르게 적응
- 오픈소스 파인튜닝 레시피 제공
- 짧은 문장은 기본 지원하지만, “top shelf second to last book” 같은 복잡 서술은 MLLM 결합이 필요
- 영상에서는 개체 수가 늘어날수록 처리 비용이 선형 증가
- 객체 간 관계 정보 공유가 향후 개선 포인트
Segment Anything Playground
- 기술 지식 없이도 SAM 3를 실험할 수 있는 웹 기반 플랫폼
- 얼굴/번호판/스크린 픽셀화, 스포트라이트, 모션 트레일, 특정 객체 확대 등의 템플릿 제공
- 데이터 어노테이션과 스트레스 테스트에도 활용
- Aria Gen 2 웨어러블 1인칭 영상에서도 안정적인 분할·추적 제공
- 인간 관점 기반의 로보틱스·퍼셉션 연구에 활용 가능