- Meta FAIR의 Segment Anything Model 2(SAM 2) 는 이미지와 비디오에서 객체를 빠르게 선택·분할하기 위한 통합 세그멘테이션 모델임
- 사용자는 클릭, 박스, 마스크를 프롬프트로 넣어 객체를 지정하고, 추가 프롬프트로 마스크 예측을 보정할 수 있음
- 비디오에서는 세션별 메모리 모듈이 이전 프레임의 객체 정보를 유지해, 객체가 잠시 가려져도 전체 프레임에서 추적을 이어감
- SAM 2는 기존 SAM보다 이미지 세그멘테이션을 개선했고, 비디오 객체 세그멘테이션에서는 특히 부분 추적과 상호작용 시간 측면을 강조함
- Meta는 사전학습 모델, 코드, 데모, SA-V 데이터셋을 공개했으며, SA-V는 약 51K개 비디오와 600K개 이상 masklet을 포함함
이미지와 비디오를 함께 다루는 세그멘테이션
- SAM 2는 이미지와 비디오 전반에서 객체를 세그멘테이션하는 첫 통합 모델임
- 사용자는 이미지나 비디오 프레임에서 클릭, 박스, 마스크를 입력해 객체를 선택할 수 있음
- 비디오에서는 하나 또는 여러 객체를 지정할 수 있고, 어느 프레임에서든 추가 프롬프트로 예측을 정교하게 수정 가능함
- 학습 중 보지 못한 객체, 이미지, 비디오에서도 강한 제로샷 성능을 내도록 설계돼 다양한 실제 애플리케이션에 활용될 수 있음
- 스트리밍 추론을 통해 비디오를 효율적으로 처리하며, 실시간·대화형 애플리케이션을 지원함
성능과 대화형 사용 경험
- SAM 2는 비디오와 이미지의 객체 세그멘테이션에서 해당 분야의 최고 모델들보다 나은 성능을 내는 모델로 제시됨
- 주요 성능 포인트
- 이미지 세그멘테이션에서 기존 SAM보다 개선됨
- 기존 비디오 객체 세그멘테이션 모델보다 우수하며, 특히 부분 추적에서 강점이 있음
- 기존 대화형 비디오 세그멘테이션 방법보다 필요한 상호작용 시간이 적음
- 데모에서는 한 프레임에서 단 한 번 클릭해도 비디오 전체에서 객체를 대화형으로 추적하고 효과를 만들 수 있음
- 데모는 SAM 2 demo에서 제공됨
비디오 추적을 위한 모델 구조
- SAM의 프롬프트 기반 선택 기능을 비디오 영역으로 확장한 구조임
- 비디오 내 대상 객체 정보를 저장하는 세션별 메모리 모듈을 추가함
- 선택한 객체를 모든 비디오 프레임에 걸쳐 추적할 수 있음
- 객체가 일시적으로 시야에서 사라져도 이전 프레임의 문맥을 활용함
- 어떤 프레임에서도 추가 프롬프트를 넣어 마스크 예측을 보정할 수 있음
- 스트리밍 아키텍처는 비디오 프레임을 한 번에 하나씩 처리함
- 이미지에 적용할 때는 메모리 모듈이 비어 있으며, 모델은 SAM처럼 동작함
SA-V 데이터셋
- SAM 2는 대규모·다양한 비디오와 masklet으로 학습됨
- masklet은 시간에 따른 객체 마스크를 뜻함
- 데이터는 SAM 2를 모델-인-더-루프 데이터 엔진에서 대화형으로 적용해 생성됨
- 학습 데이터에는 오픈소스로 공개되는 SA-V 데이터셋이 포함됨
- SA-V 데이터셋의 주요 수치
- 약 51K개 비디오에서 600K개 이상의 masklet 수집
- 47개국에서 수집된 지리적으로 다양한 실제 시나리오 포함
- 전체 객체, 객체의 부분, 까다로운 가림 상황에 대한 주석 포함
- SA-V 데이터셋 관련 문제나 질문은 support@segment-anything.com으로 문의할 수 있음
- 데이터셋은 Explore the dataset에서 확인할 수 있음
공개 리소스와 활용 가능성
- Meta는 연구 커뮤니티가 후속 작업을 이어갈 수 있도록 사전학습된 Segment Anything 2 모델, SA-V 데이터셋, 데모, 코드를 공개함
- 공개 리소스와 함께 다음 사항을 강조함
- SAM 2 학습 데이터에 대한 투명성 제공
- 실제 세계 표현을 위해 SA-V 데이터셋의 지리적 다양성을 우선함
- SAM 2에 대한 공정성 평가 수행
- 모델과 코드는 Download the model에서 받을 수 있음
- 연구 논문은 Read the research paper에서 확인할 수 있음
- SAM 2는 단독으로 쓰거나, 향후 다른 모델과 결합한 더 큰 시스템의 일부로 사용할 수 있음
- 비디오 객체 세그멘테이션 출력은 최신 비디오 생성 모델 같은 다른 AI 시스템의 입력으로 사용돼 정밀한 편집 기능을 가능하게 할 수 있음
- 향후 다른 유형의 입력 프롬프트로 확장돼 실시간 또는 라이브 비디오에서 객체와 상호작용하는 창의적 방식을 지원할 수 있음