2P by GN⁺ | ★ favorite | 댓글 1개
  • Meta FAIR의 Segment Anything Model 2(SAM 2) 는 이미지와 비디오에서 객체를 빠르게 선택·분할하기 위한 통합 세그멘테이션 모델임
  • 사용자는 클릭, 박스, 마스크를 프롬프트로 넣어 객체를 지정하고, 추가 프롬프트로 마스크 예측을 보정할 수 있음
  • 비디오에서는 세션별 메모리 모듈이 이전 프레임의 객체 정보를 유지해, 객체가 잠시 가려져도 전체 프레임에서 추적을 이어감
  • SAM 2는 기존 SAM보다 이미지 세그멘테이션을 개선했고, 비디오 객체 세그멘테이션에서는 특히 부분 추적과 상호작용 시간 측면을 강조함
  • Meta는 사전학습 모델, 코드, 데모, SA-V 데이터셋을 공개했으며, SA-V는 약 51K개 비디오와 600K개 이상 masklet을 포함함

이미지와 비디오를 함께 다루는 세그멘테이션

  • SAM 2는 이미지와 비디오 전반에서 객체를 세그멘테이션하는 첫 통합 모델임
  • 사용자는 이미지나 비디오 프레임에서 클릭, 박스, 마스크를 입력해 객체를 선택할 수 있음
  • 비디오에서는 하나 또는 여러 객체를 지정할 수 있고, 어느 프레임에서든 추가 프롬프트로 예측을 정교하게 수정 가능함
  • 학습 중 보지 못한 객체, 이미지, 비디오에서도 강한 제로샷 성능을 내도록 설계돼 다양한 실제 애플리케이션에 활용될 수 있음
  • 스트리밍 추론을 통해 비디오를 효율적으로 처리하며, 실시간·대화형 애플리케이션을 지원함

성능과 대화형 사용 경험

  • SAM 2는 비디오와 이미지의 객체 세그멘테이션에서 해당 분야의 최고 모델들보다 나은 성능을 내는 모델로 제시됨
  • 주요 성능 포인트
    • 이미지 세그멘테이션에서 기존 SAM보다 개선됨
    • 기존 비디오 객체 세그멘테이션 모델보다 우수하며, 특히 부분 추적에서 강점이 있음
    • 기존 대화형 비디오 세그멘테이션 방법보다 필요한 상호작용 시간이 적음
  • 데모에서는 한 프레임에서 단 한 번 클릭해도 비디오 전체에서 객체를 대화형으로 추적하고 효과를 만들 수 있음
  • 데모는 SAM 2 demo에서 제공됨

비디오 추적을 위한 모델 구조

  • SAM의 프롬프트 기반 선택 기능을 비디오 영역으로 확장한 구조임
  • 비디오 내 대상 객체 정보를 저장하는 세션별 메모리 모듈을 추가함
    • 선택한 객체를 모든 비디오 프레임에 걸쳐 추적할 수 있음
    • 객체가 일시적으로 시야에서 사라져도 이전 프레임의 문맥을 활용함
  • 어떤 프레임에서도 추가 프롬프트를 넣어 마스크 예측을 보정할 수 있음
  • 스트리밍 아키텍처는 비디오 프레임을 한 번에 하나씩 처리함
  • 이미지에 적용할 때는 메모리 모듈이 비어 있으며, 모델은 SAM처럼 동작함

SA-V 데이터셋

  • SAM 2는 대규모·다양한 비디오와 masklet으로 학습됨
    • masklet은 시간에 따른 객체 마스크를 뜻함
    • 데이터는 SAM 2를 모델-인-더-루프 데이터 엔진에서 대화형으로 적용해 생성됨
  • 학습 데이터에는 오픈소스로 공개되는 SA-V 데이터셋이 포함됨
  • SA-V 데이터셋의 주요 수치
    • 51K개 비디오에서 600K개 이상의 masklet 수집
    • 47개국에서 수집된 지리적으로 다양한 실제 시나리오 포함
    • 전체 객체, 객체의 부분, 까다로운 가림 상황에 대한 주석 포함
  • SA-V 데이터셋 관련 문제나 질문은 support@segment-anything.com으로 문의할 수 있음
  • 데이터셋은 Explore the dataset에서 확인할 수 있음

공개 리소스와 활용 가능성

  • Meta는 연구 커뮤니티가 후속 작업을 이어갈 수 있도록 사전학습된 Segment Anything 2 모델, SA-V 데이터셋, 데모, 코드를 공개함
  • 공개 리소스와 함께 다음 사항을 강조함
    • SAM 2 학습 데이터에 대한 투명성 제공
    • 실제 세계 표현을 위해 SA-V 데이터셋의 지리적 다양성을 우선함
    • SAM 2에 대한 공정성 평가 수행
  • 모델과 코드는 Download the model에서 받을 수 있음
  • 연구 논문은 Read the research paper에서 확인할 수 있음
  • SAM 2는 단독으로 쓰거나, 향후 다른 모델과 결합한 더 큰 시스템의 일부로 사용할 수 있음
    • 비디오 객체 세그멘테이션 출력은 최신 비디오 생성 모델 같은 다른 AI 시스템의 입력으로 사용돼 정밀한 편집 기능을 가능하게 할 수 있음
    • 향후 다른 유형의 입력 프롬프트로 확장돼 실시간 또는 라이브 비디오에서 객체와 상호작용하는 창의적 방식을 지원할 수 있음

댓글과 토론

Hacker News 의견들
  • Meta가 정말 잘하고 있음. Google은 AI 연구와 커뮤니티에 공유되는 유용한 결과물에서 뒤처지는 것처럼 보임
    Llama와 다른 프로젝트들이 새로운 창작물, 회사, 발전을 끌어올릴 것이라 확신함. 코드와 연구를 공개적으로 공유하는 방식도 결국 Meta의 사업 가치로 돌아올 것임
    창업자가 이끄는 회사와 시장에 끌려가는 회사의 차이가 여기서 드러남. Google은 나쁜 분기 실적을 피하거나, VR처럼 당장 수익이 안 보이는 프로젝트에 큰 자본 지출이 잡히는 걸 피하는 단기 목표에 더 신경 쓰는 듯함
    Meta가 VR의 킬러 앱을 찾는 순간, 다른 회사들은 너무 뒤처져 Meta에서 소프트웨어를 사거나 새 시장 점유율을 거의 못 가져가게 될 수 있음. AI 칩에서 Nvidia가 앞서간 것과 비슷하게, 아무도 충분히 투자하지 않았던 영역임

    • Google은 여전히 AI 연구에서 앞서 있음. 단기적으로 움직이는 것과는 반대에 가깝고, 그렇게 보이지 않는 이유는 많은 작업이 기초 연구이거나 화학·물리학 관련이거나 Facebook처럼 공개되지 않는 영역이기 때문일 수 있음
      다만 연구를 제품으로 만드는 데서는 뒤처져 있음. 지금까지는 학습된 모델을 제품으로 옮기는 과정에서 최소한의 노력만 하는 것처럼 보임
    • 잘 모르지만 차이는 이런 것 아닐까 싶음. Meta는 이것저것 시도해 보고 나중에 킬러 애플리케이션을 찾을 수 있음
      반면 Google은 검색이 반드시 킬러 애플리케이션이어야 한다고 실존적으로 느끼고, 모든 걸 거기에 억지로 끼워 넣으려 함. 그러다 성공 기준을 너무 높게 잡고, 실제 기술 수준이 어디쯤인지 무시하는 듯함
    • Meta가 뭘 그렇게 잘하고 있는지 모르겠음. WhatsApp이나 Instagram에 들어간 AI 통합은 거의 쓸모없고, Meta가 AI 기업처럼 보이게 하려고 시장을 속이는 용도로 끼워 넣은 것 같음
      Zuckerberg는 CEO들 중에서도 상상력이 가장 부족한 편이라고 봄. Meta에는 Portal 기기를 빼면 독창적인 제품이 거의 없고, 대부분 인수한 제품들임. 혁신에는 대단히 약한 회사임
      Zuckerberg가 이미지 세탁용 홍보전을 벌인 것처럼 보이지만, Facebook은 여전히 수상한 사람이 운영하는 수상한 회사이고 썩은 핵심은 바뀌지 않았음. 바로 이번 주에도 Texas에서 수십억 달러 벌금을 맞았음
      Meta는 “창업자 주도 회사”와는 거리가 멂. 사들인 앱의 창업자들은 곧 떠나고, Adam Mosseri 같은 경영 컨설턴트형 인물들이 운영하게 됨
      아직도 사람들이 Zuckerberg가 사용자 성장 둔화 속에서 Meta가 혁신 기업처럼 보이도록 던진 메타버스 승부수를 믿는 게 안타까움. 그 메타버스 사기가 왜 SEC 위반이 아니었는지 아직도 이해가 안 됨
    • “창업자 주도 회사와 시장 주도 회사의 차이”라고 하지만, 정말 그렇게 다른가 싶음
      Facebook은 Llama처럼 수익화 경로가 불분명한 비싼 것들도 일단 던져 봄. Google도 Waymo, Google Glass, Google Fiber, Stadia, 그리고 https://killedbygoogle.com에 있는 것들처럼 수익화 경로가 불분명한 비싼 것들을 던져 봤음
      Facebook은 메타버스라는 비전을 위해 회사 전체 방향을 크게 틀었다가 실패했고, Google은 Google Plus라는 비전을 위해 회사 전체 방향을 크게 틀었다가 실패했음
      Facebook은 Meta로 이름을 바꿨고, Google은 Alphabet으로 이름을 바꿨음
      Facebook에는 프랑스계 미국인 컴퓨터과학 교수이자 튜링상 수상자가 세운 AI 연구 조직이 있고, Google에는 영국계 캐나다인 컴퓨터과학 교수이자 튜링상 수상자가 세운 AI 연구 조직이 있음
      Facebook은 PyTorch라는 카멜케이스 이름의 널리 쓰이는 오픈소스 Python 머신러닝 라이브러리를 냈고, Google은 TensorFlow라는 카멜케이스 이름의 널리 쓰이는 오픈소스 Python 머신러닝 라이브러리를 냈음
      어쩌면 둘 다 같은 플레이북을 따르고 있고, 최근에는 Facebook의 도박이 운 좋게 맞아떨어진 것일 수도 있음
    • 창업자라고 다 같은 건 아님. 어떤 창업자는 당장 돈이 필요하지 않아도 주가가 떨어지는 걸 매우 싫어함
      그리고 결과는 섞여 있음. 개인적으로 Zuckerberg는 VR에서는 틀렸지만 AI에서는 맞았다고 봄
  • 이전 토론: https://news.ycombinator.com/item?id=41104523

    • 큰 뉴스가 이렇게 빨리 첫 페이지에서 사라지는 게 놀라움. Hacker News는 하루에 여러 번 사이트를 확인하는 사람들에게 최적화된 것 같음
  • 불과 10년 전에 누가 Facebook이 가장 개방적으로 혁신하는 회사 중 하나가 되고 Mark Zuckerberg가 그나마 제정신인 억만장자 중 하나가 될 거라고 했다면 정말 비웃었을 것임
    하지만 지금은 상황이 달라졌음. VR과 AI 시도가 실제로 얼마나 성공하든, 이미 역사 속에 어느 정도 자리를 남기게 될 듯함

    • 공정하게 보면, Meta는 내부 소프트웨어를 오픈소스로 공개하고 그것이 업계 표준이 된 역사가 꽤 김. 이건 전혀 새로운 일이 아님
      특히 데이터베이스 기술에서 그렇고, rocksdb, zstd compression, presto, Cassandra, Hive, Velox는 모두 Meta가 만든 것들임
      이것들은 인기 있는 것들만 꼽은 것이고, 공개했지만 크게 유명해지지 않은 데이터베이스 관련 프로젝트는 훨씬 더 많음
      회사로서는 불평할 점이 많지만, 오픈소스 생태계에는 늘 큰 기여자였음
    • Oculus는 좋아하지만, VR은 아직 문화적 보편성에 도달하지 못했음
  • 이런 걸 보면 항상 The Expanse에 나오는 홀로그램 궤도 지도 UI가 떠오름
    우리가 생각하는 모든 것에 연결될 미래의 종이 같고, 세상을 탐색하는 데 정말 강력한 도구가 될 수 있음

  • 편집과 모션 그래픽 일을 하던 시절에 이런 게 있었다면 정말 간절히 원했을 것임
    After Effects의 Roto Brush도 비슷하지만, 품질이 늘 부족했고 처리 시간이 너무 오래 걸렸음

    • After Effects의 Roto Brush는 생명의 은인 같은 도구지만 한계가 있음. SAM은 확실히 판도를 바꾸는 도구임
  • 코드를 공개했다고 되어 있는데 예제 코드 외에는 못 찾겠음. 학습 코드도 공개한 건가?

  • 결과가 인상적임. Mercer Labs 내부에서 찍은 테스트 영상임: https://youtu.be/W7kM0ISXkpQ?feature=shared

    • 뭘 보고 있는 건지, 그리고 이게 SAM2와 어떻게 관련되는지 모르겠음
  • Firefox는 지원을 못 받는 듯함

  • 지루하고 반복적인 데이터셋 작업을 해 온 수천 명의 아프리카 노동자들에게도 감사해야 함