1P by GN⁺ | ★ favorite | 댓글 1개
  • 영상 생성에서 어려운 움직임 일관성을 개선하기 위해, Google Research의 Lumiere는 현실적이고 다양한 비디오 합성을 목표로 한 텍스트-투-비디오 확산 모델임
  • 핵심은 Space-Time U-Net으로, 먼 키프레임을 먼저 만든 뒤 보간하는 대신 전체 시간 구간을 한 번의 모델 패스로 생성함
  • 공간·시간 방향의 다운샘플링과 업샘플링을 함께 쓰며, 사전 학습된 텍스트-투-이미지 확산 모델을 활용해 저해상도 풀프레임레이트 영상을 직접 만듦
  • 데모는 텍스트-투-비디오, 이미지-투-비디오, 스타일화 생성, 비디오 스타일화, cinemagraph, 비디오 인페인팅까지 생성과 편집 작업을 폭넓게 포함함
  • 초보자도 시각 콘텐츠를 유연하게 만들 수 있지만, 가짜·유해 콘텐츠 오용 가능성 때문에 편향과 악의적 사용 탐지가 함께 필요함

Lumiere의 목표와 공개 자료

  • Lumiere는 비디오 합성에서 현실감, 다양성, 움직임의 시간적 일관성을 높이는 데 초점을 둔 텍스트-투-비디오 확산 모델임
  • 프로젝트 페이지에서 논문과 여러 데모 영상을 확인할 수 있음
  • 생성 작업뿐 아니라 비디오 편집 애플리케이션까지 함께 보여줌

전체 시간 구간을 한 번에 생성하는 구조

  • Lumiere는 Space-Time U-Net 아키텍처를 도입해 영상의 전체 시간 길이를 한 번의 모델 패스로 생성함
  • 기존 비디오 모델은 먼 키프레임을 먼저 합성한 뒤 시간 초해상도를 적용하는 방식이라, 전역 시간 일관성을 맞추기 어려움
  • 이 모델은 공간뿐 아니라 시간 방향에서도 다운샘플링과 업샘플링을 적용함
  • 사전 학습된 텍스트-투-이미지 확산 모델을 활용해 여러 시공간 스케일에서 풀프레임레이트 저해상도 영상을 직접 생성함

텍스트와 이미지에서 비디오 생성

  • Text-to-Video 데모는 텍스트 프롬프트만으로 영상을 생성함
    • 예시는 산 정상의 하이커, 화성 기지 주변의 우주비행사, 선글라스를 쓴 개가 운전하는 장면, 초콜릿 시럽이 바닐라 아이스크림 위에 부어지는 장면, 폭죽, 해변 석양 타임랩스 등을 포함함
  • Image-to-Video 데모는 입력 이미지와 프롬프트를 바탕으로 영상을 만듦
    • 예시는 줄무늬 셔츠를 입은 슬픈 고양이, 눈 속에서 춤추는 테디베어, 바다에서 헤엄치는 거북이, 노트북을 쓰며 커피를 마시는 원숭이, 피아노를 치는 고양이 등을 포함함

스타일화 생성과 비디오 편집

  • Stylized Generation은 단일 참조 이미지를 사용해 목표 스타일의 영상을 생성함
  • 이 과정에는 미세조정된 텍스트-투-이미지 모델 가중치가 활용됨
  • 스타일 참조 예시는 Sticker, 3D Melting Gold, Flat cartoon, 3D Rendering, Line drawing, Glowing, Watercolor painting 등을 포함함
  • Video Stylization에서는 텍스트 기반 이미지 편집 방법으로 일관된 비디오 편집을 수행할 수 있음
    • 예시 스타일 프롬프트는 “Made of wooden blocks”, “Origami folded paper art”, “Made of colorful toy bricks”, “Made of flowers” 등을 포함함

영역 기반 애니메이션과 인페인팅

  • Cinemagraphs 기능은 이미지 콘텐츠 중 사용자가 지정한 특정 영역만 애니메이션화할 수 있음
  • Video Inpainting 데모는 마스크가 적용된 원본 비디오를 입력으로 받아 출력 비디오를 생성함
  • 인페인팅 예시는 의상이나 액세서리를 바꾸는 프롬프트를 포함함
    • “wearing a gold strapless gown”
    • “wearing sunglasses”
    • “wearing a red scarf”
    • “wearing rain boots”

사회적 영향과 안전성

  • Lumiere의 주요 목표는 초보 사용자가 시각 콘텐츠를 창의적이고 유연하게 생성할 수 있게 하는 것임
  • 같은 기술이 가짜 또는 유해 콘텐츠 제작에 오용될 위험도 있음
  • 안전하고 공정한 사용을 위해 편향과 악의적 사용 사례를 탐지하는 도구를 개발하고 적용해야 함

댓글과 토론

Hacker News 의견들
  • 이 작업이 과학 연구의 외피를 쓰고 발표되는 게 매우 불쾌함
    이건 자랑, 광고, 마케팅이라고밖에 보기 어렵고, 재현 가능한 절차가 설명되어 있지 않음
    아키텍처 다이어그램이 다른 사람에게 영감을 줄 수는 있어도, 과학에서 가장 중요한 반증 가능성을 제공하지는 못함
    Google이 거짓말하는지 확인할 방법이 없으니, 모든 예시는 선별되고 후처리됐다고 가정해야 함
    모델 학습 데이터도 불법적으로 확보됐다고 봐야 하고, Google이 이제 입증 불가능한 주장을 반복적으로 하기 때문에 극단적 회의주의에서 출발해야 함
    Bard의 Gemini 성능을 GPT-4와 비교하면 크게 뒤처지고, 모델과의 상호작용이라고 주장한 영상도 실제로는 그런 것이 아니었음
    어떤 조직도 이렇게 운영되어선 안 되지만, Google은 특히 심각한 상습범이 됨

    • 그런 태도는 과학에 생산적이지 않아 보임
      결과를 믿지 않는다면 주장된 산출물은 무시하고 핵심 아이디어만 가져가면 됨
      그들의 이른바 광고를 무효화하려고 악의를 가정할 필요는 없음
      이런 태도는 기분은 좀 낫게 할 수 있어도 주장을 정치적으로 만들고, 실제로 참일 경우에는 오히려 느려지게 함
      Google 논문 상당수가 재현 가능한 산출물을 거의 포함하지 않았는데도 결국 유용한 기술의 기반이 된 역사가 있음
    • 참고로, 데이터를 써서 모델을 학습시키는 것 자체는 불법이 아님
      상업적 이익을 위해 모델이 그 동일한 데이터를 출력하게 하는 것이 불법임
      이 차이는 의도적으로 흐려지지만 이해해둘 필요가 있음
    • Gemini Ultra에 어떻게 접근했다는 건지 궁금함
      아니면 GPT-3.5와 비교되는 Gemini Pro를 말하는 건가?
    • 이 영상은 거의 확실히 Google 투자자들을 위한 것처럼 보임: “우린 죽지 않았고, 검색도 죽지 않았다! 춤추는 곰이다!”
      그래도 기술이 광고한 그대로라면 매우 인상적임
    • Google이 이미 AI 데모 조작으로 들킨 적이 있으니, 거짓말하거나 좋아 보이게 예시를 선별했을 가능성이 높다고 볼 수 있음
      실제 연구 세계라면 이런 일을 하다 적발되면 이후 작업뿐 아니라 이전 작업까지 강한 검증 대상이 됨
  • 예시들이 이전에 본 다른 기법들보다 훨씬 일관되고 길게 이어짐
    다른 모델들에 비해 다리가 바닥에서 덜 미끄러짐
    반면 사람 얼굴은 좋아 보이지 않았고, 예를 들면 모나리자 미소 같은 장면이 그랬음
    개인적으로는 첫 번째로 괜찮은 영상 생성 모델처럼 보임
    수정: Google 작품인 걸 방금 봤음. 그럼 공개 출시될 일은 없겠네

    • 공개된다면 일주일 안에 그걸 기반으로 한 NSFW 모델이 Civitai에 올라올 것 같음
    • 아니, 연구자들은 늘 그렇듯 이 연구 위에 더 쌓아 올릴 것이고, 결국 어떤 회사가 이 연구를 포함한 많은 연구 결과를 바탕으로 성공적인 제품을 만들 것임
      그때 우리는 Google이 뒤처졌다고 불평하고 있겠지
      Google이 최첨단 연구를 많이 후원하고 공개적으로 공유하는 건 꽤 멋진 일임
      이게 얼마나 오래갈지는 모르겠음
    • 이 데모 영상의 샘플 중 몇 개나 진짜인지 궁금함
      https://arstechnica.com/information-technology/2023/12/googl...
    • “모나리자 미소”라고 했지만 그건 Leonardo da Vinci의 "Mona Lisa"[1]가 아니라 Johannes Vermeer의 "Girl with a Pearl Earring"[2]임
      [1] https://en.wikipedia.org/wiki/Mona_Lisa
      [2] https://en.wikipedia.org/wiki/Girl_with_a_Pearl_Earring
  • 현재 그들의 GitHub에는 링크된 페이지 말고는 아무것도 없음
    https://github.com/lumiere-video
    애초에 뭔가 있을 거라고 주장한 건 아니지만 그래도 확인해봤고, GitHub 프로필로 가는 링크도 보이지 않았음
    호스팅된 웹사이트 URL을 보고 직접 프로필 주소를 입력하기 싫은 사람들을 위해 링크를 남김

    • AI/머신러닝 쪽에서 자주 보이는 방식임: 공개되지 않은 것에 대한 정보를 GitHub에 올려놓고 “GitHub에 있다”고 함
    • 대규모 언어 모델들이 안타깝게도 새로운 유행을 만들어버림
  • 영상 인페인팅이 흥미로움
    아이들이 최근 예전 SpongeBob 에피소드를 보고 있었는데 4:3 화면비가 꽤 거슬렸음
    양쪽 가장자리를 인페인팅해서 16:9로 되돌리는 게 흥미로운 활용 사례가 될 수 있겠다고 생각했지만, 옆에서 프레임 안으로 들어오는 물체를 처리하려면 일종의 미리 보기 기반 세밀 조정이 필요할 듯함

    • 실제로 TV·영화 업계에서 누군가 살 만한 제품처럼 들림
      고정 화면비 영상을 늘이거나 눈에 띄는 왜곡 없이 원래가 아닌 크기로 동적으로 조정하는 것임
      추가된 가장자리를 관객이 눈치채지 못할 정도로 정확히 추정하면 됨
      4:3 <-> 16:9 <-> 143:100 (IMAX) <-> 11:8 (Academy) <-> 3:2 (35mm) <-> 16:10 (태블릿/데스크톱)
      새 영화를 고전 흑백 무성영화처럼 보이게 만든 뒤 알맞은 프레임을 주는 것도 가능함
      어떤 영화든 IMAX 화면에서 자연스럽게 작동하도록 맞출 수 있음
    • 그냥 영상을 거꾸로 처리하면 안 되나?
  • 이런 작은 AI 영상 생성 샘플들의 이상하고 으스스한 꿈 같은 성격을 보면, 논문들이 이스터에그로 "dreaming of electric sheep" 프롬프트를 한 번도 넣지 않는 게 늘 아쉬움

  • 젠장, 이 발표가 2~3년 전만 해도 충격적이었을 것임
    이런 새 릴리스가 아주 빠르게 쏟아지는 데 다들 익숙해졌지만 그래도 놀랍다
    이런 능력을 가진 소프트웨어를 빨리 써보고 싶음
    수정: 아니, Google 거네. 오픈소스가 나올 때까지 기다리겠음

  • 오래된 이미지를 현대 데이터셋과 자주 섞는 것처럼 보임
    George Washington 초상화를 주고 “웃는 남자”를 프롬프트로 넣으면 [틀니][1]가 보일까, 아니면 새하얀 치아가 보일까?
    [1] https://en.wikipedia.org/wiki/George_Washington%27s_teeth

    • 그런 분포 밖 데이터는 당연히 프롬프트로 제공해야 할 것 같음
      이런 모델들이 더 큰 대규모 언어 모델처럼 사실에 대한 거대한 세계 모델을 만들었는지는 분명하지 않고, 주로 사물이 어떻게 움직이는지를 파악하는 중임
      데이터셋에서 대부분의 사람은 새하얀 치아를 보이고, Washington의 입 영상은 없으니, 원하는 틀니를 자세히 묘사하지 않는 한 그쪽이 기본값일 거라 봄
  • 몇 가지 생각: Google이라서 아마 우리가 직접 써볼 일은 없을 것임
    그래도 아이디어는 매우 흥미로움. 모델이 먼저 영상의 작은 전체 시간 표현을 생성하도록 학습한 다음, 시간과 픽셀 양쪽으로 업스케일링하는 방식임
    본질적으로 이전 모델들이 깊이 지도를 추가하는 걸 봤다면, 이건 또 다른 차원으로 시간 지도를 추가하는 셈임
    눈으로 보기에는 일관성이 꽤 좋음
    어색함은 프레임별 일관성 유지에서 흔히 실패하는 것보다는, 모델이 시간에 따라 어떤 대상이 “무엇을 해야 하는지” 결정하는 부분에 더 가까워 보임
    Google 연구자들의 큰 통찰은 일관성 자체를 조건화·학습·생성한 다음 프레임을 채울 수 있다는 것임
    Stability 같은 여러 모델 제공자가 충분히 복제할 수 있을 것 같고, 구현 불가능해 보이는 부분은 딱히 없음

  • 픽셀 테마 논문에 픽셀 테마 게시물임
    꽤 인상적이고, 곧 “문단 하나로 영화 만들기” 프로그램이 엄청나게 쏟아지는 결과로 이어질 듯함
    Google 작품이니 아마 상자 안에 들어가서 우리가 절대 못 보는 Rick and Morty 도구가 될 가능성이 큼
    저자 표기 형식은 마음에 듦
    1,2,3,4,*,+ 같은 표기는 주저자, 기관 소속, 핵심 기여자를 구분하기 좋음
    천문학과 물리학 논문을 많이 읽다 보면 저자가 10명 넘는데 누가 무엇을 했는지 전혀 알 수 없는 경우가 많음
    예를 들어 arXiv 링크에는 비슷한 형식이 보이지 않음
    그리고 이건 곧바로 악용 포르노에 쓰일 가능성이 큼
    Walking Woman 예시 5번째 변형: “Wearing no clothing”

    • 생각 못 했는데, 맞음. 이런 기술로 악용 포르노가 곧 만연해질 것임
      전 세계 모든 사람이 곧 자기 얼굴이 붙은 사실적인 노골적 포르노를 갖게 될 수 있음
  • 올해 첫 장편 AI 생성 영화를 보게 될 것임
    미친 소리 같다면, 영화 초창기에도 평균 쇼트 길이는 12초였고 오늘날은 2.5초에 불과하다는 점을 생각해보면 됨
    생성 사이에서 피사체 일관성을 유지하는 것 같은 중요한 기법 몇 가지는 더 다듬어야 함
    하지만 깊이에 따라 레이어를 분리해 더 정적인 이미지를 쓰거나, 더 깊이가 필요한 곳에는 텍스처가 있는 단순한 3D 모델을 만드는 기존 방법으로 많은 불일치를 메울 수 있다고 봄
    충분한 노력과 실력이 있으면 현재 기술만으로도 가능할 것 같음

    • 영화 제작자가 지금 스토리보드를 쓰듯, 대본과 촬영을 다듬기 위해 영화의 여러 초안 버전을 만드는 모습은 쉽게 상상됨
    • 왜 “영화”를 만들어야 하지? 시청자가 의상을 마음대로 바꿀 수 있는 하나의 줄거리를 만들면 되지 않나?
    • 이런 걸로 사람들이 쏟아내는 다른 모든 미디어처럼 아마 완전히 형편없을 것임