- 영상 생성에서 어려운 움직임 일관성을 개선하기 위해, Google Research의 Lumiere는 현실적이고 다양한 비디오 합성을 목표로 한 텍스트-투-비디오 확산 모델임
- 핵심은 Space-Time U-Net으로, 먼 키프레임을 먼저 만든 뒤 보간하는 대신 전체 시간 구간을 한 번의 모델 패스로 생성함
- 공간·시간 방향의 다운샘플링과 업샘플링을 함께 쓰며, 사전 학습된 텍스트-투-이미지 확산 모델을 활용해 저해상도 풀프레임레이트 영상을 직접 만듦
- 데모는 텍스트-투-비디오, 이미지-투-비디오, 스타일화 생성, 비디오 스타일화, cinemagraph, 비디오 인페인팅까지 생성과 편집 작업을 폭넓게 포함함
- 초보자도 시각 콘텐츠를 유연하게 만들 수 있지만, 가짜·유해 콘텐츠 오용 가능성 때문에 편향과 악의적 사용 탐지가 함께 필요함
Lumiere의 목표와 공개 자료
- Lumiere는 비디오 합성에서 현실감, 다양성, 움직임의 시간적 일관성을 높이는 데 초점을 둔 텍스트-투-비디오 확산 모델임
- 프로젝트 페이지에서 논문과 여러 데모 영상을 확인할 수 있음
- 생성 작업뿐 아니라 비디오 편집 애플리케이션까지 함께 보여줌
전체 시간 구간을 한 번에 생성하는 구조
- Lumiere는 Space-Time U-Net 아키텍처를 도입해 영상의 전체 시간 길이를 한 번의 모델 패스로 생성함
- 기존 비디오 모델은 먼 키프레임을 먼저 합성한 뒤 시간 초해상도를 적용하는 방식이라, 전역 시간 일관성을 맞추기 어려움
- 이 모델은 공간뿐 아니라 시간 방향에서도 다운샘플링과 업샘플링을 적용함
- 사전 학습된 텍스트-투-이미지 확산 모델을 활용해 여러 시공간 스케일에서 풀프레임레이트 저해상도 영상을 직접 생성함
텍스트와 이미지에서 비디오 생성
- Text-to-Video 데모는 텍스트 프롬프트만으로 영상을 생성함
- 예시는 산 정상의 하이커, 화성 기지 주변의 우주비행사, 선글라스를 쓴 개가 운전하는 장면, 초콜릿 시럽이 바닐라 아이스크림 위에 부어지는 장면, 폭죽, 해변 석양 타임랩스 등을 포함함
- Image-to-Video 데모는 입력 이미지와 프롬프트를 바탕으로 영상을 만듦
- 예시는 줄무늬 셔츠를 입은 슬픈 고양이, 눈 속에서 춤추는 테디베어, 바다에서 헤엄치는 거북이, 노트북을 쓰며 커피를 마시는 원숭이, 피아노를 치는 고양이 등을 포함함
스타일화 생성과 비디오 편집
- Stylized Generation은 단일 참조 이미지를 사용해 목표 스타일의 영상을 생성함
- 이 과정에는 미세조정된 텍스트-투-이미지 모델 가중치가 활용됨
- 스타일 참조 예시는 Sticker, 3D Melting Gold, Flat cartoon, 3D Rendering, Line drawing, Glowing, Watercolor painting 등을 포함함
- Video Stylization에서는 텍스트 기반 이미지 편집 방법으로 일관된 비디오 편집을 수행할 수 있음
- 예시 스타일 프롬프트는 “Made of wooden blocks”, “Origami folded paper art”, “Made of colorful toy bricks”, “Made of flowers” 등을 포함함
영역 기반 애니메이션과 인페인팅
- Cinemagraphs 기능은 이미지 콘텐츠 중 사용자가 지정한 특정 영역만 애니메이션화할 수 있음
- Video Inpainting 데모는 마스크가 적용된 원본 비디오를 입력으로 받아 출력 비디오를 생성함
- 인페인팅 예시는 의상이나 액세서리를 바꾸는 프롬프트를 포함함
- “wearing a gold strapless gown”
- “wearing sunglasses”
- “wearing a red scarf”
- “wearing rain boots”
사회적 영향과 안전성
- Lumiere의 주요 목표는 초보 사용자가 시각 콘텐츠를 창의적이고 유연하게 생성할 수 있게 하는 것임
- 같은 기술이 가짜 또는 유해 콘텐츠 제작에 오용될 위험도 있음
- 안전하고 공정한 사용을 위해 편향과 악의적 사용 사례를 탐지하는 도구를 개발하고 적용해야 함