- 정규화 흐름(normalizing flow) 을 이용해 텍스트·이미지·비디오 입력으로부터 직접 영상을 생성하는 최초의 인과적 비디오 생성기
- 엔드투엔드 학습, 정확한 가능도 추정, 다중 생성 과제(T2V/I2V/V2V) 를 단일 모델로 처리
- Global-Local 아키텍처, Flow-Score Matching, 비디오 인식형 Jacobi 반복으로 시공간 일관성과 효율 향상
- 7B 파라미터 모델로 480p·16fps 비디오 생성, 70M 텍스트-비디오 및 400M 텍스트-이미지 데이터로 학습
- 정규화 흐름이 확산 기반 모델과 동등한 품질을 달성하며, 고품질 자가회귀 비디오 생성 가능성을 입증
STARFlow-V 개요
- STARFlow-V는 정규화 흐름 기반 인과적 비디오 생성 모델로, 확산 모델 수준의 시각 품질을 달성
- 엔드투엔드 학습, 정확한 가능도 추정, 다중 생성 과제 지원을 동시에 제공
- 기존 확산 모델이 주도하던 비디오 생성 영역에서 정규화 흐름의 실용성을 입증
- 텍스트-비디오(T2V), 이미지-비디오(I2V), 비디오-비디오(V2V) 생성 모두 단일 구조로 처리 가능
핵심 설계 및 학습 구조
- 모델은 Deep Autoregressive Block(전역 시계열 추론)과 Shallow Flow Block(프레임 내 세부 묘사)으로 구성
- 전자는 시공간 잠재 공간에서 장기 의존성을 포착
- 후자는 각 프레임의 지역적 세부 구조를 모델링
- Flow-Score Matching을 통해 학습된 인과적 경량 노이즈 제거기가 출력 일관성을 향상
- 학습 목표는 최대 가능도 추정과 Flow-Score Matching의 이중 목적 구조
주요 기술 기여
-
Global-Local 아키텍처
- 전역 인과 Transformer 블록이 장기 시공간 의존성을 처리
- 프레임 단위의 얕은 흐름 블록이 지역적 세부 묘사를 담당
- 픽셀 단위 자가회귀 모델의 누적 오차 문제를 완화
-
Flow-Score Matching 기반 노이즈 제거
- 모델의 확률 분포 기울기(스코어)를 예측하는 인과적 신경 노이즈 제거기를 병행 학습
- 비인과적 또는 불완전한 외부 디노이저 없이 단일 스텝 정제 가능
-
비디오 인식형 Jacobi 반복
- 비선형 시스템 해법으로 생성 과정을 재구성해 병렬 잠재 업데이트 수행
- 인접 프레임의 시계열 정보를 활용한 초기화와 파이프라인 실행으로 속도 향상
모델 사양
- 학습 데이터: 70M 텍스트-비디오 쌍, 400M 텍스트-이미지 쌍
- 모델 크기: 7B 파라미터, 출력 해상도 480p, 프레임 속도 16fps
- 정규화 흐름의 가역성 덕분에 구조 변경이나 재학습 없이 다양한 생성 과제 수행
생성 결과 및 비교
- 텍스트-비디오: 자연광, 실사풍, 매크로 등 다양한 장면을 고품질로 생성
- 이미지-비디오: 입력 이미지를 기반으로 시간적 일관성을 유지하며 영상 확장
- 비디오-비디오: 객체 추가, 색상 변환, 스타일 변경, 인페인팅 등 다양한 변형 수행
- 장편 비디오 생성: 10~30초 길이의 영상도 구간별 자가회귀 방식으로 생성
- 비교 실험: NOVA, WAN-Causal 대비 시각적 충실도와 시간적 일관성에서 우수한 결과
한계 및 실패 사례
- 복잡한 물리 상호작용이나 빠른 동작에서는 품질 저하 발생
- 원인으로 학습 자원 제약, 저품질 데이터, 후속 미세조정(SFT·RL) 부재가 명시됨
- 예시: 개가 물을 털거나, 염소가 점프하는 장면 등에서 부자연스러운 움직임 관찰
연구적 의의
- STARFlow-V는 정규화 흐름이 고품질 자가회귀 비디오 생성에 적합함을 최초로 입증
- 확산 모델 중심의 비디오 생성 연구에 새로운 대안적 접근 방향을 제시
- 세계 모델(world model) 구축을 위한 유망한 연구 경로로 평가됨