캐릭터 애니메이션을 위한 일관되고 제어 가능한 이미지-비디오 합성 기법
- 캐릭터 애니메이션은 정지 이미지로부터 동작 신호를 통해 캐릭터 비디오를 생성하는 것을 목표로 함.
- 디퓨전 모델은 강력한 생성 능력 덕분에 시각적 생성 연구에서 주류를 이루고 있으나, 이미지-비디오 분야, 특히 캐릭터 애니메이션에서는 세부 정보를 시간적으로 일관되게 유지하는 것이 큰 도전임.
- 본 논문에서는 디퓨전 모델의 장점을 활용하여 캐릭터 애니메이션을 위한 새로운 프레임워크를 제안하고, 참조 이미지의 복잡한 외형 특성을 유지하기 위해 ReferenceNet을 설계하여 공간적 주의를 통해 세부 특성을 통합함.
방법론
- 제안된 방법의 개요는 Pose Guider를 사용하여 포즈 시퀀스를 초기 인코딩하고, 다중 프레임 노이즈와 융합한 후, 비디오 생성을 위해 Denoising UNet이 비노이즈 과정을 수행함.
- Denoising UNet의 계산 블록은 공간적 주의, 교차 주의, 시간적 주의로 구성되며, 참조 이미지의 통합은 두 가지 측면을 포함함.
- 첫째, ReferenceNet을 통해 추출된 세부 특성이 공간적 주의에 사용되고, 둘째, CLIP 이미지 인코더를 통해 추출된 의미적 특성이 교차 주의에 사용됨.
- 시간적 주의는 시간 차원에서 작동하며, 최종적으로 VAE 디코더가 결과를 비디오 클립으로 디코딩함.
다양한 캐릭터 애니메이션
- 인간, 애니메/만화, 휴머노이드 캐릭터를 포함한 다양한 캐릭터를 애니메이션할 수 있음.
- 패션 비디오 합성은 패션 사진을 실제적인 애니메이션 비디오로 전환하는 것을 목표로 하며, UBC 패션 비디오 데이터셋에서 동일한 훈련 데이터를 사용하여 실험을 수행함.
- 인간 댄스 생성은 실제 댄스 시나리오에서 이미지를 애니메이션하는 것을 중점으로 하며, TikTok 데이터셋에서 동일한 훈련 데이터를 사용하여 실험을 수행함.
GN⁺의 의견
- 이 연구는 캐릭터 애니메이션 분야에서 중요한 진전을 나타내며, 디퓨전 모델을 활용하여 이미지로부터 비디오를 생성하는 새로운 방법을 제시함.
- 참조 이미지의 세부적인 특성을 유지하면서도 캐릭터의 움직임을 정교하게 제어할 수 있는 기술은 애니메이션과 시각 효과 산업에 큰 영향을 미칠 수 있음.
- 이 글은 캐릭터 애니메이션을 위한 혁신적인 접근 방식과 그것이 어떻게 다양한 캐릭터와 시나리오에 적용될 수 있는지에 대한 흥미로운 정보를 제공함.