- OpenAI는 Sora를 통해 비디오 생성 모델을 단순 영상 합성을 넘어 물리·디지털 세계 시뮬레이션으로 확장할 수 있는지 탐구함
- 핵심 설계는 비디오와 이미지를 시간·공간적으로 압축한 잠재 공간에 넣고, 이를 시공간 패치로 나눠 Transformer 토큰처럼 학습하는 방식임
- Sora는 고정 크기로 자르지 않고 가변 길이·해상도·화면비를 그대로 학습해 와이드스크린, 세로 비디오, 고해상도 이미지 생성을 같은 모델에서 처리함
- DALL·E 3의 재캡셔닝을 비디오에 적용하고 GPT로 짧은 프롬프트를 상세 캡션으로 확장해 텍스트 충실도와 영상 품질을 높임
- 3D 일관성, 객체 지속성, Minecraft 같은 디지털 세계 시뮬레이션은 일부 가능하지만, 유리 파손이나 음식 섭취처럼 상태 변화가 필요한 물리 상호작용에는 한계가 남아 있음
Sora가 다루는 문제와 보고 범위
- OpenAI는 비디오 데이터에 대한 대규모 생성 모델 학습을 탐구함
- Sora는 다양한 길이, 해상도, 화면비의 비디오와 이미지를 함께 학습하는 텍스트 조건부 확산 모델임
- 가장 큰 모델인 Sora는 최대 1분 길이의 고충실도 비디오를 생성할 수 있음
- 이 기술 보고서는 두 가지에 초점을 둠
- 다양한 시각 데이터를 대규모 생성 모델 학습에 적합한 통합 표현으로 바꾸는 방법
- Sora의 능력과 한계에 대한 정성적 평가
- 모델 세부 구조와 구현 세부사항은 포함하지 않음
- 기존 비디오 생성 연구는 순환 신경망, GAN, 자기회귀 Transformer, 확산 모델 등 여러 방법을 사용했지만, 좁은 데이터 범주, 짧은 비디오, 고정 크기 비디오에 집중한 경우가 많았음
- Sora는 다양한 길이, 화면비, 해상도에 걸쳐 비디오와 이미지를 생성하는 범용 시각 데이터 모델로 설계됨
시각 데이터를 패치로 통합하는 방식
- 대규모 언어 모델이 텍스트 토큰으로 코드, 수학, 자연어를 통합하듯, Sora는 시각 데이터에 패치를 사용함
- 비디오는 먼저 낮은 차원의 잠재 공간으로 압축되고, 이후 시공간 패치로 분해됨
- 패치 기반 표현은 다양한 비디오와 이미지 유형을 학습하는 데 확장 가능하고 효과적으로 작동함
비디오 압축과 시공간 잠재 패치
- Sora는 원본 비디오를 픽셀 공간에서 직접 다루지 않고, 시간·공간적으로 압축된 잠재 표현에서 학습하고 생성함
- 별도의 디코더 모델이 생성된 잠재 표현을 다시 픽셀 공간으로 매핑함
- 압축된 입력 비디오에서 추출한 시공간 패치 시퀀스는 Transformer의 토큰처럼 작동함
- 이미지는 단일 프레임 비디오로 볼 수 있어 같은 방식으로 처리 가능함
- 추론 시에는 무작위 초기화 패치를 원하는 크기의 격자에 배치해 생성 비디오의 크기를 제어함
비디오 생성을 위한 확산 Transformer 확장
- Sora는 잡음이 섞인 패치와 텍스트 프롬프트 같은 조건 정보를 입력받아 원래의 깨끗한 패치를 예측하도록 학습되는 확산 모델임
- 동시에 Sora는 확산 Transformer임
- Transformer는 언어 모델링, 컴퓨터 비전, 이미지 생성 등 여러 영역에서 확장 특성을 보여왔고, Sora에서도 비디오 모델로 효과적으로 확장됨
- 같은 seed와 입력에서 학습이 진행되고 계산량이 늘어날수록 샘플 품질이 뚜렷하게 좋아짐
- 비교 예시는 base compute, 4x compute, 32x compute로 구성됨
원래 크기로 학습하는 이점
- 기존 이미지·비디오 생성 접근은 보통 4초, 256x256 같은 표준 크기로 리사이즈, 크롭, 트림함
- Sora는 데이터를 원래 크기로 학습하는 방식에서 여러 이점을 얻음
-
샘플링 유연성
- Sora는 1920x1080p 와이드스크린 비디오, 1080x1920 세로 비디오, 그 사이의 다양한 비디오를 샘플링할 수 있음
- 서로 다른 기기에 맞는 콘텐츠를 네이티브 화면비로 직접 생성 가능함
- 같은 모델로 낮은 크기에서 빠르게 프로토타입을 만들고, 이후 전체 해상도로 생성할 수 있음
-
프레이밍과 구도 개선
- 원래 화면비로 학습하면 구도와 프레이밍이 개선됨
- 모든 학습 비디오를 정사각형으로 크롭한 모델은 피사체가 부분적으로만 보이는 비디오를 만들 때가 있음
- Sora는 정사각형 크롭 모델보다 프레이밍이 개선된 비디오를 생성함
언어 이해와 캡션 처리
- 텍스트-비디오 생성 시스템을 학습하려면 대응되는 텍스트 캡션이 있는 대량의 비디오가 필요함
- OpenAI는 DALL·E 3에서 도입한 재캡셔닝 기법을 비디오에 적용함
- 먼저 매우 상세한 캡션을 만드는 모델을 학습한 뒤, 이를 사용해 전체 학습 비디오에 텍스트 캡션을 생성함
- 상세한 비디오 캡션으로 학습하면 텍스트 충실도와 전체 비디오 품질이 개선됨
- DALL·E 3와 유사하게 GPT를 사용해 짧은 사용자 프롬프트를 긴 상세 캡션으로 바꾸고, 이를 비디오 모델에 전달함
- 이 방식은 Sora가 사용자 프롬프트를 더 정확히 따르는 고품질 비디오를 생성하는 데 쓰임
이미지와 비디오를 입력으로 쓰는 생성·편집
- Sora는 텍스트뿐 아니라 기존 이미지나 비디오도 프롬프트로 받을 수 있음
- 이 기능은 완벽히 반복되는 비디오 생성, 정적 이미지 애니메이션화, 비디오를 앞뒤 시간으로 확장하는 작업 등에 활용됨
-
DALL·E 이미지 애니메이션화
- Sora는 이미지와 프롬프트를 입력받아 비디오를 생성할 수 있음
- 예시는 DALL·E 2와 DALL·E 3 이미지 기반 비디오 생성으로 구성됨
-
생성 비디오 확장
- Sora는 비디오를 시간상 앞으로 또는 뒤로 확장할 수 있음
- 생성된 비디오의 한 구간에서 시작해 뒤쪽 시간으로 확장한 세 비디오는 서로 다른 시작점을 갖지만 같은 결말로 이어짐
- 같은 방법으로 비디오를 앞뒤로 확장해 끊김 없는 무한 루프를 만들 수 있음
-
비디오-투-비디오 편집과 연결
- 확산 모델 기반 이미지·비디오 편집 방법 중 하나인 SDEdit을 Sora에 적용함
- 이 기법은 Sora가 입력 비디오의 스타일과 환경을 제로샷으로 변환할 수 있게 함
- 두 입력 비디오 사이를 점진적으로 보간해, 주제와 장면 구성이 완전히 다른 비디오 사이에도 매끄러운 전환을 만들 수 있음
이미지 생성 능력
- Sora는 이미지도 생성할 수 있음
- 시간 길이가 한 프레임인 공간 격자에 Gaussian noise 패치를 배치하는 방식으로 이미지를 생성함
- 생성 가능한 이미지 크기는 가변적이며 최대 2048x2048 해상도까지 가능함
- 예시 프롬프트는 가을 인물 클로즈업, 산호초, 사과나무 아래 어린 호랑이 디지털 아트, 오로라가 있는 눈 덮인 산악 마을 등으로 구성됨
규모 확장에서 나타난 시뮬레이션 능력
- 대규모로 학습된 비디오 모델은 사람, 동물, 환경의 일부 측면을 시뮬레이션하는 창발적 능력을 보임
- 이런 특성은 3D나 객체에 대한 명시적 귀납 편향 없이 규모 확장에서 나타난 현상으로 다뤄짐
-
3D 일관성
- Sora는 동적인 카메라 움직임이 있는 비디오를 생성할 수 있음
- 카메라가 이동하거나 회전할 때 사람과 장면 요소가 3차원 공간에서 일관되게 움직임
-
장기 일관성과 객체 지속성
- 긴 비디오 샘플에서 시간적 일관성을 유지하는 것은 비디오 생성 시스템의 중요한 과제임
- Sora는 항상은 아니지만, 짧은 범위와 긴 범위의 의존성을 효과적으로 모델링할 때가 있음
- 사람, 동물, 객체가 가려지거나 프레임 밖으로 나가도 지속시키는 경우가 있음
- 하나의 샘플 안에서 같은 캐릭터의 여러 샷을 만들고, 비디오 전체에서 외형을 유지할 수 있음
-
세계와의 상호작용
- Sora는 단순한 방식으로 세계 상태에 영향을 주는 행동을 때때로 시뮬레이션함
- 예시는 화가가 캔버스에 남긴 붓자국이 시간이 지나도 유지되는 경우, 사람이 햄버거를 먹고 물린 자국이 남는 경우임
-
디지털 세계 시뮬레이션
- Sora는 비디오 게임 같은 인공 프로세스도 시뮬레이션할 수 있음
- Minecraft 예시에서는 기본 정책으로 플레이어를 제어하면서, 세계와 동역학을 높은 충실도로 렌더링할 수 있음
- “Minecraft”를 언급하는 캡션 프롬프트만으로 이런 능력을 제로샷으로 끌어낼 수 있음
현재 한계와 결론
- Sora는 시뮬레이터로서 여러 한계를 갖고 있음
- 유리가 깨지는 것 같은 많은 기본 상호작용의 물리를 정확히 모델링하지 못함
- 음식을 먹는 상호작용처럼 객체 상태가 올바르게 변해야 하는 경우도 항상 정확하지 않음
- 긴 샘플에서 일관성이 무너지거나 객체가 갑자기 나타나는 실패 사례는 Sora 랜딩 페이지에 더 제시됨
- 현재 능력은 비디오 모델의 지속적 확장이 물리·디지털 세계와 그 안의 객체, 동물, 사람을 다루는 유능한 시뮬레이터 개발 경로가 될 수 있음을 보여줌