- 이미지·비디오·오디오를 하나의 아키텍처에서 함께 학습해 생성·이해·행동 예측을 통합하려는 멀티모달 기반 모델이며, FLUX 3 Video부터 Early Access로 제공됨
- 이미지의 공간 구조, 비디오의 시간·물리 역학, 오디오의 사건·소리 관계를 상호 제약으로 학습하며, Self-Flow를 기반으로 데이터와 연산 자원을 확장함
- 네이티브 오디오가 포함된 비디오를 한 번에 최대 20초까지 생성하며, 초기 평가에서 Grok Imagine Video보다 최대 69%, Runway Gen-4.5보다 77%, Luma Ray 3.2보다 93%의 비교에서 선호됨
- 이미지 합성·편집과 다국어 텍스트 렌더링을 지원하고, 사전 학습된 비디오 백본을 제한된 작업별 데이터로 미세조정해 로봇 행동 모델로 활용할 수 있음
- Video·Image·Action과 오픈 가중치 기반 FLUX 3 Dev를 순차 출시하며, 장기적으로 지각·행동·언어 예측을 하나의 모델로 통합하는 것이 목표임
현실을 함께 학습하는 멀티모달 모델
- FLUX 3는 이미지·비디오·오디오를 분리된 요소가 아니라, 동일한 현실을 서로 다른 센서로 관측한 결과로 취급함
- 이미지는 특정 시점의 공간 구조와 관계를 포착함
- 비디오는 시간 차원을 복원해 움직임, 시간적 역학, 물리 법칙을 드러냄
- 오디오는 시각만으로 감지하기 어려운 기계적 현상과 음향의 인과관계를 보여줌
- 언어는 이러한 지각을 목표·추상화·지시와 연결함
- 여러 양식을 함께 학습하면 소리는 충돌과 일치하고, 움직임은 질량을 따르며, 미래는 과거에서 이어져야 한다는 상호 제약을 활용할 수 있음
- FLUX 3는 이러한 원칙만으로 구축한 첫 모델로, 물리·디지털 환경에서 지각하고 예측하며 행동하는 현실 세계의 시각 지능을 지향함
- 콘텐츠 제작과 물리 AI에서 얻은 초기 결과는 이 접근법의 가능성을 보여줌
Self-Flow 기반 통합 아키텍처
- Self-Flow는 하나의 기반 아키텍처에서 멀티모달 생성과 이해를 효율적으로 정렬하는 접근법임
- FLUX 3는 Self-Flow를 바탕으로 연산량과 데이터 자원을 크게 확장해 비디오·이미지·오디오를 동시에 학습함
- 공개 비교에는 양식별 생성 오류를 Flow Matching 기준 100으로 정규화한 Fréchet distance와, 미세조정 후 4개 작업군의 조작 성공률이 사용됨
비디오와 네이티브 오디오 생성
- FLUX 3는 한 번의 생성으로 최대 20초 길이의 다양한 비디오와 오디오를 만들 수 있음
- 지원 범위는 다음과 같음
- 텍스트-비디오 생성
- 시작 프레임을 이어가거나 이미지를 시각 참조로 사용하는 이미지-비디오 생성
- 원본 캐릭터 같은 핵심 요소를 새로운 장면이나 맥락으로 옮기는 비디오-비디오 생성
- 입력 비디오와 오디오를 이어 만드는 생성형 비디오·오디오 연속 생성
- 지정한 장면 사이의 전환을 제어하는 키프레임-비디오 생성
- 다국어 대화
- 전통적인 영화 형식을 넘어서는 다양한 시각 스타일과 화면비
- 개별 클립을 더 긴 멀티숏 시퀀스로 연결하는 에이전트형 체이닝
- 캠코더 영상부터 애니메이션·영화 영상까지 아우르는 폭넓은 스타일
- 타이포그래피 생성과 애니메이션 디자인
- 모든 비디오 출력에는 네이티브 오디오 생성이 포함됨
초기 비디오 평가
- 예비 평가는 오디오가 포함된 720p 10초 텍스트-비디오 클립으로 진행함
- 비교 평가에서 FLUX 3가 선호된 비율은 다음과 같음
- Grok Imagine Video 대비 최대 69%
- Kling v3 Pro 대비 60%
- Happy Horse v1 대비 59%, Happy Horse 1.1 대비 57%
- Seedance 2.0 및 Gemini Omni Flash 대비 각각 52%
- Runway Gen-4.5 대비 77%
- Luma Ray 3.2 대비 93%
- 모델과 주변 하네스가 아직 개발 중이어서 결과는 예비 단계이며, Early Access 기간에 더 개선될 예정임
- 현재 특히 강한 영역은 사람의 표정 포착, 물리적 사건과 소리의 연결, 다국어 처리임
- 시각 참조로 장면 전반의 캐릭터 일관성을 유지하면서 여러 클립을 결합해 수분 길이 시퀀스를 만들 수 있음
- FLUX 3 Video는 Early Access로 제공됨
이미지 합성과 편집
- FLUX 3는 다양한 스타일·화면비·해상도로 이미지를 합성하고 편집할 수 있음
- 중간 학습 단계의 예비 평가에서는 이전 FLUX 버전보다 복잡한 프롬프트 처리와 텍스트 생성 능력이 크게 향상됨
- 다양한 출력 스타일을 생성하고 여러 언어의 텍스트를 높은 정확도로 렌더링할 수 있음
- 평가 결과는 아직 예비 단계이며, 정식 출시 전까지 추가 개선할 예정임
- FLUX 3 Image Early Access는 향후 몇 주 안에 시작할 계획임
행동 예측과 로봇 학습
- 현실 이해를 행동 예측으로 확장하기 위해 두 가지 경로를 사용함
- Self-Flow의 초기 작업을 확장해 FLUX 3 자체에 네이티브 행동 예측을 통합함
- 사전 학습된 비디오 백본을 역학을 이해하는 기반으로 삼고, 제한된 작업별 데이터로 전문 행동 모델을 미세조정함
- 초기 접근 파트너인 mimic robotics와 함께 FLUX-mimic을 개발함
- FLUX 3 백본에 mimic의 정교한 로봇 조작 학습 및 프로덕션 배포 전문성을 결합한 비디오-행동 모델임
- Audi의 실제 프로덕션 작업에서 물리 AI와 콘텐츠 제작의 공통 기반을 시험하는 내용도 별도로 공개됨
기능별 순차 출시
- 각 기능은 원활한 출시와 피드백 수집, 엄격한 안전성 테스트를 위한 Early Access를 거쳐 향후 몇 주에서 몇 달에 걸쳐 제공됨
- 모두 같은 멀티모달 Flow Matching 기반 모델에서 파생됨
- FLUX 3 Video: API와 비공개 가중치 접근을 통한 비디오·오디오 생성 및 편집
- FLUX-mimic·FLUX 3 Action: mimic robotics를 시작으로 선정된 연구·상업 파트너에게 행동 예측 제공
- FLUX 3 Image: API와 비공개 가중치 접근을 통한 이미지 합성 및 편집
- FLUX 3 Dev: 비디오·오디오·이미지 콘텐츠 생성과 행동 예측을 위한 멀티모달 백본의 오픈 가중치 제공
- 기반 접근법의 추가 기술 세부 정보도 공개할 예정이며, Early Access를 신청할 수 있음
지각·행동·언어의 통합
- 향후 적용 대상으로 대화형 이미지·비디오 편집, 시뮬레이션, 컴퓨터 사용, 물리 AI를 내세움
- 현재 기능을 점진적으로 출시하는 동시에 차세대 모델 개발도 진행 중임
- 최종 목표는 지각·행동·언어 예측을 하나의 통합 모델에 결합하는 것임