- Black Forest Labs와 mimic robotics는 이미지·비디오·오디오를 공동 학습한 FLUX 3 백본에 로봇 행동 예측을 결합해, Audi 생산 현장에서 시험·배포한 FLUX-mimic을 개발함
- 전체 학습 연산의 95% 이상을 차지하는 비디오 예측으로 접촉·운동·무게·인과관계를 익히고, 저차원 로봇 행동도 같은 물리 현실을 나타내는 추가 양식으로 처리함
- 행동 예측을 추가한 직후 비디오 생성 품질이 최대 10% 하락했지만 3,500스텝 뒤 기존 수준을 회복해, 하나의 백본으로 생성과 행동 예측을 함께 수행할 수 있음을 확인함
- Self-Flow로 생성·표현 학습을 통합하고 경량 행동 디코더를 연결해, 단일 NVIDIA RTX 5090에서 백본 처리 80ms 미만, 전체 로봇 반응 시간 101ms를 달성함
- 범용 비디오와 조작 작업을 대규모로 학습한 세계 모델은 적은 시연만으로 새 작업에 적응하고 실패 후 재시도해, 유연한 부품과 정밀 조작처럼 기존 자동화의 비용이 높았던 생산 작업에 활용됨
하나의 백본으로 콘텐츠 생성과 로봇 제어
- FLUX 1·FLUX 2가 이미지 생성에 집중한 데 이어, FLUX 3는 이미지·비디오·오디오를 처음부터 함께 학습해 시청각 콘텐츠를 공동 생성함
- Black Forest Labs는 mimic robotics에 FLUX 3 초기 버전을 제공하고, 양사의 로봇 학습·배포 및 기반 모델 전문성을 결합해 FLUX-mimic을 개발함
- mimic은 자체 로봇과 로봇 학습, 정교한 조작, 생산 환경 배포를 담당함
- Black Forest Labs는 시각 기반 모델과 다중양식 학습·모델링 역량을 제공함
- FLUX-mimic은 FLUX 3 백본에 기반한 범용 조작용 비디오-액션 모델이며, mimic의 풀스택 배포 시스템에 통합됨
- 같은 백본이 이미지·비디오·오디오 콘텐츠를 생성하는 동시에, Physical AI에서는 행동을 수행함
비디오 예측으로 학습하는 물리 세계
- FLUX 3 학습 연산의 95% 이상이 비디오 예측에 사용됨
- 사실적인 비디오를 만들려면 접촉, 운동, 무게, 원인과 결과를 학습해야 하며, 이를 잘못 처리하면 결과 영상도 부자연스러워짐
- 세계를 정확히 렌더링하는 과정은 세계가 작동하는 방식을 학습하는 과정과 연결됨
- 오디오는 720p 음향 포함 비디오에서 토큰의 0.5% 미만을 차지하는 저차원 양식임
- 비디오를 이해한 모델은 입술 움직임과 동기화된 음성, 물리적 사건에 맞물린 효과음의 인과관계를 학습할 수 있음
- 로봇 행동 역시 시각 관측과 밀접하게 결합된 저차원 상태 표현임
- 행동·오디오·비디오 프레임은 하나의 물리적 현실을 부분적으로 나타냄
- 행동 예측은 별도의 기반 모델을 만드는 대신, 기존 세계 모델에 또 하나의 관측 방식을 연결함
행동 학습 뒤 회복한 생성 품질
- 대규모 학습에 행동 예측을 추가하자 텍스트-비디오와 이미지-비디오 생성의 인간 평가 점수가 처음에는 최대 10% 하락함
- 모델이 행동 공간의 구조를 익히고 내부 세계 표현을 정렬하면서 품질이 회복됐으며, 3,500스텝 뒤 기존 비디오 생성 수준에 도달하면서 행동도 예측하게 됨
- 행동을 입출력에 통합하는 동안 일시적인 혼란은 있었지만, 기존 능력의 용량을 영구적으로 희생하지는 않았음
- 비디오 생성과 행동 예측에 별도의 기반 모델이 필요하지 않으며, 동일한 단일 백본이 두 작업을 수행함
세계 표현에서 행동을 해독하는 구조
- FLUX-mimic은 FLUX 3가 비디오 생성을 위해 학습한 내부 세계 표현에서 로봇 행동을 해독함
- mimic-video에서 먼저 사용한 방식에 따라 FLUX의 비디오 예측 경로에서 중간 특징을 추출하고, 그 위에 경량 행동 디코더를 학습함
- 성능은 서로 연결된 두 요소에 좌우됨
- 세계 모델 품질: 세계가 어떻게 움직이는지 이해하지 못하면 정확한 시뮬레이션도 어려우며, 생성 품질과 직접 연결됨
- 표현 품질: 양식 사이의 인과관계가 특징 공간에서 비선형적으로 얽히면 행동 디코더가 이를 원시 입력만큼 어렵게 해석해야 함
- 생성 모델은 고품질 시뮬레이션과 연산량 증가에 따른 예측 가능한 확장 법칙을 제공하지만, 전문 표현 학습 방식보다 덜 분리된 표현을 만들어 세계 이해가 필요한 후속 작업의 활용도를 제한할 수 있음
Self-Flow로 통합한 생성·표현 학습
- Self-Flow는 생성 학습과 표현 학습을 하나의 프레임워크로 통합함
- 적용 후 세계 모델과 표현의 품질이 함께 향상됨
- 비디오·이미지·오디오 생성 품질로 측정한 세계 모델 성능이 높아짐
- 시뮬레이션 로봇 제어 작업의 성공률로 측정한 표현 품질도 개선됨
- FLUX 3는 Self-Flow를 확장해 처음부터 폭넓은 세계 동역학과 조작 능력을 학습함
- 일반 비디오 콘텐츠 수천만 시간
- 인간 및 로봇 조작에 초점을 둔 비디오 콘텐츠 수십만 시간
- 이 대규모 학습을 통해 실험실의 Self-Flow 결과를 실제 생산·물류 환경으로 확장함
공장 작업과 벤치마크 성능
- mimic은 FLUX-mimic을 실제 공장 업무에 배포함
- 부품을 구조화된 트레이에 담는 키팅
- 전자 제어 장치를 여유가 적은 고정구에 삽입하는 작업
- 부품 조립
- 실·케이블처럼 부드럽고 유연한 재료 취급
- FLUX 백본을 완전히 고정해도 행동 디코더가 이전 시각-언어-행동 모델보다 높은 성능을 냈으며, 이전 모델들은 이 설정에서 작업에 성공하지 못함
- 백본과 행동 디코더를 함께 미세조정하면 FLUX-mimic이 최고 수준의 작업 성공률을 기록함
- 대규모 학습은 백본에 세계와 행동에 관한 지식을 제공하고, Self-Flow는 그 지식을 특징 표현에서 쉽게 해독할 수 있게 함
적은 시연으로 배우고 실패에서 복구
- 물리 법칙이 이미 접근 가능한 표현에 담겨 있으면, 새 작업 적응은 세계의 작동 방식을 다시 배우는 대신 특정 작업을 기존 지식에 연결하는 과정이 됨
- Self-Flow 실험에서는 같은 성공률에 도달하는 데 필요한 행동 예측 학습 스텝이 Self-Flow를 사용하지 않은 비디오 모델의 절반으로 줄어듦
- mimic-video 논문에서 비디오-액션 모델은 시각-언어-행동 모델보다 최대 10배 높은 표본 효율성을 보였으며, FLUX-mimic은 두 효과를 결합함
- 로봇이 물체 잡기에 실패하면 자세를 수정해 다시 잡고 작업을 마치는 자연스러운 실패 복구가 가능함
- 모든 실패 유형을 시연 데이터에 담을 수 없으므로, 시연되지 않은 복구 행동은 세계의 작동 방식을 이미 학습한 모델에서 나옴
101ms로 반응하는 로봇 시스템
- 실제 환경에서는 모델이 환경 변화 속도에 맞춰 행동해야 하며, FLUX-mimic의 연산 비용 대부분은 가장 큰 구성 요소인 백본에서 발생함
- 잘 구조화된 세계 표현은 같은 성능을 더 적은 매개변수로 달성하게 해, 더 작고 빠른 백본을 사용할 수 있게 함
- 최적화된 백본은 단일 NVIDIA RTX 5090에서 입력부터 세계 표현 생성까지 80ms 미만으로 실행되며, 인간의 시각 반응 시간과 같은 규모임
- mimic은 전체 배포 스택에서 추가 지연을 줄이기 위해 다음 요소를 최적화함
- 행동 디코더
- 센서·모델·액추에이터 사이의 프로세스 간 지연
- 예측과 실행을 겹쳐 로봇의 끊김을 방지하는 실시간 청킹
- 모든 최적화를 적용한 독립형 로봇 시스템의 최종 반응 시간은 101ms임
Audi 생산 현장 적용
- Audi는 높은 자동화 수준에도 유연한 부품과 정밀 조작 작업을 계속 수작업으로 처리해 왔음
- 프리미엄 제품 생산은 변형 종류가 많아, 기존 방식으로 프로그래밍한 로봇 셀을 사례마다 다시 설계하는 비용이 높음
- 학습 기반 시스템은 이러한 비용 구조를 바꿈
- Audi Production Lab은 mimic과 협력해 FLUX-mimic을 시험·배포함
- 기존 로봇으로는 불가능했던 복잡한 연성 물체 조작을 수행함
- 직원 지원, 효율 개선, 생산·물류의 유연한 자동화 확대에 활용할 수 있음
- FLUX-mimic의 표본 효율성과 견고성은 작업별 엔지니어링이 아니라 FLUX 3 백본과 해독 가능한 표현에서 나오며, 작업·산업·하드웨어 사이의 이전을 지원함
- 하나의 시각 지능 기반 모델이 이미지·비디오·오디오를 생성하는 동시에 생산 라인의 로봇을 구동함