# FLUX 3 x mimic: 로봇을 위한 차세대 비디오-액션 모델

> Clean Markdown view of GeekNews topic #31789. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=31789](https://news.hada.io/topic?id=31789)
- GeekNews Markdown: [https://news.hada.io/topic/31789.md](https://news.hada.io/topic/31789.md)
- Type: GN+
- Author: [xguru](https://news.hada.io/@xguru)
- Published: 2026-07-25T08:11:30+09:00
- Updated: 2026-07-25T08:11:30+09:00
- Original source: [bfl.ai](https://bfl.ai/blog/flux-3-mimic)
- Points: 1
- Comments: 1

## Topic Body

- Black Forest Labs와 mimic robotics는 이미지·비디오·오디오를 공동 학습한 **FLUX 3 백본**에 로봇 행동 예측을 결합해, Audi 생산 현장에서 시험·배포한 FLUX-mimic을 개발함
- 전체 학습 연산의 **95% 이상을 차지하는 비디오 예측**으로 접촉·운동·무게·인과관계를 익히고, 저차원 로봇 행동도 같은 물리 현실을 나타내는 추가 양식으로 처리함
- 행동 예측을 추가한 직후 비디오 생성 품질이 최대 10% 하락했지만 **3,500스텝 뒤 기존 수준을 회복**해, 하나의 백본으로 생성과 행동 예측을 함께 수행할 수 있음을 확인함
- Self-Flow로 생성·표현 학습을 통합하고 경량 행동 디코더를 연결해, 단일 NVIDIA RTX 5090에서 **백본 처리 80ms 미만**, 전체 로봇 반응 시간 101ms를 달성함
- 범용 비디오와 조작 작업을 대규모로 학습한 세계 모델은 적은 시연만으로 새 작업에 적응하고 실패 후 재시도해, **유연한 부품과 정밀 조작**처럼 기존 자동화의 비용이 높았던 생산 작업에 활용됨

---

### 하나의 백본으로 콘텐츠 생성과 로봇 제어
- **FLUX 1·FLUX 2**가 이미지 생성에 집중한 데 이어, FLUX 3는 이미지·비디오·오디오를 처음부터 함께 학습해 시청각 콘텐츠를 공동 생성함
- Black Forest Labs는 [mimic robotics](https://www.mimicrobotics.com/)에 FLUX 3 초기 버전을 제공하고, 양사의 로봇 학습·배포 및 기반 모델 전문성을 결합해 **FLUX-mimic**을 개발함
  - mimic은 자체 로봇과 로봇 학습, 정교한 조작, 생산 환경 배포를 담당함
  - Black Forest Labs는 시각 기반 모델과 다중양식 학습·모델링 역량을 제공함
- FLUX-mimic은 FLUX 3 백본에 기반한 범용 조작용 **비디오-액션 모델**이며, mimic의 풀스택 배포 시스템에 통합됨
- 같은 백본이 이미지·비디오·오디오 콘텐츠를 생성하는 동시에, Physical AI에서는 행동을 수행함

### 비디오 예측으로 학습하는 물리 세계
- FLUX 3 학습 연산의 **95% 이상**이 비디오 예측에 사용됨
  - 사실적인 비디오를 만들려면 접촉, 운동, 무게, 원인과 결과를 학습해야 하며, 이를 잘못 처리하면 결과 영상도 부자연스러워짐
  - 세계를 정확히 렌더링하는 과정은 세계가 작동하는 방식을 학습하는 과정과 연결됨
- 오디오는 720p 음향 포함 비디오에서 토큰의 **0.5% 미만**을 차지하는 저차원 양식임
  - 비디오를 이해한 모델은 입술 움직임과 동기화된 음성, 물리적 사건에 맞물린 효과음의 인과관계를 학습할 수 있음
- 로봇 행동 역시 시각 관측과 밀접하게 결합된 저차원 상태 표현임
  - 행동·오디오·비디오 프레임은 하나의 물리적 현실을 부분적으로 나타냄
  - 행동 예측은 별도의 기반 모델을 만드는 대신, 기존 세계 모델에 또 하나의 관측 방식을 연결함

### 행동 학습 뒤 회복한 생성 품질
- 대규모 학습에 행동 예측을 추가하자 텍스트-비디오와 이미지-비디오 생성의 인간 평가 점수가 처음에는 최대 **10% 하락**함
- 모델이 행동 공간의 구조를 익히고 내부 세계 표현을 정렬하면서 품질이 회복됐으며, **3,500스텝** 뒤 기존 비디오 생성 수준에 도달하면서 행동도 예측하게 됨
- 행동을 입출력에 통합하는 동안 일시적인 혼란은 있었지만, 기존 능력의 용량을 영구적으로 희생하지는 않았음
- 비디오 생성과 행동 예측에 별도의 기반 모델이 필요하지 않으며, 동일한 **단일 백본**이 두 작업을 수행함

### 세계 표현에서 행동을 해독하는 구조
- FLUX-mimic은 FLUX 3가 비디오 생성을 위해 학습한 내부 세계 표현에서 로봇 행동을 해독함
- mimic-video에서 먼저 사용한 방식에 따라 FLUX의 비디오 예측 경로에서 중간 특징을 추출하고, 그 위에 **경량 행동 디코더**를 학습함
- 성능은 서로 연결된 두 요소에 좌우됨
  - **세계 모델 품질**: 세계가 어떻게 움직이는지 이해하지 못하면 정확한 시뮬레이션도 어려우며, 생성 품질과 직접 연결됨
  - **표현 품질**: 양식 사이의 인과관계가 특징 공간에서 비선형적으로 얽히면 행동 디코더가 이를 원시 입력만큼 어렵게 해석해야 함
- 생성 모델은 고품질 시뮬레이션과 연산량 증가에 따른 예측 가능한 확장 법칙을 제공하지만, 전문 표현 학습 방식보다 덜 분리된 표현을 만들어 세계 이해가 필요한 후속 작업의 활용도를 제한할 수 있음

### Self-Flow로 통합한 생성·표현 학습
- [Self-Flow](https://bfl.ai/research/self-flow)는 생성 학습과 표현 학습을 **하나의 프레임워크**로 통합함
- 적용 후 세계 모델과 표현의 품질이 함께 향상됨
  - 비디오·이미지·오디오 생성 품질로 측정한 세계 모델 성능이 높아짐
  - 시뮬레이션 로봇 제어 작업의 성공률로 측정한 표현 품질도 개선됨
- FLUX 3는 Self-Flow를 확장해 처음부터 폭넓은 세계 동역학과 조작 능력을 학습함
  - 일반 비디오 콘텐츠 **수천만 시간**
  - 인간 및 로봇 조작에 초점을 둔 비디오 콘텐츠 **수십만 시간**
- 이 대규모 학습을 통해 실험실의 Self-Flow 결과를 실제 생산·물류 환경으로 확장함

### 공장 작업과 벤치마크 성능
- mimic은 FLUX-mimic을 실제 공장 업무에 배포함
  - 부품을 구조화된 트레이에 담는 키팅
  - 전자 제어 장치를 여유가 적은 고정구에 삽입하는 작업
  - 부품 조립
  - 실·케이블처럼 부드럽고 유연한 재료 취급
- FLUX 백본을 완전히 고정해도 행동 디코더가 이전 **시각-언어-행동 모델**보다 높은 성능을 냈으며, 이전 모델들은 이 설정에서 작업에 성공하지 못함
- 백본과 행동 디코더를 함께 미세조정하면 FLUX-mimic이 최고 수준의 작업 성공률을 기록함
- 대규모 학습은 백본에 세계와 행동에 관한 지식을 제공하고, Self-Flow는 그 지식을 특징 표현에서 쉽게 해독할 수 있게 함

### 적은 시연으로 배우고 실패에서 복구
- 물리 법칙이 이미 접근 가능한 표현에 담겨 있으면, 새 작업 적응은 세계의 작동 방식을 다시 배우는 대신 특정 작업을 기존 지식에 연결하는 과정이 됨
- Self-Flow 실험에서는 같은 성공률에 도달하는 데 필요한 행동 예측 학습 스텝이 Self-Flow를 사용하지 않은 비디오 모델의 **절반**으로 줄어듦
- mimic-video 논문에서 비디오-액션 모델은 시각-언어-행동 모델보다 최대 **10배 높은 표본 효율성**을 보였으며, FLUX-mimic은 두 효과를 결합함
- 로봇이 물체 잡기에 실패하면 자세를 수정해 다시 잡고 작업을 마치는 **자연스러운 실패 복구**가 가능함
  - 모든 실패 유형을 시연 데이터에 담을 수 없으므로, 시연되지 않은 복구 행동은 세계의 작동 방식을 이미 학습한 모델에서 나옴

### 101ms로 반응하는 로봇 시스템
- 실제 환경에서는 모델이 환경 변화 속도에 맞춰 행동해야 하며, FLUX-mimic의 연산 비용 대부분은 가장 큰 구성 요소인 **백본**에서 발생함
- 잘 구조화된 세계 표현은 같은 성능을 더 적은 매개변수로 달성하게 해, 더 작고 빠른 백본을 사용할 수 있게 함
- 최적화된 백본은 단일 **NVIDIA RTX 5090**에서 입력부터 세계 표현 생성까지 80ms 미만으로 실행되며, 인간의 시각 반응 시간과 같은 규모임
- mimic은 전체 배포 스택에서 추가 지연을 줄이기 위해 다음 요소를 최적화함
  - 행동 디코더
  - 센서·모델·액추에이터 사이의 프로세스 간 지연
  - 예측과 실행을 겹쳐 로봇의 끊김을 방지하는 실시간 청킹
- 모든 최적화를 적용한 독립형 로봇 시스템의 최종 **반응 시간은 101ms**임

### Audi 생산 현장 적용
- Audi는 높은 자동화 수준에도 유연한 부품과 정밀 조작 작업을 계속 수작업으로 처리해 왔음
- 프리미엄 제품 생산은 변형 종류가 많아, 기존 방식으로 프로그래밍한 로봇 셀을 사례마다 다시 설계하는 비용이 높음
  - 학습 기반 시스템은 이러한 비용 구조를 바꿈
- Audi Production Lab은 mimic과 협력해 **FLUX-mimic을 시험·배포**함
  - 기존 로봇으로는 불가능했던 복잡한 연성 물체 조작을 수행함
  - 직원 지원, 효율 개선, 생산·물류의 유연한 자동화 확대에 활용할 수 있음
- FLUX-mimic의 표본 효율성과 견고성은 작업별 엔지니어링이 아니라 FLUX 3 백본과 해독 가능한 표현에서 나오며, 작업·산업·하드웨어 사이의 이전을 지원함
- 하나의 시각 지능 기반 모델이 이미지·비디오·오디오를 생성하는 동시에 생산 라인의 로봇을 구동함

## Comments



### Comment 62359

- Author: neo
- Created: 2026-07-25T08:11:31+09:00
- Points: 1

###### [Hacker News 의견들](https://news.ycombinator.com/item?id=49033127) 
- 잘 훈련된 **멀티모달 동영상 생성 모델** 내부에는 세계 표상 모델이 형성되며, 이를 추출해 로봇에 적용해도 잘 작동하는 것으로 보임  
  동영상 모델이 물질과 빛, 세계를 이해한다는 발상은 새롭지 않지만, 동영상 연구소가 로봇 연구소로 전환한 경우는 드물었음. 동영상 생성으로 규모를 키운 뒤 그 역량으로 로봇을 훈련하는 사업 경로가 될 수 있음  
  장갑 안에 여러 장치를 숨긴 듯한 BFL의 손도 흥미로움. Xiami의 Robotics-1은 일반적인 그리퍼와 그리퍼형 장갑으로 훈련 영상을 만들지만, **BFL 모델**은 그런 장비가 필요 없어 보임. 하드웨어가 어려운 분야인 만큼 앞으로의 접근이 궁금함
  - 이 전략은 이미 일반적이지 않나 싶음. Nvidia도 동영상 생성 모델로 로봇을 훈련하는 시연을 했고, Waymo 역시 한동안 이를 활용해 왔음  
    [https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-f...](<https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-frontier-for-autonomous-driving-simulation/>)
  - 다른 동영상 연구소들도 **로봇공학**에 진출하고 있음  
    Luma Labs [https://lumalabs.ai/news/luma-open-physical-ai-lab](<https://lumalabs.ai/news/luma-open-physical-ai-lab>)  
    Runway [https://runway.com/product/robotics](<https://runway.com/product/robotics>)

- 3분 30초쯤 로봇 팔이 세 번 시도한 끝에 창문 몰딩을 다시 끼우는 장면이 상당히 놀라웠음. 이런 **실패 후 문제 해결**은 처음 보는데 새로운 기술인지 궁금함
  - Google은 1년도 더 전에 VLA 기반 로봇이 장력이 걸린 **타이밍 벨트**를 교체하는, 어쩌면 더 인상적인 작업을 선보였음: [https://www.youtube.com/watch?v=2AAFiuEP7iE](<https://www.youtube.com/watch?v=2AAFiuEP7iE/>)
  - 최신 수준을 따라잡으려면 정교한 조작 작업에서 최첨단인 **Generalist**를 살펴볼 만함: [https://generalistai.com/blog/gen-1](<https://generalistai.com/blog/gen-1>)

- “세계 이해가 필요한 작업에는 덜 분리된 표상이 덜 유용하다”는 설명에서, ‘더 얽힌’이라는 개념을 굳이 **덜 분리된 표상**으로 표현한 문장이 우스움. 현실 세계를 설명하면서 개념 자체도 더 얽히게 만드는 건 LLM다운 표현처럼 보임
  - 이제는 근거 없이 문장마다 LLM의 흔적을 찾는 수준임. 모든 글이 어느 정도 **LLM의 도움**을 받았다고 가정하고 결과물의 품질만 평가할 때가 됐음
  - 사람도 어색한 문장을 자주 씀. 오히려 그런 표현은 훈련 데이터에 드물어서 **LLM이 만들 가능성**이 사람보다 낮을 수도 있음
  - 농담이었음
  - 원문의 대시도 분명 LLM이 이 댓글을 썼다는 증거임 /s

- 기술은 이토록 발전했는데 영화는 어느 때보다 나빠진 듯해 슬픔. 괜찮은 작품을 찾으려고 수십 년 전 영화를 보곤 하는데, 우스꽝스러운 인형을 쓰고도 **이야기 구성은 1,000배** 뛰어났음
  - 아무도 기억하지 않는 형편없는 옛 영화는 보지 않기 때문에 생기는 **생존자 편향**일 수 있음
  - Robin Rombach가 영화 제작을 모른다는 이유로 BFL 투자를 거절할 것인가? Sora는 끝났으며, Bill Peebles가 영화 제작을 모른다고 공개적으로 말할 용기 있는 사람을 찾기도 어려움  
    이는 벤처캐피털만의 문제가 아니며 이른바 **Hollywood No**와 연결됨. 반대로 Hollywood No 자체가 문제일 수도 있고, 게임 업계에서는 이를 **독성 긍정주의**라고 불러왔음

- **유럽 스타트업 간 협력**을 보니 반가움
  - Flux는 Meta에 인수되지 않았나?

- 이것은 미래이면서 이미 현재임. 소프트웨어 개발·엔지니어링 바깥에 있는 지인에게도 이 내용을 공유해 주길 바람

- 생산수단을 소유하지 않은 인간의 가치가 더욱 낮아지는 **위기**를 향해 정면으로 달려가고 있음. 암울한 시기가 다가올 것으로 보임
