# FLUX 3 모델 공개

> Clean Markdown view of GeekNews topic #31791. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=31791](https://news.hada.io/topic?id=31791)
- GeekNews Markdown: [https://news.hada.io/topic/31791.md](https://news.hada.io/topic/31791.md)
- Type: GN+
- Author: [xguru](https://news.hada.io/@xguru)
- Published: 2026-07-25T08:16:41+09:00
- Updated: 2026-07-25T08:16:41+09:00
- Original source: [bfl.ai](https://bfl.ai/blog/flux-3)
- Points: 1
- Comments: 1

## Topic Body

- 이미지·비디오·오디오를 하나의 아키텍처에서 함께 학습해 생성·이해·행동 예측을 통합하려는 **멀티모달 기반 모델**이며, FLUX 3 Video부터 Early Access로 제공됨
- 이미지의 공간 구조, 비디오의 시간·물리 역학, 오디오의 사건·소리 관계를 상호 제약으로 학습하며, **Self-Flow**를 기반으로 데이터와 연산 자원을 확장함
- 네이티브 오디오가 포함된 비디오를 한 번에 최대 **20초**까지 생성하며, 초기 평가에서 Grok Imagine Video보다 최대 69%, Runway Gen-4.5보다 77%, Luma Ray 3.2보다 93%의 비교에서 선호됨
- 이미지 합성·편집과 다국어 텍스트 렌더링을 지원하고, 사전 학습된 비디오 백본을 제한된 작업별 데이터로 미세조정해 **로봇 행동 모델**로 활용할 수 있음
- Video·Image·Action과 오픈 가중치 기반 **FLUX 3 Dev**를 순차 출시하며, 장기적으로 지각·행동·언어 예측을 하나의 모델로 통합하는 것이 목표임

---

### 현실을 함께 학습하는 멀티모달 모델
- **FLUX 3**는 이미지·비디오·오디오를 분리된 요소가 아니라, 동일한 현실을 서로 다른 센서로 관측한 결과로 취급함
  - 이미지는 특정 시점의 공간 구조와 관계를 포착함
  - 비디오는 시간 차원을 복원해 움직임, 시간적 역학, 물리 법칙을 드러냄
  - 오디오는 시각만으로 감지하기 어려운 기계적 현상과 음향의 인과관계를 보여줌
  - 언어는 이러한 지각을 목표·추상화·지시와 연결함
- 여러 양식을 함께 학습하면 소리는 충돌과 일치하고, 움직임은 질량을 따르며, 미래는 과거에서 이어져야 한다는 **상호 제약**을 활용할 수 있음
- FLUX 3는 이러한 원칙만으로 구축한 첫 모델로, 물리·디지털 환경에서 지각하고 예측하며 행동하는 현실 세계의 시각 지능을 지향함
- 콘텐츠 제작과 **물리 AI**에서 얻은 초기 결과는 이 접근법의 가능성을 보여줌

### Self-Flow 기반 통합 아키텍처
- [Self-Flow](https://bfl.ai/research/self-flow)는 하나의 기반 아키텍처에서 멀티모달 생성과 이해를 효율적으로 정렬하는 접근법임
- FLUX 3는 Self-Flow를 바탕으로 연산량과 데이터 자원을 크게 확장해 **비디오·이미지·오디오를 동시에 학습**함
- 공개 비교에는 양식별 생성 오류를 Flow Matching 기준 100으로 정규화한 Fréchet distance와, 미세조정 후 4개 작업군의 조작 성공률이 사용됨

### 비디오와 네이티브 오디오 생성
- FLUX 3는 한 번의 생성으로 **최대 20초** 길이의 다양한 비디오와 오디오를 만들 수 있음
- 지원 범위는 다음과 같음
  - 텍스트-비디오 생성
  - 시작 프레임을 이어가거나 이미지를 시각 참조로 사용하는 이미지-비디오 생성
  - 원본 캐릭터 같은 핵심 요소를 새로운 장면이나 맥락으로 옮기는 비디오-비디오 생성
  - 입력 비디오와 오디오를 이어 만드는 생성형 비디오·오디오 연속 생성
  - 지정한 장면 사이의 전환을 제어하는 **키프레임-비디오** 생성
  - 다국어 대화
  - 전통적인 영화 형식을 넘어서는 다양한 시각 스타일과 화면비
  - 개별 클립을 더 긴 멀티숏 시퀀스로 연결하는 에이전트형 체이닝
  - 캠코더 영상부터 애니메이션·영화 영상까지 아우르는 폭넓은 스타일
  - 타이포그래피 생성과 애니메이션 디자인
- 모든 비디오 출력에는 **네이티브 오디오 생성**이 포함됨

### 초기 비디오 평가
- 예비 평가는 오디오가 포함된 **720p 10초 텍스트-비디오 클립**으로 진행함
- 비교 평가에서 FLUX 3가 선호된 비율은 다음과 같음
  - Grok Imagine Video 대비 최대 69%
  - Kling v3 Pro 대비 60%
  - Happy Horse v1 대비 59%, Happy Horse 1.1 대비 57%
  - Seedance 2.0 및 Gemini Omni Flash 대비 각각 52%
  - Runway Gen-4.5 대비 77%
  - Luma Ray 3.2 대비 93%
- 모델과 주변 **하네스**가 아직 개발 중이어서 결과는 예비 단계이며, Early Access 기간에 더 개선될 예정임
- 현재 특히 강한 영역은 사람의 표정 포착, 물리적 사건과 소리의 연결, 다국어 처리임
- 시각 참조로 장면 전반의 캐릭터 일관성을 유지하면서 여러 클립을 결합해 **수분 길이 시퀀스**를 만들 수 있음
- [FLUX 3 Video](https://bfl.ai/models/flux-3)는 Early Access로 제공됨

### 이미지 합성과 편집
- FLUX 3는 다양한 스타일·화면비·해상도로 이미지를 **합성하고 편집**할 수 있음
- 중간 학습 단계의 예비 평가에서는 이전 FLUX 버전보다 복잡한 프롬프트 처리와 텍스트 생성 능력이 크게 향상됨
- 다양한 출력 스타일을 생성하고 여러 언어의 텍스트를 높은 정확도로 렌더링할 수 있음
- 평가 결과는 아직 예비 단계이며, 정식 출시 전까지 추가 개선할 예정임
- **FLUX 3 Image** Early Access는 향후 몇 주 안에 시작할 계획임

### 행동 예측과 로봇 학습
- 현실 이해를 **행동 예측**으로 확장하기 위해 두 가지 경로를 사용함
  - Self-Flow의 초기 작업을 확장해 FLUX 3 자체에 네이티브 행동 예측을 통합함
  - 사전 학습된 비디오 백본을 역학을 이해하는 기반으로 삼고, 제한된 작업별 데이터로 전문 행동 모델을 미세조정함
- 초기 접근 파트너인 mimic robotics와 함께 **FLUX-mimic**을 개발함
  - FLUX 3 백본에 mimic의 정교한 로봇 조작 학습 및 프로덕션 배포 전문성을 결합한 비디오-행동 모델임
  - [Audi의 실제 프로덕션 작업에서 물리 AI와 콘텐츠 제작의 공통 기반을 시험하는 내용](https://bfl.ai/blog/flux-3-mimic)도 별도로 공개됨

### 기능별 순차 출시
- 각 기능은 원활한 출시와 피드백 수집, 엄격한 **안전성 테스트**를 위한 Early Access를 거쳐 향후 몇 주에서 몇 달에 걸쳐 제공됨
- 모두 같은 멀티모달 Flow Matching 기반 모델에서 파생됨
  - **FLUX 3 Video**: API와 비공개 가중치 접근을 통한 비디오·오디오 생성 및 편집
  - **FLUX-mimic·FLUX 3 Action**: mimic robotics를 시작으로 선정된 연구·상업 파트너에게 행동 예측 제공
  - **FLUX 3 Image**: API와 비공개 가중치 접근을 통한 이미지 합성 및 편집
  - **FLUX 3 Dev**: 비디오·오디오·이미지 콘텐츠 생성과 행동 예측을 위한 멀티모달 백본의 오픈 가중치 제공
- 기반 접근법의 추가 기술 세부 정보도 공개할 예정이며, [Early Access를 신청](https://tally.so/r/44d9NX)할 수 있음

### 지각·행동·언어의 통합
- 향후 적용 대상으로 대화형 이미지·비디오 편집, 시뮬레이션, 컴퓨터 사용, **물리 AI**를 내세움
- 현재 기능을 점진적으로 출시하는 동시에 차세대 모델 개발도 진행 중임
- 최종 목표는 **지각·행동·언어 예측**을 하나의 통합 모델에 결합하는 것임

## Comments



### Comment 62361

- Author: neo
- Created: 2026-07-25T08:16:42+09:00
- Points: 1

###### [Hacker News 의견들](https://news.ycombinator.com/item?id=49031796) 
- 공개 가중치 버전이 **최고 성능(SOTA)** 이길 기대함  
  향후 몇 주에서 몇 달 사이 콘텐츠 제작과 행동 예측을 위한 멀티모달 기반 모델 **FLUX 3 Dev**를 공개 가중치로 제공하고, 기반 접근법의 기술적 세부 사항도 공개할 예정이라고 함
  - 공개 가중치 약속은 반갑지만, 과거에도 비슷한 약속이 실현되지 않았다는 얘기가 있었음  
    기반 모델이 Dev 버전으로 나온다면 무엇이 빠지는지도 게시물만으로는 파악하기 어려움

- 사람을 보여주는 예시는 거의 없고, **세계 모델**이라는 용어를 가볍게 사용했으며, 20초짜리 영상을 주장하면서 실제로는 점프컷만 보여줌  
  결국 핵심은 모두 “곧 공개”인 셈임
  - /r/stablediffusion에는 영상 예시가 많이 올라와 있음
  - 모델 기반 강화학습에서 쓰이던 **세계 모델**이라는 말이 이제는 선형 회귀처럼 단순한 것까지 가리킬 수 있게 된 듯함  
    강화학습 분야도 행동과학에서 이 말을 빌려왔을 가능성이 있으니 그냥 받아들이는 편이 나을지도 모름. 철학자와 시각 예술가들이 **객체 지향**을 제각각 오용한 것과 비슷함
  - 공개 방식이 무척 이상해서 영상을 어디서 봐야 하는지 의아했음

- 여기 반응은 놀랄 만큼 부정적이고 냉소적이지만, 내 눈에는 이 모델의 **성능이 상당히 인상적**으로 보임  
  부정적인 사람들이 늘 가장 먼저 악담을 남긴다는 얘기도 있으니 더 지켜볼 생각임
  - HN의 감성을 **시계열로 분석**해 보면 흥미로울 듯함  
    요즘 HN에 부정적인 분위기가 많아졌다고 느끼는데, 내 착각이길 바람
  - 실제로 좋은 모델일 가능성은 크지만, **Qwen-Image-3**가 LaTeX로 렌더링한 듯한 이미지나 여러 요소를 나란히 또는 깊이감 있게 구성하는 능력을 보여준 뒤라 시각적 품질에만 집중하는 방향이 완전히 옳은지는 의문임
  - 최신 **고성능 LLM**을 코딩과 자동화 도구 제작에 적극 활용하며, 서로 다른 오픈소스를 연결해 새 프로젝트를 만드는 고된 작업을 맡기고 있음  
    적절한 실행 환경을 갖추고 모델이 잘못된 추론에 빠지거나 미묘하게 틀린 결과를 냈는지 판별할 만큼 분야를 이해한다면 꽤 낙관적임. 반면 소셜 미디어가 끔찍한 AI 생성 이미지와 영상으로 넘쳐나는 모습을 보면, 완전 합성 이미지·영상 생성기가 현실에서 유익하게 쓰일 가능성에는 훨씬 비관적임. 수백만 명의 손에 들어갔을 때 사회에 이롭기보다 해롭게 쓰이는 듯함
  - Star Trek의 **홀로덱**과 비교하면 이 정도로는 흥미롭지 않음
  - Martin Scorsese가 이제 고문으로 참여하므로 BFL은 계속 자신을 **영화 제작자를 위한 연구소**로 자리매김할 듯함  
    이 영상 모델이 Seedance 2.0과 비슷한 수준이라면 비용이 너무 높아 저품질 콘텐츠 생성용으로는 맞지 않고, 프로젝트의 VFX 파이프라인에 들어갈 가능성이 큼

- 모델에 **촉각 데이터**를 학습시키는 곳이 있는지 궁금함  
  로봇에게 가장 원하는 일은 물체를 만지는 것인데 오디오·영상·이미지만 제공하고 있어, 한 번도 만져본 적 없는 모델이 접촉 방법을 배워야 함. 로봇들이 물체를 만질 때 주저하는 듯 보이는 이유도 이것일 수 있음
  - 실제 촉각 데이터를 주는 것보다 **접촉을 시뮬레이션**하는 편이 빠르며, 그렇게 하면 훨씬 빨리 학습함

- **Flux 2 Dev Klein**은 일반적인 상용 하드웨어에서 사용할 수 있는 모델 중 사실상 최고였음  
  Flux 3에도 이에 상응하는 최신 공개 가중치 모델이 포함되길 바라며, 그렇지 않다면 많은 취미 사용자에게 큰 손실이 될 것임

- 유럽에서 나온 AI 프로젝트 중 처음으로 **큰 기대**를 품게 함

- Freiburg im Breisgau에서 채용한다는데, 현지에서 인재 확보가 잘되는지 궁금함
  - Freiburg는 매우 아름다운 곳임  
    그곳에 사는 친구 한 명은 주변 산에서 로드 자전거를 즐기고, 다른 친구는 겨울이면 점심시간에 크로스컨트리 스키를 탐
  - 근처에 사는데 독일에서 손꼽히게 햇볕이 많고 풍경도 훌륭한 지역임  
    **인재 풀**은 잘 모르겠지만 대학이 있음
  - **University of Freiburg**는 꽤 유명함  
    SF 밖의 스타트업이 대학 도시에서 채용하는 것은 흔한 방식임
  - 사람들이 그곳을 **Flyburg im Nicegau**라고 부르는 데는 이유가 있음
  - 요즘은 미국에 있지 않다는 점이 많은 잠재적 지원자에게 오히려 **장점**일 수 있음

- 침수된 방에서 춤추기 전까지는 **실사 영상**인 줄 알았음

- **2.3 버전**이 훌륭했고, 사전 접근 권한을 받은 사람들이 공개한 영상과 평가를 보면 이번 모델이 가정용으로는 새로운 최고 성능이 될 듯해 매우 기대됨

- 모델이 세계와 사건의 소리를 표현하는 법을 배워야 한다면, 재미 삼아 학습 과정에 비현실적으로 많은 **Wilhelm scream**을 넣어주길 바람
  - 고무 밀봉재를 너무 거칠게 끼우면 비명을 지를 수 있으니 조심해서 다뤄야겠음
