1P by GN⁺ | ★ favorite | 댓글 1개
  • 이미지·비디오·오디오를 하나의 아키텍처에서 함께 학습해 생성·이해·행동 예측을 통합하려는 멀티모달 기반 모델이며, FLUX 3 Video부터 Early Access로 제공됨
  • 이미지의 공간 구조, 비디오의 시간·물리 역학, 오디오의 사건·소리 관계를 상호 제약으로 학습하며, Self-Flow를 기반으로 데이터와 연산 자원을 확장함
  • 네이티브 오디오가 포함된 비디오를 한 번에 최대 20초까지 생성하며, 초기 평가에서 Grok Imagine Video보다 최대 69%, Runway Gen-4.5보다 77%, Luma Ray 3.2보다 93%의 비교에서 선호됨
  • 이미지 합성·편집과 다국어 텍스트 렌더링을 지원하고, 사전 학습된 비디오 백본을 제한된 작업별 데이터로 미세조정해 로봇 행동 모델로 활용할 수 있음
  • Video·Image·Action과 오픈 가중치 기반 FLUX 3 Dev를 순차 출시하며, 장기적으로 지각·행동·언어 예측을 하나의 모델로 통합하는 것이 목표임

현실을 함께 학습하는 멀티모달 모델

  • FLUX 3는 이미지·비디오·오디오를 분리된 요소가 아니라, 동일한 현실을 서로 다른 센서로 관측한 결과로 취급함
    • 이미지는 특정 시점의 공간 구조와 관계를 포착함
    • 비디오는 시간 차원을 복원해 움직임, 시간적 역학, 물리 법칙을 드러냄
    • 오디오는 시각만으로 감지하기 어려운 기계적 현상과 음향의 인과관계를 보여줌
    • 언어는 이러한 지각을 목표·추상화·지시와 연결함
  • 여러 양식을 함께 학습하면 소리는 충돌과 일치하고, 움직임은 질량을 따르며, 미래는 과거에서 이어져야 한다는 상호 제약을 활용할 수 있음
  • FLUX 3는 이러한 원칙만으로 구축한 첫 모델로, 물리·디지털 환경에서 지각하고 예측하며 행동하는 현실 세계의 시각 지능을 지향함
  • 콘텐츠 제작과 물리 AI에서 얻은 초기 결과는 이 접근법의 가능성을 보여줌

Self-Flow 기반 통합 아키텍처

  • Self-Flow는 하나의 기반 아키텍처에서 멀티모달 생성과 이해를 효율적으로 정렬하는 접근법임
  • FLUX 3는 Self-Flow를 바탕으로 연산량과 데이터 자원을 크게 확장해 비디오·이미지·오디오를 동시에 학습
  • 공개 비교에는 양식별 생성 오류를 Flow Matching 기준 100으로 정규화한 Fréchet distance와, 미세조정 후 4개 작업군의 조작 성공률이 사용됨

비디오와 네이티브 오디오 생성

  • FLUX 3는 한 번의 생성으로 최대 20초 길이의 다양한 비디오와 오디오를 만들 수 있음
  • 지원 범위는 다음과 같음
    • 텍스트-비디오 생성
    • 시작 프레임을 이어가거나 이미지를 시각 참조로 사용하는 이미지-비디오 생성
    • 원본 캐릭터 같은 핵심 요소를 새로운 장면이나 맥락으로 옮기는 비디오-비디오 생성
    • 입력 비디오와 오디오를 이어 만드는 생성형 비디오·오디오 연속 생성
    • 지정한 장면 사이의 전환을 제어하는 키프레임-비디오 생성
    • 다국어 대화
    • 전통적인 영화 형식을 넘어서는 다양한 시각 스타일과 화면비
    • 개별 클립을 더 긴 멀티숏 시퀀스로 연결하는 에이전트형 체이닝
    • 캠코더 영상부터 애니메이션·영화 영상까지 아우르는 폭넓은 스타일
    • 타이포그래피 생성과 애니메이션 디자인
  • 모든 비디오 출력에는 네이티브 오디오 생성이 포함됨

초기 비디오 평가

  • 예비 평가는 오디오가 포함된 720p 10초 텍스트-비디오 클립으로 진행함
  • 비교 평가에서 FLUX 3가 선호된 비율은 다음과 같음
    • Grok Imagine Video 대비 최대 69%
    • Kling v3 Pro 대비 60%
    • Happy Horse v1 대비 59%, Happy Horse 1.1 대비 57%
    • Seedance 2.0 및 Gemini Omni Flash 대비 각각 52%
    • Runway Gen-4.5 대비 77%
    • Luma Ray 3.2 대비 93%
  • 모델과 주변 하네스가 아직 개발 중이어서 결과는 예비 단계이며, Early Access 기간에 더 개선될 예정임
  • 현재 특히 강한 영역은 사람의 표정 포착, 물리적 사건과 소리의 연결, 다국어 처리임
  • 시각 참조로 장면 전반의 캐릭터 일관성을 유지하면서 여러 클립을 결합해 수분 길이 시퀀스를 만들 수 있음
  • FLUX 3 Video는 Early Access로 제공됨

이미지 합성과 편집

  • FLUX 3는 다양한 스타일·화면비·해상도로 이미지를 합성하고 편집할 수 있음
  • 중간 학습 단계의 예비 평가에서는 이전 FLUX 버전보다 복잡한 프롬프트 처리와 텍스트 생성 능력이 크게 향상됨
  • 다양한 출력 스타일을 생성하고 여러 언어의 텍스트를 높은 정확도로 렌더링할 수 있음
  • 평가 결과는 아직 예비 단계이며, 정식 출시 전까지 추가 개선할 예정임
  • FLUX 3 Image Early Access는 향후 몇 주 안에 시작할 계획임

행동 예측과 로봇 학습

  • 현실 이해를 행동 예측으로 확장하기 위해 두 가지 경로를 사용함
    • Self-Flow의 초기 작업을 확장해 FLUX 3 자체에 네이티브 행동 예측을 통합함
    • 사전 학습된 비디오 백본을 역학을 이해하는 기반으로 삼고, 제한된 작업별 데이터로 전문 행동 모델을 미세조정함
  • 초기 접근 파트너인 mimic robotics와 함께 FLUX-mimic을 개발함

기능별 순차 출시

  • 각 기능은 원활한 출시와 피드백 수집, 엄격한 안전성 테스트를 위한 Early Access를 거쳐 향후 몇 주에서 몇 달에 걸쳐 제공됨
  • 모두 같은 멀티모달 Flow Matching 기반 모델에서 파생됨
    • FLUX 3 Video: API와 비공개 가중치 접근을 통한 비디오·오디오 생성 및 편집
    • FLUX-mimic·FLUX 3 Action: mimic robotics를 시작으로 선정된 연구·상업 파트너에게 행동 예측 제공
    • FLUX 3 Image: API와 비공개 가중치 접근을 통한 이미지 합성 및 편집
    • FLUX 3 Dev: 비디오·오디오·이미지 콘텐츠 생성과 행동 예측을 위한 멀티모달 백본의 오픈 가중치 제공
  • 기반 접근법의 추가 기술 세부 정보도 공개할 예정이며, Early Access를 신청할 수 있음

지각·행동·언어의 통합

  • 향후 적용 대상으로 대화형 이미지·비디오 편집, 시뮬레이션, 컴퓨터 사용, 물리 AI를 내세움
  • 현재 기능을 점진적으로 출시하는 동시에 차세대 모델 개발도 진행 중임
  • 최종 목표는 지각·행동·언어 예측을 하나의 통합 모델에 결합하는 것임

댓글과 토론

Hacker News 의견들
  • 공개 가중치 버전이 최고 성능(SOTA) 이길 기대함
    향후 몇 주에서 몇 달 사이 콘텐츠 제작과 행동 예측을 위한 멀티모달 기반 모델 FLUX 3 Dev를 공개 가중치로 제공하고, 기반 접근법의 기술적 세부 사항도 공개할 예정이라고 함

    • 공개 가중치 약속은 반갑지만, 과거에도 비슷한 약속이 실현되지 않았다는 얘기가 있었음
      기반 모델이 Dev 버전으로 나온다면 무엇이 빠지는지도 게시물만으로는 파악하기 어려움
  • 사람을 보여주는 예시는 거의 없고, 세계 모델이라는 용어를 가볍게 사용했으며, 20초짜리 영상을 주장하면서 실제로는 점프컷만 보여줌
    결국 핵심은 모두 “곧 공개”인 셈임

    • /r/stablediffusion에는 영상 예시가 많이 올라와 있음
    • 모델 기반 강화학습에서 쓰이던 세계 모델이라는 말이 이제는 선형 회귀처럼 단순한 것까지 가리킬 수 있게 된 듯함
      강화학습 분야도 행동과학에서 이 말을 빌려왔을 가능성이 있으니 그냥 받아들이는 편이 나을지도 모름. 철학자와 시각 예술가들이 객체 지향을 제각각 오용한 것과 비슷함
    • 공개 방식이 무척 이상해서 영상을 어디서 봐야 하는지 의아했음
  • 여기 반응은 놀랄 만큼 부정적이고 냉소적이지만, 내 눈에는 이 모델의 성능이 상당히 인상적으로 보임
    부정적인 사람들이 늘 가장 먼저 악담을 남긴다는 얘기도 있으니 더 지켜볼 생각임

    • HN의 감성을 시계열로 분석해 보면 흥미로울 듯함
      요즘 HN에 부정적인 분위기가 많아졌다고 느끼는데, 내 착각이길 바람
    • 실제로 좋은 모델일 가능성은 크지만, Qwen-Image-3가 LaTeX로 렌더링한 듯한 이미지나 여러 요소를 나란히 또는 깊이감 있게 구성하는 능력을 보여준 뒤라 시각적 품질에만 집중하는 방향이 완전히 옳은지는 의문임
    • 최신 고성능 LLM을 코딩과 자동화 도구 제작에 적극 활용하며, 서로 다른 오픈소스를 연결해 새 프로젝트를 만드는 고된 작업을 맡기고 있음
      적절한 실행 환경을 갖추고 모델이 잘못된 추론에 빠지거나 미묘하게 틀린 결과를 냈는지 판별할 만큼 분야를 이해한다면 꽤 낙관적임. 반면 소셜 미디어가 끔찍한 AI 생성 이미지와 영상으로 넘쳐나는 모습을 보면, 완전 합성 이미지·영상 생성기가 현실에서 유익하게 쓰일 가능성에는 훨씬 비관적임. 수백만 명의 손에 들어갔을 때 사회에 이롭기보다 해롭게 쓰이는 듯함
    • Star Trek의 홀로덱과 비교하면 이 정도로는 흥미롭지 않음
    • Martin Scorsese가 이제 고문으로 참여하므로 BFL은 계속 자신을 영화 제작자를 위한 연구소로 자리매김할 듯함
      이 영상 모델이 Seedance 2.0과 비슷한 수준이라면 비용이 너무 높아 저품질 콘텐츠 생성용으로는 맞지 않고, 프로젝트의 VFX 파이프라인에 들어갈 가능성이 큼
  • 모델에 촉각 데이터를 학습시키는 곳이 있는지 궁금함
    로봇에게 가장 원하는 일은 물체를 만지는 것인데 오디오·영상·이미지만 제공하고 있어, 한 번도 만져본 적 없는 모델이 접촉 방법을 배워야 함. 로봇들이 물체를 만질 때 주저하는 듯 보이는 이유도 이것일 수 있음

    • 실제 촉각 데이터를 주는 것보다 접촉을 시뮬레이션하는 편이 빠르며, 그렇게 하면 훨씬 빨리 학습함
  • Flux 2 Dev Klein은 일반적인 상용 하드웨어에서 사용할 수 있는 모델 중 사실상 최고였음
    Flux 3에도 이에 상응하는 최신 공개 가중치 모델이 포함되길 바라며, 그렇지 않다면 많은 취미 사용자에게 큰 손실이 될 것임

  • 유럽에서 나온 AI 프로젝트 중 처음으로 큰 기대를 품게 함

  • Freiburg im Breisgau에서 채용한다는데, 현지에서 인재 확보가 잘되는지 궁금함

    • Freiburg는 매우 아름다운 곳임
      그곳에 사는 친구 한 명은 주변 산에서 로드 자전거를 즐기고, 다른 친구는 겨울이면 점심시간에 크로스컨트리 스키를 탐
    • 근처에 사는데 독일에서 손꼽히게 햇볕이 많고 풍경도 훌륭한 지역임
      인재 풀은 잘 모르겠지만 대학이 있음
    • University of Freiburg는 꽤 유명함
      SF 밖의 스타트업이 대학 도시에서 채용하는 것은 흔한 방식임
    • 사람들이 그곳을 Flyburg im Nicegau라고 부르는 데는 이유가 있음
    • 요즘은 미국에 있지 않다는 점이 많은 잠재적 지원자에게 오히려 장점일 수 있음
  • 침수된 방에서 춤추기 전까지는 실사 영상인 줄 알았음

  • 2.3 버전이 훌륭했고, 사전 접근 권한을 받은 사람들이 공개한 영상과 평가를 보면 이번 모델이 가정용으로는 새로운 최고 성능이 될 듯해 매우 기대됨

  • 모델이 세계와 사건의 소리를 표현하는 법을 배워야 한다면, 재미 삼아 학습 과정에 비현실적으로 많은 Wilhelm scream을 넣어주길 바람

    • 고무 밀봉재를 너무 거칠게 끼우면 비명을 지를 수 있으니 조심해서 다뤄야겠음