1P by GN⁺ | ★ favorite | 댓글 1개
  • Black Forest Labs와 mimic robotics는 이미지·비디오·오디오를 공동 학습한 FLUX 3 백본에 로봇 행동 예측을 결합해, Audi 생산 현장에서 시험·배포한 FLUX-mimic을 개발함
  • 전체 학습 연산의 95% 이상을 차지하는 비디오 예측으로 접촉·운동·무게·인과관계를 익히고, 저차원 로봇 행동도 같은 물리 현실을 나타내는 추가 양식으로 처리함
  • 행동 예측을 추가한 직후 비디오 생성 품질이 최대 10% 하락했지만 3,500스텝 뒤 기존 수준을 회복해, 하나의 백본으로 생성과 행동 예측을 함께 수행할 수 있음을 확인함
  • Self-Flow로 생성·표현 학습을 통합하고 경량 행동 디코더를 연결해, 단일 NVIDIA RTX 5090에서 백본 처리 80ms 미만, 전체 로봇 반응 시간 101ms를 달성함
  • 범용 비디오와 조작 작업을 대규모로 학습한 세계 모델은 적은 시연만으로 새 작업에 적응하고 실패 후 재시도해, 유연한 부품과 정밀 조작처럼 기존 자동화의 비용이 높았던 생산 작업에 활용됨

하나의 백본으로 콘텐츠 생성과 로봇 제어

  • FLUX 1·FLUX 2가 이미지 생성에 집중한 데 이어, FLUX 3는 이미지·비디오·오디오를 처음부터 함께 학습해 시청각 콘텐츠를 공동 생성함
  • Black Forest Labs는 mimic robotics에 FLUX 3 초기 버전을 제공하고, 양사의 로봇 학습·배포 및 기반 모델 전문성을 결합해 FLUX-mimic을 개발함
    • mimic은 자체 로봇과 로봇 학습, 정교한 조작, 생산 환경 배포를 담당함
    • Black Forest Labs는 시각 기반 모델과 다중양식 학습·모델링 역량을 제공함
  • FLUX-mimic은 FLUX 3 백본에 기반한 범용 조작용 비디오-액션 모델이며, mimic의 풀스택 배포 시스템에 통합됨
  • 같은 백본이 이미지·비디오·오디오 콘텐츠를 생성하는 동시에, Physical AI에서는 행동을 수행함

비디오 예측으로 학습하는 물리 세계

  • FLUX 3 학습 연산의 95% 이상이 비디오 예측에 사용됨
    • 사실적인 비디오를 만들려면 접촉, 운동, 무게, 원인과 결과를 학습해야 하며, 이를 잘못 처리하면 결과 영상도 부자연스러워짐
    • 세계를 정확히 렌더링하는 과정은 세계가 작동하는 방식을 학습하는 과정과 연결됨
  • 오디오는 720p 음향 포함 비디오에서 토큰의 0.5% 미만을 차지하는 저차원 양식임
    • 비디오를 이해한 모델은 입술 움직임과 동기화된 음성, 물리적 사건에 맞물린 효과음의 인과관계를 학습할 수 있음
  • 로봇 행동 역시 시각 관측과 밀접하게 결합된 저차원 상태 표현임
    • 행동·오디오·비디오 프레임은 하나의 물리적 현실을 부분적으로 나타냄
    • 행동 예측은 별도의 기반 모델을 만드는 대신, 기존 세계 모델에 또 하나의 관측 방식을 연결함

행동 학습 뒤 회복한 생성 품질

  • 대규모 학습에 행동 예측을 추가하자 텍스트-비디오와 이미지-비디오 생성의 인간 평가 점수가 처음에는 최대 10% 하락
  • 모델이 행동 공간의 구조를 익히고 내부 세계 표현을 정렬하면서 품질이 회복됐으며, 3,500스텝 뒤 기존 비디오 생성 수준에 도달하면서 행동도 예측하게 됨
  • 행동을 입출력에 통합하는 동안 일시적인 혼란은 있었지만, 기존 능력의 용량을 영구적으로 희생하지는 않았음
  • 비디오 생성과 행동 예측에 별도의 기반 모델이 필요하지 않으며, 동일한 단일 백본이 두 작업을 수행함

세계 표현에서 행동을 해독하는 구조

  • FLUX-mimic은 FLUX 3가 비디오 생성을 위해 학습한 내부 세계 표현에서 로봇 행동을 해독함
  • mimic-video에서 먼저 사용한 방식에 따라 FLUX의 비디오 예측 경로에서 중간 특징을 추출하고, 그 위에 경량 행동 디코더를 학습함
  • 성능은 서로 연결된 두 요소에 좌우됨
    • 세계 모델 품질: 세계가 어떻게 움직이는지 이해하지 못하면 정확한 시뮬레이션도 어려우며, 생성 품질과 직접 연결됨
    • 표현 품질: 양식 사이의 인과관계가 특징 공간에서 비선형적으로 얽히면 행동 디코더가 이를 원시 입력만큼 어렵게 해석해야 함
  • 생성 모델은 고품질 시뮬레이션과 연산량 증가에 따른 예측 가능한 확장 법칙을 제공하지만, 전문 표현 학습 방식보다 덜 분리된 표현을 만들어 세계 이해가 필요한 후속 작업의 활용도를 제한할 수 있음

Self-Flow로 통합한 생성·표현 학습

  • Self-Flow는 생성 학습과 표현 학습을 하나의 프레임워크로 통합함
  • 적용 후 세계 모델과 표현의 품질이 함께 향상됨
    • 비디오·이미지·오디오 생성 품질로 측정한 세계 모델 성능이 높아짐
    • 시뮬레이션 로봇 제어 작업의 성공률로 측정한 표현 품질도 개선됨
  • FLUX 3는 Self-Flow를 확장해 처음부터 폭넓은 세계 동역학과 조작 능력을 학습함
    • 일반 비디오 콘텐츠 수천만 시간
    • 인간 및 로봇 조작에 초점을 둔 비디오 콘텐츠 수십만 시간
  • 이 대규모 학습을 통해 실험실의 Self-Flow 결과를 실제 생산·물류 환경으로 확장함

공장 작업과 벤치마크 성능

  • mimic은 FLUX-mimic을 실제 공장 업무에 배포함
    • 부품을 구조화된 트레이에 담는 키팅
    • 전자 제어 장치를 여유가 적은 고정구에 삽입하는 작업
    • 부품 조립
    • 실·케이블처럼 부드럽고 유연한 재료 취급
  • FLUX 백본을 완전히 고정해도 행동 디코더가 이전 시각-언어-행동 모델보다 높은 성능을 냈으며, 이전 모델들은 이 설정에서 작업에 성공하지 못함
  • 백본과 행동 디코더를 함께 미세조정하면 FLUX-mimic이 최고 수준의 작업 성공률을 기록함
  • 대규모 학습은 백본에 세계와 행동에 관한 지식을 제공하고, Self-Flow는 그 지식을 특징 표현에서 쉽게 해독할 수 있게 함

적은 시연으로 배우고 실패에서 복구

  • 물리 법칙이 이미 접근 가능한 표현에 담겨 있으면, 새 작업 적응은 세계의 작동 방식을 다시 배우는 대신 특정 작업을 기존 지식에 연결하는 과정이 됨
  • Self-Flow 실험에서는 같은 성공률에 도달하는 데 필요한 행동 예측 학습 스텝이 Self-Flow를 사용하지 않은 비디오 모델의 절반으로 줄어듦
  • mimic-video 논문에서 비디오-액션 모델은 시각-언어-행동 모델보다 최대 10배 높은 표본 효율성을 보였으며, FLUX-mimic은 두 효과를 결합함
  • 로봇이 물체 잡기에 실패하면 자세를 수정해 다시 잡고 작업을 마치는 자연스러운 실패 복구가 가능함
    • 모든 실패 유형을 시연 데이터에 담을 수 없으므로, 시연되지 않은 복구 행동은 세계의 작동 방식을 이미 학습한 모델에서 나옴

101ms로 반응하는 로봇 시스템

  • 실제 환경에서는 모델이 환경 변화 속도에 맞춰 행동해야 하며, FLUX-mimic의 연산 비용 대부분은 가장 큰 구성 요소인 백본에서 발생함
  • 잘 구조화된 세계 표현은 같은 성능을 더 적은 매개변수로 달성하게 해, 더 작고 빠른 백본을 사용할 수 있게 함
  • 최적화된 백본은 단일 NVIDIA RTX 5090에서 입력부터 세계 표현 생성까지 80ms 미만으로 실행되며, 인간의 시각 반응 시간과 같은 규모임
  • mimic은 전체 배포 스택에서 추가 지연을 줄이기 위해 다음 요소를 최적화함
    • 행동 디코더
    • 센서·모델·액추에이터 사이의 프로세스 간 지연
    • 예측과 실행을 겹쳐 로봇의 끊김을 방지하는 실시간 청킹
  • 모든 최적화를 적용한 독립형 로봇 시스템의 최종 반응 시간은 101ms

Audi 생산 현장 적용

  • Audi는 높은 자동화 수준에도 유연한 부품과 정밀 조작 작업을 계속 수작업으로 처리해 왔음
  • 프리미엄 제품 생산은 변형 종류가 많아, 기존 방식으로 프로그래밍한 로봇 셀을 사례마다 다시 설계하는 비용이 높음
    • 학습 기반 시스템은 이러한 비용 구조를 바꿈
  • Audi Production Lab은 mimic과 협력해 FLUX-mimic을 시험·배포
    • 기존 로봇으로는 불가능했던 복잡한 연성 물체 조작을 수행함
    • 직원 지원, 효율 개선, 생산·물류의 유연한 자동화 확대에 활용할 수 있음
  • FLUX-mimic의 표본 효율성과 견고성은 작업별 엔지니어링이 아니라 FLUX 3 백본과 해독 가능한 표현에서 나오며, 작업·산업·하드웨어 사이의 이전을 지원함
  • 하나의 시각 지능 기반 모델이 이미지·비디오·오디오를 생성하는 동시에 생산 라인의 로봇을 구동함

댓글과 토론

Hacker News 의견들
  • 잘 훈련된 멀티모달 동영상 생성 모델 내부에는 세계 표상 모델이 형성되며, 이를 추출해 로봇에 적용해도 잘 작동하는 것으로 보임
    동영상 모델이 물질과 빛, 세계를 이해한다는 발상은 새롭지 않지만, 동영상 연구소가 로봇 연구소로 전환한 경우는 드물었음. 동영상 생성으로 규모를 키운 뒤 그 역량으로 로봇을 훈련하는 사업 경로가 될 수 있음
    장갑 안에 여러 장치를 숨긴 듯한 BFL의 손도 흥미로움. Xiami의 Robotics-1은 일반적인 그리퍼와 그리퍼형 장갑으로 훈련 영상을 만들지만, BFL 모델은 그런 장비가 필요 없어 보임. 하드웨어가 어려운 분야인 만큼 앞으로의 접근이 궁금함

  • 3분 30초쯤 로봇 팔이 세 번 시도한 끝에 창문 몰딩을 다시 끼우는 장면이 상당히 놀라웠음. 이런 실패 후 문제 해결은 처음 보는데 새로운 기술인지 궁금함

  • “세계 이해가 필요한 작업에는 덜 분리된 표상이 덜 유용하다”는 설명에서, ‘더 얽힌’이라는 개념을 굳이 덜 분리된 표상으로 표현한 문장이 우스움. 현실 세계를 설명하면서 개념 자체도 더 얽히게 만드는 건 LLM다운 표현처럼 보임

    • 이제는 근거 없이 문장마다 LLM의 흔적을 찾는 수준임. 모든 글이 어느 정도 LLM의 도움을 받았다고 가정하고 결과물의 품질만 평가할 때가 됐음
    • 사람도 어색한 문장을 자주 씀. 오히려 그런 표현은 훈련 데이터에 드물어서 LLM이 만들 가능성이 사람보다 낮을 수도 있음
    • 농담이었음
    • 원문의 대시도 분명 LLM이 이 댓글을 썼다는 증거임 /s
  • 기술은 이토록 발전했는데 영화는 어느 때보다 나빠진 듯해 슬픔. 괜찮은 작품을 찾으려고 수십 년 전 영화를 보곤 하는데, 우스꽝스러운 인형을 쓰고도 이야기 구성은 1,000배 뛰어났음

    • 아무도 기억하지 않는 형편없는 옛 영화는 보지 않기 때문에 생기는 생존자 편향일 수 있음
    • Robin Rombach가 영화 제작을 모른다는 이유로 BFL 투자를 거절할 것인가? Sora는 끝났으며, Bill Peebles가 영화 제작을 모른다고 공개적으로 말할 용기 있는 사람을 찾기도 어려움
      이는 벤처캐피털만의 문제가 아니며 이른바 Hollywood No와 연결됨. 반대로 Hollywood No 자체가 문제일 수도 있고, 게임 업계에서는 이를 독성 긍정주의라고 불러왔음
  • 유럽 스타트업 간 협력을 보니 반가움

    • Flux는 Meta에 인수되지 않았나?
  • 이것은 미래이면서 이미 현재임. 소프트웨어 개발·엔지니어링 바깥에 있는 지인에게도 이 내용을 공유해 주길 바람

  • 생산수단을 소유하지 않은 인간의 가치가 더욱 낮아지는 위기를 향해 정면으로 달려가고 있음. 암울한 시기가 다가올 것으로 보임