- 10만 시간 규모의 로봇 비종속 UMI 궤적으로 사전 학습한 뒤 실제 로봇 데이터로 후속 학습해, 로봇 정책 모델의 데이터 부족을 완화하는 기반 모델
- 1,700개 이상의 시나리오를 자동 주석 처리해 일반적인 행동 생성 능력을 익히고, 후속 학습에서 로봇 형태와 자연어 명령에 얼라인함
- 사전 학습 데이터와 모델이 커질수록 검증 행동 오차가 감소했으며, 후속 학습 뒤 미지의 환경과 객체에서 측정한 실제 로봇 성공률도 꾸준히 상승해 포화 징후가 없었음
- 작업별 평균 10시간 미만의 시연으로 전화기 포장·프린터 보충·세탁물 투입·상자 포장에서 종합 성공률 75% 를 기록했고, 평균 40시간 미만에서는 85%에 도달함
- RoboCasa·RoboCasa365·VLABench·RoboDojo에서 모두 최고 성능을 기록해, 대규모 UMI 사전 학습의 일반화 효과가 실제 로봇 적응과 표준 평가로 이어짐
로봇 데이터 장벽을 넘는 2단계 학습
- 언어·비전 기반 모델은 데이터, 매개변수, 연산량이 늘어날수록 성능이 향상됐지만, 로봇 정책 모델은 대규모 고품질 데이터 부족으로 확장이 제한돼 왔음
- Xiaomi-Robotics-1은 대규모 로봇 비종속 UMI 데이터로 사전 학습하고, 비교적 적은 실제 로봇 데이터로 후속 학습하는 2단계 학습 방식을 사용함
- 이를 통해 로봇 정책 모델의 확장 양상과 사전 학습의 개선이 실제 로봇 성능으로 이전되는지를 평가함
사전·후속 학습 데이터 구성
- 사전 학습 데이터는 10만 시간의 UMI 궤적으로 구성됨
- 가정, 상업 시설, 산업 현장, 야외 공간을 포함한 1,700개 이상의 시나리오와 다양한 작업을 포괄함
- 궤적을 고정 길이 구간으로 나눈 뒤 각 구간의 장면 상태 변화를 언어로 기록하는 자동 주석 파이프라인을 개발함
- 후속 학습에는 여러 로봇 형태를 아우르는 데이터셋을 사용함
- 자체 수집한 실제 로봇 데이터
- 필터링한 오픈소스 로봇 데이터
- 엄선한 고품질 UMI 데이터
- 자체 데이터에는 실제 가정에서 수집한 7,200시간 이상의 실제 로봇 작업이 포함됨
- 소파 정리, 신발장 분류, 주방용품 수납 등의 작업을 다룸
- 후속 학습용 UMI 데이터는 시간 구간과 명령 프롬프트를 사람이 직접 주석 처리함
- 사전 학습 데이터에 사용한 자동 생성 상태 전환 설명과 구별되는 방식임
UMI 사전 학습과 자동 주석
- 사전 학습은 다양한 실제 환경과 작업을 접하게 해 일반적인 행동 생성 표현을 익히는 단계임
- 데이터 규모상 수동 주석이 어려워 강력한 비전-언어 모델(VLM)을 이용한 자동화 파이프라인을 구축함
- 긴 영상을 고정 길이 클립으로 분할함
- 각 클립에서 그리퍼와 상호작용 객체의 상태 변화를 VLM이 기술함
- 실제 조작 궤적과 정밀한 언어 설명을 결합한 대규모 말뭉치를 생성함
- 모델은 언어로 기술된 상태 전환에 맞춰 장면을 변화시키는 행동을 생성하도록 학습함
- 데이터와 모델 크기가 증가할수록 검증 행동 오차가 지속해서 감소하는 뚜렷한 확장 양상을 보임
실제 로봇과 자연어 명령 정렬
- 후속 학습은 사전 학습에서 얻은 행동 생성 능력을 두 축으로 정렬함
- 로봇 형태 정렬: 고품질 다중 형태 실제 로봇 데이터로 일반 행동 생성 능력을 물리적 로봇에 매핑함
- 명령 정렬: 장면 상태 전환 설명을 입력받던 모델을 자연어 명령을 이해하고 직접 수행하도록 전환함
- 후속 학습을 마친 모델은 별도 조정 없이 다양한 실제 이동·조작 작업에 사용할 수 있음
- 사전 학습의 확장 효과가 이전되는지 확인하기 위해 보지 못한 환경과 객체 인스턴스에서 실제 로봇 성능을 평가함
- 사전 학습 데이터와 모델 크기가 커질수록 실제 로봇 성공률도 꾸준하고 예측 가능하게 상승함
- 더 강한 사전 학습 모델은 후속 학습 후에도 더 높은 실제 로봇 성능을 보임
- 데이터와 모델 규모 증가에 따른 성공률 향상에는 포화 징후가 없었음
적은 데이터로 새로운 작업 학습
- Xiaomi-Robotics-1은 작업별 몇 시간의 실제 로봇 시연만으로 복잡한 신규 작업에 적응함
- 전화기 포장, 프린터 보충, 세탁물 투입, 상자 포장을 평가 작업으로 사용함
- 작업당 평균 10시간 미만의 시연에서 종합 성공률 75%를 기록해, 같은 데이터 예산에서 기준 모델 Ï0.5의 40%를 크게 앞섬
- 전화기 포장: XR-1 70%, Ï0.5 30%
- 프린터 보충: XR-1 70%, Ï0.5 20%
- 세탁물 투입: XR-1 80%, Ï0.5 40%
- 상자 포장: XR-1 80%, Ï0.5 70%
- 작업당 평균 40시간 미만으로 늘리면 종합 성공률은 XR-1 85%, Ï0.5 53%로 높아짐
- 전화기 포장: XR-1 80%, Ï0.5 40%
- 프린터 보충: XR-1 60%, Ï0.5 20%
- 세탁물 투입: XR-1 100%, Ï0.5 50%
- 상자 포장: 두 모델 모두 100%
네 가지 시뮬레이션 벤치마크 성능
- 일반화를 중시하는 4개 주요 시뮬레이션 벤치마크에서 모두 최고 성능을 기록함
- RoboCasa: 평균 성공률 74.5%, 2위 72.6% 대비 2.6% 향상
- RoboCasa365: 57.4%, 2위 46.6% 대비 23.2% 향상
- VLABench: 59.1%, 2위 53.2% 대비 11.1% 향상
- RoboDojo: 13.93%, 2위 8.80% 대비 58.3% 향상
- 사전 학습에서 얻은 일반화 및 확장 효과가 표준 시뮬레이션 평가에도 이어짐
확장 결과와 활용 범위
- 대규모 UMI 사전 학습은 로봇 데이터 병목을 완화하고, 실제 로봇 및 명령 정렬은 일반 행동 생성 능력을 물리적 로봇으로 이전함
- 사전 학습 데이터와 모델 규모에 따른 성능 향상은 후속 학습 뒤 실제 로봇의 즉시 사용 성능에도 직접 반영됨
- 완성된 기반 모델은 적은 데이터로 새로운 작업에 적응하면서, 일반화를 평가하는 4개 시뮬레이션 벤치마크에서도 최고 성능을 달성함
- 실제 활용 사례로 편집하지 않은 여행가방 포장 영상도 공개함