- OK-Robot은 새로운 가정 환경에서 언어 지시만으로 물건을 찾아 집고 옮기는 pick-and-drop 작업을 제로샷으로 수행하려는 개방형 모듈러 로봇 프레임워크임
- 비전-언어 모델(VLM), 내비게이션 프리미티브, 집기 프리미티브를 결합해 별도 학습 없이 객체 인식·이동·조작을 이어 붙임
- 뉴욕시의 10개 실제 가정에서 171개 작업을 평가했고, 완전히 새로운 집에서 58.5% 성공률을 기록함
- 깨끗하고 어수선하지 않은 환경에서는 성공률이 82% 로 올라갔으며, Open Vocabulary Mobile Manipulation(OVMM)에서 이전 작업 대비 약 1.8배 성능을 보임
- 주요 실패는 객체 검색, 어려운 조작 자세, 하드웨어 문제에서 발생해 개방형 지식 모델과 로봇 모듈의 세밀한 통합이 성능을 좌우함
프레임워크 구성과 목표
- OK-Robot은 임의의 가정에서 제로샷, 언어 조건 기반 pick-and-drop 작업을 수행하기 위한 개방형 모듈러 프레임워크임
- 시스템은 세 가지 구성요소를 결합함
- 비전-언어 모델(VLM): 언어 질의 기반 객체 탐지
- 내비게이션 프리미티브: 모바일 시스템 이동 제어
- 집기 프리미티브: 다양한 객체 조작
- 별도 학습 단계 없이 객체 인식, 이동, 집기를 통합해 실제 가정 작업을 수행하는 시스템 우선 접근을 사용함
- 프로젝트 자료:
실제 가정 평가와 실패 요인
- 뉴욕시의 10개 가정 환경에서 171개 pick-and-drop 작업을 시도함
- 완전히 새로운 집에서의 성공률은 58.5% 였고, Open Vocabulary Mobile Manipulation(OVMM)에서 이전 작업 대비 약 1.8배 성능을 보임
- 성공률: {p:58}
- 더 깨끗하고 어수선하지 않은 환경에서는 성공률이 82% 로 상승함
- 정돈된 환경 성공률: {p:82}
- 실패 원인은 긴 꼬리 형태로 분포하며, 가장 큰 세 가지 원인은 다음과 같음
- 의미 메모리에서 이동해야 할 올바른 객체를 찾지 못함: 9.3%
- 조작 모듈이 어려운 자세를 받음: 8.0%
- 하드웨어 어려움: 7.5%
- VLM 같은 개방형 지식 시스템을 로봇 모듈과 결합할 때는 모델 성능뿐 아니라 객체 메모리, 조작 자세, 하드웨어 안정성까지 함께 맞물려야 함