- Google DeepMind는 물리적 작업이 가능한 차세대 로봇용 멀티모달 AI 모델인 Gemini Robotics를 개발
- 해당 모델은 텍스트, 비디오, 오디오뿐만 아니라 실제 행동까지 수행할 수 있도록 Gemini 2.0을 로봇 특화 데이터로 파인튜닝한 버전
- 로봇이 샐러드 만들기, 틱택토 게임, 종이접기, 점심 도시락 포장 등 다양한 작업을 수행
실제 테스트 사례 및 가능성 확인
- 연구용 ALOHA 이중 팔 로봇에 다양한 작업 요청
- 예: 신발 안에 펜 넣기, 농구공 덩크슛 요청 등
- 로봇이 이전에 본 적 없는 물체와 작업임에도 요청을 이해하고 첫 시도에 성공적으로 수행함
- 기존 모델들과는 달리 복잡한 물리적 명령을 자연어로 이해하고 실행 가능
Gemini Robotics의 핵심 특징
- 높은 유연성, 상호작용 능력, 일반화 능력 보유
- 추가 훈련 없이도 새로운 물체, 환경, 지시에 적응 가능
- AI와 로봇을 하나의 통합된 에이전트로 구현할 수 있는 기반 마련
- 인간과 비슷한 인식 및 판단, 행동 능력 제공
구성 모델 소개
-
Gemini Robotics-ER (Embodied Reasoning):
- Gemini 2.0 Flash 기반
- 물체 인식, 위치 파악, 이동 궤적 예측, 그립 설정 등을 통해 코드를 생성하고 실행함
- 신뢰받는 테스터 및 파트너에게 공개 중
-
Gemini Robotics:
- 비전-언어-행동 통합 모델
- 장면 이해, 사용자와의 상호작용, 다단계 작업 수행 가능
- 복잡한 조작과 공간 추론이 필요한 작업에서도 최신 최고 수준의 손재주 성능 기록
구체적 기술 능력
- 2D 및 3D 객체 탐지
- 포인팅(지시) 기능
- 여러 뷰에서의 대응점 찾기
- 다양한 시각 정보를 활용한 조작 능력 확보
훈련 접근 방식과 장점
- 기존 산업 방식인 단일 작업 반복 훈련이 아닌, 다양한 작업을 통한 광범위한 학습 선택
- 그 결과, 일반화 능력이 자연스럽게 나타남
- 다양한 형태의 로봇에 적용 가능
- 예: ALOHA(연구용), Apptronik의 Apollo(휴머노이드 로봇)
다양한 형태의 로봇 지원
- 도시락 포장, 화이트보드 지우기, 작은 물체 집기 등 다양한 형태의 로봇이 다양한 작업을 수행함
- 하나의 모델이 여러 로봇에 적응 가능하다는 점이 핵심
향후 비전
- 정밀한 작업이 요구되거나 인간에게 적합하지 않은 환경의 산업 분야에서 유용성 기대
- 가정 등 인간 중심 환경에서도 도움이 되는 로봇으로 발전할 가능성 있음
- 실제 일상에서 로봇이 AI와의 또 다른 인터페이스가 될 수 있음