- Google이 Gemini 2.5 Pro 기반의 Computer Use 모델을 공개, 개발자들이 사용자 인터페이스를 직접 조작하는 에이전트를 만들 수 있도록 지원함
- 웹·모바일 제어 벤치마크에서 경쟁 모델보다 빠르고 정확한 성능을 보이며, Google AI Studio와 Vertex AI에서 프리뷰로 이용 가능
- 모델은 화면 캡처·사용자 요청·액션 히스토리를 입력으로 받아 클릭·입력·스크롤 등의 UI 조작 명령을 자동 생성함
- 안전성 확보를 위해 Per-step Safety Service와 사용자 확인 절차를 포함해 오남용 및 보안 위협을 방지
- 이미 Project Mariner, Firebase Testing Agent, AI Mode in Search 등에 적용되어 실무 수준의 자동화와 테스트 효율 개선을 입증
개요
- Google DeepMind가 Gemini 2.5 Computer Use 모델을 출시함
- Gemini 2.5 Pro의 시각 이해 및 추론 기능을 바탕으로, 웹·모바일 UI를 직접 제어할 수 있는 에이전트용 모델임
- 기존 API 기반 자동화에서 한 단계 나아가 폼 입력·스크롤·로그인 처리 등 그래픽 인터페이스 상호작용을 수행함
- Google AI Studio와 Vertex AI를 통해 미리보기 형태로 제공됨
작동 방식
- 새로운
computer_use도구를 통해 반복 루프 구조로 동작함- 입력: 사용자 요청, 현재 UI의 스크린샷, 최근 액션 내역
- 출력: 클릭·입력·드래그 등 UI 액션 함수 호출
- 일부 고위험 작업(예: 결제)은 사용자 확인 절차를 요구함
- 각 액션 후 새 스크린샷과 URL이 모델에 다시 전달되어 다음 단계 실행
- 주로 웹 브라우저 환경에 최적화되어 있으나, 모바일 UI 제어에도 높은 성능을 보임
성능
-
Browserbase와 Google 자체 평가에서 업계 최고 수준의 정확도 및 지연 시간 기록
- Online-Mind2Web 등 벤치마크에서 경쟁 모델 대비 50% 이상 빠른 반응을 보임
- 복잡한 화면 내 컨텍스트 파악 정확도도 개선되어 18% 성능 향상 보고됨
- UI 제어 작업 중 실패 상황을 자동 복구하는 기능도 포함되어 테스트 자동화에 유용함
안전성 설계
- 에이전트의 오남용 방지를 위해 모델에 내장 안전 기능을 포함함
- Per-step Safety Service: 모델이 제안한 액션을 실행 전 검증
- System Instructions: 특정 작업(보안·의료·CAPTCHA 등)에 대해 사용자 확인 또는 거부 규칙 설정 가능
- 개발자용 가이드에서 추가 보안 권장 사항 제공, 실서비스 적용 전 철저한 테스트 권장
초기 적용 사례
- Google 내부 팀이 UI 테스트 자동화에 도입, 실패율 25% 감소
- Project Mariner, Firebase Testing Agent, AI Mode in Search 등 실제 프로덕션 환경에서 사용 중
- 외부 초기 사용자 평가에서도 데이터 파싱 신뢰도 향상 및 실행 속도 개선 효과 보고
- 예: Autotab은 복잡한 컨텍스트 처리 정확도 18% 향상
- Google 결제 플랫폼은 실패 테스트 60% 자동 복구
시작하기
- 모델은 공개 프리뷰로 제공 중이며, 다음 채널에서 접근 가능
- Google AI Studio
- Vertex AI
- Browserbase 데모 환경에서 실시간 테스트 가능
- 개발자는 GitHub 레퍼런스 및 문서를 통해 Playwright 또는 클라우드 VM 환경에서 에이전트 루프 구성 가능
- 피드백은 Developer Forum에서 수집 중