- Google DeepMind의 Gemini 3.5는 최신 모델 시리즈로, 더 유능한 지능형 에이전트를 만들기 위한 “frontier intelligence with action”을 전면에 내세움
- 현재 중심 모델은 Gemini 3.5 Flash이며, 에이전트·코딩 성능을 강조하고 3.5 Pro는 “coming soon”으로 표시됨
- 강점으로는 에이전트 코딩, 고급 멀티모달 이해, 장기 실행 작업, 다단계 문제 해결이 제시되며 텍스트·이미지·비디오·오디오를 상호작용 UI로 바꾸는 활용까지 포함함
- 벤치마크 표에서는 MCP Atlas 83.6%, Toolathlon 56.5%, Finance Agent v2 57.9%, MMMU-Pro 83.6% 등에서 Gemini 3.5 Flash가 최고점을 기록하지만 Terminal-bench 2.1, SWE-Bench Pro, OSWorld-Verified, GDPval-AA 등은 다른 모델이 앞섬
- 사용자는 Gemini 앱, Google AI Studio, Gemini API, Google Antigravity, Gemini Enterprise Agent Platform을 통해 모델을 써볼 수 있으며, Google은 안전과 보안을 우선하겠다고 밝힘
Gemini 3.5의 포지션
- Gemini 3.5는 “frontier intelligence with action”을 내세운 Google DeepMind의 최신 모델 시리즈임
- 핵심 목표는 더 유능한 지능형 에이전트를 만들 수 있게 하는 것임
- 바로 써볼 수 있는 경로로 Gemini와 Google AI Studio가 제시됨
모델 라인업
- Gemini 3.5 Flash는 에이전트와 코딩 전반의 frontier performance에 적합한 모델로 소개됨
- Gemini 3.1 Pro는 복잡한 작업과 창의적 콘셉트 구현에 맞춰진 모델임
- 3.5 Pro는 “coming soon”으로 표시됨
- Gemini 3.1 Deep Think는 과학, 연구, 엔지니어링의 현대적 과제를 겨냥함
- Gemini 3.1 Flash-Lite는 효율성과 지능이 필요한 대량 작업용 모델임
강조된 역량
-
에이전트 코딩
- 고급 추론을 빠르게 활용해 복잡한 개발 작업을 처리함
-
고급 멀티모달 이해
- 텍스트, 이미지, 비디오, 오디오를 풍부한 상호작용 사용자 인터페이스로 변환함
-
장기 실행 작업
- 긴 시간 범위에 걸친 정교한 워크플로를 실행함
-
다단계 문제 해결
- 고급 도구를 활용해 까다로운 실제 문제를 풀 수 있음
벤치마크 성능
- Google DeepMind는 Gemini 3.5를 에이전트 워크플로용으로 강한 모델로 내세우며, 여러 벤치마크에서 선두권 성능을 강조함
- 표에 제시된 Gemini 3.5 Flash 주요 결과
- Terminal-bench 2.1 Agentic terminal coding: 76.2%
- GPT-5.5는 78.2%로 표 내 최고
- SWE-Bench Pro: 55.1%
- Claude Opus 4.7은 64.3%로 표 내 최고
- MCP Atlas: 83.6%
- Gemini 3.5 Flash가 표 내 최고
- Toolathlon: 56.5%
- Gemini 3.5 Flash가 표 내 최고
- OSWorld-Verified: 78.4%
- GPT-5.5는 78.7%로 표 내 최고
- Finance Agent v2: 57.9%
- Gemini 3.5 Flash가 표 내 최고
- GDPval-AA: 1656 Elo
- GPT-5.5는 1769 Elo로 표 내 최고
- CharXiv Reasoning: 84.2%
- Gemini 3.5 Flash가 표 내 최고
- MMMU-Pro: 83.6%
- Gemini 3.5 Flash가 표 내 최고
- MRCR v2 128k 평균: 77.3%
- GPT-5.5는 94.8%로 표 내 최고
- MRCR v2 1M pointwise: 26.6%
- Humanity’s Last Exam: 40.2%
- Claude Opus 4.7은 46.9%로 표 내 최고
- ARC-AGI-2: 72.1%
- GPT-5.5는 84.6%로 표 내 최고
- Terminal-bench 2.1 Agentic terminal coding: 76.2%
- 평가 방법 세부사항은 Gemini 3.5 Flash 평가 방법에 있음
핸즈온 예시
-
반복 루프 기반 코딩
- Gemini 3.5 Flash가 60초 안에 결제 UI 옵션 6개를 생성하는 예시가 있음
-
병렬 창작
- 64개의 프랙털 변형을 빠르게 생성함
-
장기 실행 에이전트
- AlphaGo 논문을 입력받아 지능형 게임을 자율적으로 만드는 흐름을 보여줌
-
브랜드 자산 생성
- 모금 행사 브랜드를 만들고 다듬기 위해 여러 워크플로를 조율함
-
상호작용 웹 애니메이션
- 텍스트 설명을 완전한 상호작용 HTML 컴포넌트로 바꿈
-
실시간 음악 협업
- Strudel 음악 라이브러리를 사용해 여러 에이전트가 곡을 만들도록 조율함
-
멀티 에이전트 워크플로
- 전문 에이전트 팀을 조율해 가상 도시를 설계하고 구축함
-
파일 컬렉션 정리
- 병렬 에이전트를 배치해 지저분한 데이터셋의 이름을 바꾸고 구조화함
-
게임 개선 루프
- 에이전트를 배치해 게임을 실시간으로 계속 개선함
기업 활용 사례
-
Shopify
- 장기 범위의 복잡한 데이터를 분석하기 위해 서브에이전트를 병렬 실행하고, 글로벌 규모에서 더 정확한 merchant growth forecast를 만드는 데 Gemini 3.5 Flash를 사용함
-
Macquarie Bank
- 100페이지가 넘는 복잡한 문서를 추론하고 관련 정보를 검색하며 낮은 지연 시간으로 신뢰할 만한 추천을 만드는 고객 온보딩 가속화를 파일럿 중임
-
Salesforce
- Agentforce에 3.5 Flash를 통합해, 문맥을 유지하고 복잡한 다회전 도구 호출을 실행하는 여러 서브에이전트로 기업 작업 자동화를 추진함
-
Ramp
- 복잡한 청구서의 멀티모달 이해와 과거 패턴 추론을 결합해 더 스마트하고 신뢰할 수 있는 OCR을 지원함
-
Xero
- 공급업체 식별과 1099 세금 양식용 정보 수집 같은 복잡한 다주 워크플로를 에이전트가 자율 관리하도록 배포함
-
Databricks
- 실시간 정보 모니터링·검색, 대규모 데이터셋 추론, 문제 진단, 수정 사항 식별, 데이터 과학자를 위한 해결책 제안에 에이전트 워크플로를 사용함
파트너 평가 수치
- Armadin 기준으로 Gemini 최신 Flash 모델은 Flash 3 대비 장기·다회전 사이버 벤치마크에서 42% 더 높고 토큰 효율은 68% 개선됨
- Box의 엔터프라이즈 작업 평가 세트에서는 Gemini 3.5 Flash가 Gemini 3 Flash보다 19.6% 높게 나옴
- Life Sciences 고객의 데이터 추출과 계산 정확도는 96.4% 더 높았음
- Financial Services 기업의 구조화 데이터 기반 재무 보고서 생성 정확도는 46.7% 더 높았음
- GitHub의 VS Code 초기 테스트에서는 Gemini 3 Pro가 Gemini 2.5 Pro보다 소프트웨어 엔지니어링 과제 해결 정확도에서 35% 앞섬
- JetBrains는 Gemini 3.5 Flash가 Pro에 가까운 코딩·추론 품질을 제공하면서 Flash의 속도와 비용 특성을 유지하고, 이전 Flash 세대 대비 낮은 추론 코딩 성능을 10–20% 개선한다고 평가함
- Rakuten Group은 3시간 다국어 회의 전사와 화자 식별, 저품질 문서 사진의 구조화 데이터 추출에서 기준 모델보다 50% 이상 높은 성능을 확인함
시작 도구와 플랫폼
- Google Antigravity
- 누구나 빌더가 될 수 있게 하는 AI 우선 개발 플랫폼임
- Google AI Studio
- 프롬프트에서 프로덕션으로 넘어가는 경로로 소개됨
- Gemini API
- 최신 AI 모델로 빌드를 시작할 수 있는 API 경로임
- Gemini Enterprise Agent Platform
- 에이전트를 구축, 확장, 거버넌스할 수 있는 플랫폼임
안전과 Gemini 생태계
- Google DeepMind는 새로운 기술 개발에 따르는 책임을 인식하고, 모든 노력에서 안전과 보안을 우선하겠다고 밝힘
- 안전 관련 자료로 Gemini 3 Pro FSF report가 연결됨
- Gemini 생태계에는 다음 모델과 제품군이 포함됨