- Google DeepMind의 Gemini 3.5 Flash는 Flash 계열의 낮은 지연시간과 확장성을 유지하면서 에이전트·코딩 작업에 고급 추론을 제공하는 Preview 모델임
- 긴 작업 흐름과 반복적 코딩뿐 아니라 텍스트·오디오·이미지·코드·비디오를 함께 다루는 멀티모달 이해가 핵심 역량임
- 공개 예시는 빠른 UI 생성부터 논문 기반 게임 구축, 가상 도시 설계까지 포함해 에이전트형 작업에서의 활용 범위를 강조함
- 벤치마크에서는 MCP Atlas 83.6%, Toolathlon 56.5%, Finance Agent v2 57.9%, MMMU-Pro 83.6% 등 여러 항목에서 표 내 최고 점수를 기록함
- 입력은 텍스트·이미지·비디오·오디오·PDF를 지원하고 출력은 텍스트이며, 1M 입력 토큰과 64k 출력 토큰, 함수 호출·구조화 출력·검색 도구·코드 실행을 제공함
Gemini 3.5 Flash의 위치
- Gemini 3.5 Flash는 “Flash 수준의 지연시간과 확장성”에서 고급 추론을 제공하는 모델임
- 적용 영역은 에이전트, 코딩, 일상 작업, 고급 추론, 멀티모달 이해, 긴 컨텍스트 이해임
- 모델 상태는 Preview임
Flash 지연시간에서 겨냥하는 작업
- 빠른 속도와 지능을 함께 제공하는 것이 핵심 방향임
- 속도와 확장성을 유지하면서도 지능을 희생하지 않는 모델로 자리 잡으려 함
- 긴 범위 추론과 반복적 코딩 작업을 처리함
- 텍스트, 오디오, 이미지, 코드, 비디오 전반에서 멀티모달 이해를 지원함
에이전트 활용 예시
- 빠른 에이전트 역량을 보여주는 작업 사례가 여럿 제시됨
- 60초 미만에 결제 UI 옵션 6개 생성
- 고속으로 프랙털 변형 64개 생성
- AlphaGo 논문을 입력받아 지능형 게임을 자율적으로 구축
- 최소 입력으로 모금 행사 브랜드를 생성·개선하는 여러 워크플로 조율
- 텍스트 설명을 완전한 인터랙티브 HTML 컴포넌트로 변환
- Strudel 음악 라이브러리를 사용해 여러 에이전트가 노래를 생성
- 전문 에이전트 팀을 조율해 가상 도시를 설계·구축
- 지저분한 데이터셋을 자동으로 이름 변경하고 구조화
- 에이전트를 배치해 게임을 실시간으로 계속 개선
고객 사례와 성능 개선
- Armadin은 Gemini의 최신 Flash 모델이 장거리 멀티턴 사이버 벤치마크에서 Flash 3보다 42% 높고, 토큰 효율은 68% 개선됐다고 밝힘
- Box의 엔터프라이즈 작업 평가 세트에서는 Gemini 3.5 Flash가 Gemini 3 Flash보다 19.6% 높았음
- Life Sciences 고객의 데이터 추출과 계산 정확도는 96.4% 높아짐
- Financial Services용 구조화 데이터 기반 금융 보고서 생성 정확도는 46.7% 높아짐
- JetBrains의 Junie는 Gemini 3.5 Flash가 Gemini Pro에 가까운 코딩·추론 품질을 제공하면서 Flash의 속도와 비용 특성을 유지한다고 평가함
- 이전 Flash 세대 대비 낮은 추론 수준의 코딩 성능이 10–20% 개선됨
벤치마크 결과
- Gemini 3.5 Flash는 에이전트 워크플로용 모델로 강하게 부각됨
- 코딩 벤치마크
- Terminal-bench 2.1 Agentic terminal coding: 76.2%
- SWE-Bench Pro Public: 55.1%
- 에이전트·도구 사용 벤치마크
- MCP Atlas: 83.6% 로 표 내 최고 점수
- Toolathlon: 56.5% 로 표 내 최고 점수
- UI 제어와 전문 작업
- OSWorld-Verified: 78.4%
- Finance Agent v2: 57.9% 로 표 내 최고 점수
- GDPval-AA Elo: 1656
- 멀티모달 벤치마크
- CharXiv Reasoning: 84.2% 로 표 내 최고 점수
- MMMU-Pro: 83.6% 로 표 내 최고 점수
- Blueprint-Bench 2: 33.6%
- 긴 컨텍스트와 추론
- MRCR v2 128k 평균: 77.3%
- MRCR v2 1M pointwise: 26.6% 로 비교 가능한 Gemini 3 Flash와 Gemini 3.1 Pro보다 높음
- Humanity’s Last Exam: 40.2%
- ARC-AGI-2: 72.1%
- 평가 방법 세부 정보는 Gemini 3.5 Flash evals methodology에 있음
모델 정보와 사용 가능 환경
- 입력은 텍스트, 이미지, 비디오, 오디오, PDF를 지원함
- 출력은 텍스트임
- 컨텍스트와 지식 기준
- 입력 토큰: 1M
- 출력 토큰: 64k
- 지식 컷오프: 2025년 1월
- 도구 사용 기능
- 함수 호출
- 구조화 출력
- 검색을 도구로 사용
- 코드 실행
- 사용 가능 환경은 Gemini App, Gemini API, Gemini Enterprise, Gemini Enterprise Agent Platform, Google AI Mode, Google AI Studio, Google Antigravity, Android Studio임
- 개발자 문서는 Gemini API models documentation에서 제공됨
- 모델 카드는 Gemini 3.5 Flash model card에서 제공됨