- Gemini 2.5는 복잡한 문제 해결을 위해 설계된 가장 지능적인 추론 기반 AI 모델
- 최초 릴리스인 Gemini 2.5 Pro Experimental은 다양한 AI 벤치마크에서 최고 성능을 기록함
- 특히 LMArena 순위에서 큰 격차로 1위를 차지함
- 기존 모델과 달리 응답 전에 스스로 사고 과정을 거치는 구조로 설계되어 정확성과 성능이 향상됨
AI에서의 '사고' 능력이란?
- 단순한 분류나 예측을 넘어서, 정보 분석, 논리적 결론 도출, 맥락 이해, 의사 결정 등 고차원적인 인지 능력을 포함함
- 이를 위해 DeepMind는 강화 학습, Chain-of-Thought 프롬프트 기법 등을 활용해 AI의 추론 능력을 연구해왔음
- 기존의 Gemini 2.0 Flash Thinking 모델에서 한 단계 더 발전된 성능을 보여줌
앞으로의 방향
- Gemini 2.5를 통해 향상된 기반 모델과 후처리 기법을 결합하여 새로운 성능 수준 달성
- 향후 모든 Gemini 모델에 이 사고 능력을 기본 탑재하여, 더 복잡한 문제 해결과 고도화된 에이전트 지원 가능하게 할 예정임
Gemini 2.5 Pro 소개
- Gemini 2.5 Pro Experimental은 지금까지 개발된 모델 중 가장 복잡한 작업 수행에 뛰어난 성능을 보임
- 인간 선호도를 기준으로 평가하는 LMArena에서 큰 격차로 1위를 차지
- 코딩, 수학, 과학 벤치마크에서도 뛰어난 성능을 보임
- 현재 Google AI Studio 및 Gemini 앱에서 사용 가능하며, 곧 Vertex AI에서도 제공 예정
- 향후 요금제가 도입되어 더 높은 호출 제한으로 확장 가능한 서비스 가능 예정
향상된 추론 성능
- 복잡한 논리 문제 해결에서 최고 수준의 벤치마크 성적 기록
- 추가적인 비용이 드는 테스트 기법(예: 다수결 투표) 없이도 우수한 성능 유지
- GPQA, AIME 2025 등의 수학·과학 문제에서 선도적인 성능
- 수백 명의 전문가가 설계한 고난이도 추론 테스트 'Humanity’s Last Exam'에서 도구 없이 18.8%라는 업계 최고 성적 기록
고급 코딩 성능
- 코딩 성능이 Gemini 2.0 대비 크게 향상됨
- 웹앱 생성, 에이전트형 코드 작성, 코드 변환 및 수정에 뛰어난 능력
- SWE-Bench Verified 평가에서 맞춤형 에이전트 사용 시 63.8% 달성
- 단 한 줄의 프롬프트로 실행 가능한 비디오 게임을 생성하는 예시도 있음
Gemini 모델의 강점 계승
- Gemini 2.5는 기존 Gemini 모델의 강점인 멀티모달 처리 및 긴 컨텍스트 창을 그대로 유지함
- 1백만 토큰 컨텍스트 창 지원 (곧 2백만으로 확장 예정)
- 텍스트, 오디오, 이미지, 비디오, 전체 코드 저장소 등 다양한 정보 소스를 종합적으로 처리 가능
- 개발자 및 기업 사용자는 Google AI Studio, Gemini Advanced, Vertex AI 등을 통해 실험 및 테스트 가능