- xAI가 발표한 Grok 4 Fast는 기존 Grok 4의 학습 성과를 기반으로, 비용 효율성과 속도를 극대화한 차세대 추론 모델
- 이 모델은 2M 토큰 컨텍스트 윈도우, 웹 및 X 검색 기능, 그리고 reasoning / non-reasoning 통합 아키텍처를 갖춰 실시간 활용에 적합
- 벤치마크에서 Grok 4와 유사한 성능을 내면서도 평균 40% 적은 토큰을 사용해, 같은 성능을 훨씬 낮은 비용으로 달성할 수 있음
- 또한 도구 사용 강화 학습을 통해 코드 실행, 웹 탐색 등에서 높은 성능을 발휘하며, LMArena Search Arena에서 1위를 기록
비용 효율적 지능의 진보
- Grok 4 Fast는 Grok 3 Mini보다 우수한 성능을 보이면서도 토큰 비용을 크게 절감함
- 평균적으로 Grok 4 대비 40% 더 적은 'Thinking Tokens' 사용으로 유사한 성능 달성
- 벤치마크 점수 예시 (pass@1):
- Grok 4 Fast: 85.7%, 92.0%, 93.3%, 20.0%, 80.0%
- 경쟁 모델(GPT-5 등) 대비 동급 또는 우수한 결과
- GPQA, AIME, HMMT, LiveCodeBench 등 다양한 추론 벤치마크에서 Grok 4에 근접한 성과를 보여줌
- Grok 4 Fast의 토큰 효율성 40% 개선과 함께, 토큰당 가격을 크게 낮춤
- 동일 성능 달성 시 가격이 Grok 4 대비 98% 절감되어, 공개된 모델 중 '최고 가격-지능비(SOTA Price-to-Intelligence Ratio)' 기록
- 독립기관인 Artificial Analysis Intelligence Index 외부 평가에서 우수 성적을 검증받음
네이티브 도구 활용과 SOTA 검색
- 도구 사용 강화 학습(RL) 로 훈련되어, 필요 시 코드 실행이나 웹 브라우징을 자동으로 수행할 수 있음
- 웹과 X를 실시간으로 탐색해 다중 홉 검색과 미디어(이미지, 동영상)까지 소화하는 에이전틱 검색 능력을 갖춤
- BrowseComp, SimpleQA, X Bench Deepsearch(zh) 등 다양한 벤치마크에서 Grok 4를 초월하는 성능을 달성함
일반 도메인 포스트 트레이닝 성과
- LMArena의 Search Arena에서 Grok 4 Fast(
menlo)는 Elo 1163으로 1위를 기록, 경쟁 모델 대비 17점 차로 앞섬 - Text Arena에서는
grok-4-fast(코드네임 tahoe)가 8위로, 동급 타 모델(18위 이하)과 비교 압도적으로 우수 - 실제 검색 및 텍스트 작업에서 대형 모델 이상의 효율성을 보임
Reasoning과 Non-Reasoning 통합 모델
- 기존에는 별도 모델이 필요했던 reasoning / non-reasoning 모드를 단일 아키텍처로 통합함
- 시스템 프롬프트 만으로 reasoning(심층사고) 및 non-reasoning(신속 답변) 모드를 전환
- 엔드 투 엔드 지연시간과 토큰 비용 감소로 실시간 어플리케이션에 적합함
- xAI API에서는 개발자가 속도/깊이를 세밀하게 조절 가능
배포 및 가격 정책
- Grok 4 Fast는 바로 이용 가능하며, OpenRouter와 Vercel AI Gateway에서 한시적 무료 제공됨
- xAI API에서도
grok-4-fast-reasoning과grok-4-fast-non-reasoning두 가지 버전으로 제공되며, 2M 토큰 컨텍스트 윈도우 지원 - 가격은 입력 토큰 $0.20/1M, 출력 토큰 $0.50/1M부터 시작, 128k 토큰 초과 시 2배 요금 적용
- 캐시 입력 토큰은 $0.05/1M으로 제공되어 비용 절감에 도움
향후 계획
- 사용자 피드백을 반영해 지속적으로 모델 개선 예정
- 멀티모달 기능과 에이전틱 특성 강화가 차기 업데이트의 핵심 목표임
- 모델 카드와 추가 세부 정보는 Grok 4 Fast 모델카드 (PDF)를 통해 확인 가능함