- 평가된 170개 모델 중 Claude Opus 5 Adaptive Reasoning·Max Effort가 Intelligence Index 61점으로 1위를 차지했으며, Xhigh Effort와 Claude Fable 5가 각각 60점으로 뒤를 이음
- Intelligence Index v4.1은 에이전트 작업·코딩·과학 추론·지식 신뢰성·장문맥 추론을 다루는 9개 평가를 결합하고, 추론 모델의 확장 사고 시간도 성능 측정에 반영함
- 출력 속도는 Mercury 2가 901.6 tokens/s로 가장 빠르고, 첫 토큰 지연은 Gemini 2.5 Flash-Lite가 0.34초로 가장 짧으며, Llama 4 Scout는 10M 토큰의 최대 문맥 창을 제공함
- 가격은 토큰 단가뿐 아니라 입력·캐시 적중·캐시 쓰기·추론·답변 토큰을 가중한 작업당 비용으로 비교하며, 캐시 쓰기와 저장 비용은 제공업체마다 다름
- 공개 가중치 모델 중 GLM-5.2 (max) 가 51점으로 가장 높지만 전체 1위보다 10점 낮아, 모델 선택에는 지능과 함께 비용·속도·지연·문맥 창을 고려해야 함
Claude Opus 5의 지능 순위
- Claude Opus 5 (Adaptive Reasoning, Max Effort) 는 Intelligence Index 61점으로 평가된 170개 모델 가운데 1위임
- 상위 5개 모델은 다음과 같음
- Claude Opus 5 (Adaptive Reasoning, Max Effort): 61점
- Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60점
- Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60점
- GPT-5.6 Sol (max): 59점
- Claude Opus 5 (Adaptive Reasoning, High Effort): 59점
- Max Effort 구성은 126개 추론 모델 중에서도 1위이며, 추론 모델은 답변 전에 복잡한 문제를 처리하기 위한 확장 사고를 수행함
Intelligence Index v4.1의 평가 구성
- Intelligence Index v4.1은 다음 9개 평가를 결합함
- GDPval-AA v2: 에이전트 기반 실제 업무
- 𝜏³-Banking: 에이전트 도구 사용
- Terminal-Bench v2.1: 에이전트 코딩 및 터미널 사용
- SciCode: 코딩
- Humanity's Last Exam: 추론 및 지식
- GPQA Diamond: 과학적 추론
- CritPt: 물리학 추론
- AA-Omniscience: 지식 정확도와 비환각률
- AA-LCR: 장문맥 추론
- 용도에 따라 종합 지능 점수보다 특정 평가 결과가 더 중요할 수 있음
- 별도 평가 항목에는 다음 벤치마크도 포함됨
- AA-Briefcase: 에이전트 지식 업무
- AutomationBench-AA: 에이전트 SaaS 워크플로
- Harvey LAB-AA: 법률 에이전트 업무
- EnterpriseOps-Gym-AA: 에이전트 비즈니스 운영
- IFBench: 지시 준수
- APEX-Agents-AA: 장기 에이전트 작업
- ITBench-AA: Kubernetes 사고 근본 원인 분석
- MMMU-Pro: 시각적 추론
지식 업무·신뢰성·개방성 지표
- AA-Briefcase Elo는 분석 품질 Elo, 프레젠테이션 Elo, 평가 기준 통과율을 결합함
- 통과율은 합성 일대일 대결을 통해 Elo로 변환함
- Elo와 95% 신뢰구간 경계는 0 미만이 되지 않도록 제한함
- AA-Omniscience Index는 지식 신뢰성과 환각을 -100~100점으로 측정함
- 정답에는 보상하고 환각에는 벌점을 부여하지만, 답변 거부에는 벌점이 없음
- 0점은 정답과 오답 수가 같고, 음수는 오답이 정답보다 많다는 뜻임
- Openness Index는 모델의 개방성을 0~100의 정규화 점수로 평가하며, 높을수록 더 개방적임
- 가중치 공개 여부를 구분하고, 가중치는 공개됐지만 상업적 이용에 유료 라이선스 등이 필요한 모델은
Commercial Use Restricted로 표시함
공개 가중치 모델 순위
- 평가된 170개 모델 중 94개가 공개 가중치 모델임
- 공개 가중치 모델의 Intelligence Index 상위권은 다음과 같음
- GLM-5.2 (max): 51점
- MiniMax-M3: 44점
- DeepSeek V4 Pro (Reasoning, Max Effort): 44점
- GLM-5.2 (max)가 공개 가중치 모델 중 가장 높은 점수를 기록함
출력 속도와 작업 처리 시간
- Mercury 2는 901.6 tokens/s로 출력 속도가 가장 빠름
- Gemini 3.5 Flash-Lite: 435.1 tokens/s
- HyperNova 60B 2605: 427.6 tokens/s
- Granite 4.0 H Small도 상위권에 포함됨
- 출력 속도는 스트리밍 모델에서 첫 청크를 받은 뒤, 모델이 토큰을 생성하는 동안 수신한 초당 토큰 수임
- Intelligence Index의 작업당 시간은 작업당 출력 토큰 수를 출력 속도로 나누고 각 벤치마크의 상대적 가중치를 적용해 계산함
- 첫 토큰 도착 시간(TTFT)과 기타 오버헤드는 제외함
- 자체 API가 있으면 해당 API 성능을 사용하고, Meta Llama처럼 자체 API가 없으면 여러 제공업체의 중앙값을 사용함
지연과 종단 간 응답 시간
- 첫 답변 토큰 도착 시간이 가장 짧은 모델은 Gemini 2.5 Flash-Lite (Non-reasoning) 로 0.34초임
- Command A+: 0.42초
- North Mini Code: 0.49초
- Gemini 2.5 Flash도 지연이 짧은 모델에 포함됨
- 첫 토큰 지연은 API 요청 후 첫 답변 토큰을 받을 때까지 걸리는 시간임
- 추론 모델에서는 답변 전 사고 시간도 포함함
- 스트리밍을 지원하지 않는 모델에는 전체 응답을 받는 시간이 적용됨
- 500토큰 종단 간 응답 시간은 다음 요소를 합산함
- 첫 응답 토큰을 받기까지의 입력 시간
- 추론 모델이 답변 전에 사용하는 사고 시간
- 출력 속도에 기반해 500개 답변 토큰을 생성하는 시간
- 사고 토큰 수는 서로 다른 60개 프롬프트에서 측정한 평균을 사용함
가격과 작업당 비용
- 가격 비교에는 캐시 적중·입력·출력 토큰의 100만 토큰당 달러 단가를 사용함
- 목록에서 Devstral 2와 North Mini Code는 100만 토큰당 $0.00으로 표시되며, Gemma 3 4B와 Gemma 3 27B가 뒤를 이음
- 혼합 단가 기준 가장 저렴한 모델은 다음과 같음
- Nova Micro: $0.03/1M tokens
- Sarvam 30B (high): $0.03/1M tokens
- Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
- Intelligence Index 작업당 비용은 각 평가의 입력·캐시 적중·캐시 쓰기·추론·답변 토큰 가격을 작업 수로 나누고, Index 내 평가 가중치를 적용함
- 전체 Index 실행 비용은 반복 실행을 제외한 평가별 토큰 사용량과 각 토큰 유형의 가격으로 계산함
- 표시된 캐시 혼합 가격은 캐시 적중 비용만 사용하며, 다른 캐시 비용은 제공업체마다 다름
- Anthropic은 캐시 쓰기 비용을 별도로 부과하며, 5분과 1시간 TTL의 요율이 다르고 1시간이 더 비쌈
- Google Vertex/Gemini는 캐시 적중 가격 외에 시간당 저장 비용을 부과함
- 일부 제공업체는 200K 토큰을 넘는 프롬프트에 구간별 가격을 적용함
- OpenAI와 DeepSeek 등은 일반적으로 쓰기·저장 비용 없이 캐시 적중 가격만 부과함
토큰 사용량과 문맥 창
- 작업당 출력 토큰 수는 각 평가의 출력 토큰에 Intelligence Index 내 상대적 가중치를 곱한 뒤, 반복을 제외한 작업 수로 나눠 계산함
- 문맥 창 상위 모델은 다음과 같음
- Llama 4 Scout: 10M 토큰
- Grok 4.20 0309: 2M 토큰
- Gemini 1.5 Pro (May)
- Grok 4.1 Fast
- 문맥 창은 입력과 출력 토큰을 합친 최대 한도이며, 출력 토큰 한도는 일반적으로 이보다 훨씬 작고 모델마다 다름
- 큰 문맥 창은 대량 데이터에서 정보를 검색하고 추론하는 RAG 워크플로와 관련됨
공개 가중치 모델의 크기
- 모델 크기는 학습 가능한 가중치와 편향을 합한 전체 파라미터와 실제 추론에서 실행되는 활성 파라미터로 구분함
- Mixture of Experts 모델은 라우팅 메커니즘이 토큰마다 일부 전문가만 선택하므로 활성 파라미터가 전체보다 적음
- Dense 모델은 모든 파라미터를 사용하므로 활성 파라미터와 전체 파라미터가 같음
비교 범위와 활용법
- 모델은 지능, 가격, 출력 속도, 첫 토큰 지연, 종단 간 응답 시간, 문맥 창 크기 등 여러 차원에서 비교됨
- 성능 지표는 586개 모델을 대상으로 표준화된 프롬프트를 사용해 직접 측정함
- 각 모델의 상세 페이지에서 세부 지표와 유사 모델 간 직접 비교를 확인할 수 있으며, 모델 선택기로 차트에 표시할 모델을 조정할 수 있음