# Claude Opus 5, Artificial Analysis 지능 리더보드 1위

> Clean Markdown view of GeekNews topic #31807. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=31807](https://news.hada.io/topic?id=31807)
- GeekNews Markdown: [https://news.hada.io/topic/31807.md](https://news.hada.io/topic/31807.md)
- Type: GN+
- Author: [neo](https://news.hada.io/@neo)
- Published: 2026-07-26T01:34:50+09:00
- Updated: 2026-07-26T01:34:50+09:00
- Original source: [artificialanalysis.ai](https://artificialanalysis.ai/models)
- Points: 1
- Comments: 1

## Topic Body

- 평가된 170개 모델 중 **Claude Opus 5 Adaptive Reasoning·Max Effort**가 Intelligence Index 61점으로 1위를 차지했으며, Xhigh Effort와 Claude Fable 5가 각각 60점으로 뒤를 이음
- **Intelligence Index v4.1**은 에이전트 작업·코딩·과학 추론·지식 신뢰성·장문맥 추론을 다루는 9개 평가를 결합하고, 추론 모델의 확장 사고 시간도 성능 측정에 반영함
- 출력 속도는 **Mercury 2**가 901.6 tokens/s로 가장 빠르고, 첫 토큰 지연은 Gemini 2.5 Flash-Lite가 0.34초로 가장 짧으며, Llama 4 Scout는 10M 토큰의 최대 문맥 창을 제공함
- 가격은 토큰 단가뿐 아니라 입력·캐시 적중·캐시 쓰기·추론·답변 토큰을 가중한 **작업당 비용**으로 비교하며, 캐시 쓰기와 저장 비용은 제공업체마다 다름
- 공개 가중치 모델 중 **GLM-5.2 (max)** 가 51점으로 가장 높지만 전체 1위보다 10점 낮아, 모델 선택에는 지능과 함께 비용·속도·지연·문맥 창을 고려해야 함

---

### Claude Opus 5의 지능 순위
- **Claude Opus 5 (Adaptive Reasoning, Max Effort)** 는 Intelligence Index 61점으로 평가된 170개 모델 가운데 1위임
- 상위 5개 모델은 다음과 같음
  - Claude Opus 5 (Adaptive Reasoning, Max Effort): **61점**
  - Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60점
  - Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60점
  - GPT-5.6 Sol (max): 59점
  - Claude Opus 5 (Adaptive Reasoning, High Effort): 59점
- Max Effort 구성은 126개 추론 모델 중에서도 1위이며, 추론 모델은 답변 전에 복잡한 문제를 처리하기 위한 **확장 사고**를 수행함

### Intelligence Index v4.1의 평가 구성
- **Intelligence Index v4.1**은 다음 9개 평가를 결합함
  - GDPval-AA v2: 에이전트 기반 실제 업무
  - 𝜏³-Banking: 에이전트 도구 사용
  - Terminal-Bench v2.1: 에이전트 코딩 및 터미널 사용
  - SciCode: 코딩
  - Humanity's Last Exam: 추론 및 지식
  - GPQA Diamond: 과학적 추론
  - CritPt: 물리학 추론
  - AA-Omniscience: 지식 정확도와 비환각률
  - AA-LCR: 장문맥 추론
- 용도에 따라 종합 지능 점수보다 **특정 평가 결과**가 더 중요할 수 있음
- 별도 평가 항목에는 다음 벤치마크도 포함됨
  - AA-Briefcase: 에이전트 지식 업무
  - AutomationBench-AA: 에이전트 SaaS 워크플로
  - Harvey LAB-AA: 법률 에이전트 업무
  - EnterpriseOps-Gym-AA: 에이전트 비즈니스 운영
  - IFBench: 지시 준수
  - APEX-Agents-AA: 장기 에이전트 작업
  - ITBench-AA: Kubernetes 사고 근본 원인 분석
  - MMMU-Pro: 시각적 추론

### 지식 업무·신뢰성·개방성 지표
- **AA-Briefcase Elo**는 분석 품질 Elo, 프레젠테이션 Elo, 평가 기준 통과율을 결합함
  - 통과율은 합성 일대일 대결을 통해 Elo로 변환함
  - Elo와 95% 신뢰구간 경계는 0 미만이 되지 않도록 제한함
- **AA-Omniscience Index**는 지식 신뢰성과 환각을 -100~100점으로 측정함
  - 정답에는 보상하고 환각에는 벌점을 부여하지만, 답변 거부에는 벌점이 없음
  - 0점은 정답과 오답 수가 같고, 음수는 오답이 정답보다 많다는 뜻임
- Openness Index는 모델의 **개방성**을 0~100의 정규화 점수로 평가하며, 높을수록 더 개방적임
- 가중치 공개 여부를 구분하고, 가중치는 공개됐지만 상업적 이용에 유료 라이선스 등이 필요한 모델은 `Commercial Use Restricted`로 표시함

### 공개 가중치 모델 순위
- 평가된 170개 모델 중 **94개**가 공개 가중치 모델임
- 공개 가중치 모델의 Intelligence Index 상위권은 다음과 같음
  - GLM-5.2 (max): **51점**
  - MiniMax-M3: 44점
  - DeepSeek V4 Pro (Reasoning, Max Effort): 44점
- GLM-5.2 (max)가 공개 가중치 모델 중 가장 높은 점수를 기록함

### 출력 속도와 작업 처리 시간
- **Mercury 2**는 901.6 tokens/s로 출력 속도가 가장 빠름
  - Gemini 3.5 Flash-Lite: 435.1 tokens/s
  - HyperNova 60B 2605: 427.6 tokens/s
  - Granite 4.0 H Small도 상위권에 포함됨
- 출력 속도는 스트리밍 모델에서 첫 청크를 받은 뒤, 모델이 토큰을 생성하는 동안 수신한 **초당 토큰 수**임
- Intelligence Index의 작업당 시간은 작업당 출력 토큰 수를 출력 속도로 나누고 각 벤치마크의 상대적 가중치를 적용해 계산함
  - 첫 토큰 도착 시간(TTFT)과 기타 오버헤드는 제외함
- 자체 API가 있으면 해당 API 성능을 사용하고, Meta Llama처럼 자체 API가 없으면 여러 제공업체의 **중앙값**을 사용함

### 지연과 종단 간 응답 시간
- 첫 답변 토큰 도착 시간이 가장 짧은 모델은 **Gemini 2.5 Flash-Lite (Non-reasoning)** 로 0.34초임
  - Command A+: 0.42초
  - North Mini Code: 0.49초
  - Gemini 2.5 Flash도 지연이 짧은 모델에 포함됨
- 첫 토큰 지연은 API 요청 후 첫 답변 토큰을 받을 때까지 걸리는 시간임
  - 추론 모델에서는 답변 전 **사고 시간**도 포함함
  - 스트리밍을 지원하지 않는 모델에는 전체 응답을 받는 시간이 적용됨
- 500토큰 종단 간 응답 시간은 다음 요소를 합산함
  - 첫 응답 토큰을 받기까지의 입력 시간
  - 추론 모델이 답변 전에 사용하는 사고 시간
  - 출력 속도에 기반해 500개 답변 토큰을 생성하는 시간
- 사고 토큰 수는 서로 다른 **60개 프롬프트**에서 측정한 평균을 사용함

### 가격과 작업당 비용
- 가격 비교에는 캐시 적중·입력·출력 토큰의 **100만 토큰당 달러 단가**를 사용함
- 목록에서 Devstral 2와 North Mini Code는 100만 토큰당 $0.00으로 표시되며, Gemma 3 4B와 Gemma 3 27B가 뒤를 이음
- 혼합 단가 기준 가장 저렴한 모델은 다음과 같음
  - Nova Micro: **$0.03/1M tokens**
  - Sarvam 30B (high): $0.03/1M tokens
  - Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
- Intelligence Index 작업당 비용은 각 평가의 입력·캐시 적중·캐시 쓰기·추론·답변 토큰 가격을 작업 수로 나누고, Index 내 평가 가중치를 적용함
- 전체 Index 실행 비용은 반복 실행을 제외한 평가별 토큰 사용량과 각 토큰 유형의 가격으로 계산함
- 표시된 **캐시 혼합 가격**은 캐시 적중 비용만 사용하며, 다른 캐시 비용은 제공업체마다 다름
  - Anthropic은 캐시 쓰기 비용을 별도로 부과하며, 5분과 1시간 TTL의 요율이 다르고 1시간이 더 비쌈
  - Google Vertex/Gemini는 캐시 적중 가격 외에 시간당 저장 비용을 부과함
  - 일부 제공업체는 200K 토큰을 넘는 프롬프트에 구간별 가격을 적용함
  - OpenAI와 DeepSeek 등은 일반적으로 쓰기·저장 비용 없이 캐시 적중 가격만 부과함

### 토큰 사용량과 문맥 창
- 작업당 출력 토큰 수는 각 평가의 출력 토큰에 Intelligence Index 내 상대적 가중치를 곱한 뒤, 반복을 제외한 **작업 수**로 나눠 계산함
- 문맥 창 상위 모델은 다음과 같음
  - Llama 4 Scout: **10M 토큰**
  - Grok 4.20 0309: 2M 토큰
  - Gemini 1.5 Pro (May)
  - Grok 4.1 Fast
- 문맥 창은 입력과 출력 토큰을 합친 최대 한도이며, 출력 토큰 한도는 일반적으로 이보다 훨씬 작고 모델마다 다름
- 큰 문맥 창은 대량 데이터에서 정보를 검색하고 추론하는 **RAG 워크플로**와 관련됨

### 공개 가중치 모델의 크기
- 모델 크기는 학습 가능한 가중치와 편향을 합한 **전체 파라미터**와 실제 추론에서 실행되는 활성 파라미터로 구분함
- Mixture of Experts 모델은 라우팅 메커니즘이 토큰마다 일부 전문가만 선택하므로 활성 파라미터가 전체보다 적음
- Dense 모델은 모든 파라미터를 사용하므로 **활성 파라미터와 전체 파라미터**가 같음

### 비교 범위와 활용법
- 모델은 지능, 가격, 출력 속도, 첫 토큰 지연, 종단 간 응답 시간, 문맥 창 크기 등 여러 차원에서 비교됨
- 성능 지표는 **586개 모델**을 대상으로 표준화된 프롬프트를 사용해 직접 측정함
- 각 모델의 상세 페이지에서 세부 지표와 유사 모델 간 직접 비교를 확인할 수 있으며, 모델 선택기로 차트에 표시할 모델을 조정할 수 있음

## Comments



### Comment 62382

- Author: neo
- Created: 2026-07-26T01:34:52+09:00
- Points: 1

###### [Hacker News 의견들](https://news.ycombinator.com/item?id=49040741) 
- 이 순위표는 최종 사용자가 어떤 모델을 언제 쓸지 결정하는 데 사실상 무의미해졌음  
  모델마다 특정 분야와 작업에서 강점과 약점이 달라 **단일 지표 순위**는 쓸모가 없고, 이제는 ‘최고의 모델’ 하나도 없으며 작업 복잡도에 따라 최고 모델이 필요하지 않을 수도 있음  
  예컨대 UI 디자인에는 Fable, 백엔드 시스템 설계에는 Sol, 취약점 개발에는 Kimi K3를 쓸 수 있으며, 이런 지표는 결국 모델 회사의 **과시용 숫자**에 가까움
  - 1년 전 새 ‘최고 모델’이 나와 기대하며 파일 3개를 사소하게 수정하는 간단한 프로그래밍 작업을 시켰고 잘 처리했음  
    그런데 같은 계열의 더 오래되고 작은 모델도 잘 처리하면서 **3배 빠르고 비용은 9분의 1**이었고, 그 순간 깨달음을 얻었음
  - **기술 스택별 벤치마크**가 있으면 좋겠음  
    2026년에 Elixir/Phoenix 프로젝트를 가장 관용적인 방식으로 잘 처리하는 모델이 무엇인지처럼 다소 주관적이더라도, 모든 모델을 계속 직접 비교하기 어렵고 성능 차이도 큰 상황에서는 유용할 수 있음
  - ‘완전히 무의미하다’거나 ‘유일한 목적’이라는 표현은 과장임  
    모든 통계에 왜곡은 있지만 아무것도 모르는 것보다는 낫고, 벤치마크가 여러 작업의 평균을 보여준다는 건 통계가 본래 요약을 위한 것이라는 뜻임
  - 링크를 열어 보면 **단일 지표**만 있는 게 아니라 판단에 필요한 모든 지표가 실제로 제공됨
  - Artificial Analysis의 작업당 비용이나 **환각 발생 빈도** 같은 차트에는 가치가 있음  
    다만 이를 하나의 결과로 합치면 모든 미묘한 차이가 사라지고 과시용 순위만 남음

- Google 경영진이라면 일이 많아서뿐 아니라 사람들 앞에 보이기 부끄러워서 사무실에서 자야 하는 것 아닌가 싶음
  - 보조금을 태우며 손해 보지 않는 유일한 업체라서 오히려 편히 잘 수 있음
  - Google은 가장 지능적인 AI보다 모든 제품에서 **수익화할 수 있는 속도**를 더 중시하는 듯함  
    오래전부터 질문에 정확한 답을 가장 빠르게 제공하는 것이 최우선이라고 밝혀 왔음
  - Google이 OpenAI나 Anthropic처럼 지능을 극대화한 모델로 경쟁하려는지도 의문임  
    셋 중 **AGI를 숭배하며 고행하지 않는 유일한 회사**처럼 보임
  - **GPQA Diamond** 벤치마크에서는 공동 1위임: [https://artificialanalysis.ai/evaluations/gpqa-diamond](<https://artificialanalysis.ai/evaluations/gpqa-diamond>)  
    어쩌면 이것만이 목표일 수도 있음
  - Gemini 모델도 여러 부문에서 선두이거나 선두권이라, 부끄러울 만큼 뒤처졌다는 결론은 맞지 않아 보임

- 지능 지수 상위권은 Claude Opus 5 Max 61점, Opus 5 Xhigh 60점, Claude Fable 5 Max와 Opus 4.8 대체 모델 조합 60점, GPT-5.6 Sol Max 59점, Opus 5 High 59점임  
  따라서 **Opus 5 Xhigh가 Sol Max보다 높고**, Opus 5 High는 Sol Max와 같으니 두 모델의 가격과 속도 차이가 궁금함
  - Artificial Analysis의 작업당 지능 대비 비용과 시간 그래프에서는 **Opus 5 High와 Sol Max**의 비용·시간이 대략 비슷함  
    DeepSwe에서는 Opus 5가 Fable을 이기지만 Sol에는 밀리며, FrontierCode에서는 모두 압도하다가 추론 노력을 Medium보다 높이면 Sonnet 수준으로 급락함
  - Opus 5는 Sol Max만큼 지능적이지 않고 일부 작업에서는 Opus 4.8보다도 못해 보임  
    특히 피상적으로 접근해 앱이나 프레임워크 전체를 가르쳐 줘야 하며, 이미 다른 형태로 지원되는 기능을 또 추가하는 식의 어리석은 작업부터 시작함

- 구성 요소 중 **AA-Omniscience Index**가 흥미로움  
  지식 신뢰성과 환각을 측정해 정답에는 보상하고 환각에는 감점하지만 답변 거부에는 감점하지 않으며, 매개변수 규모나 밀도를 대략 보여주는 지표처럼 보임  
  순위는 Claude Fable 5 대체 모델 조합, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash, GPT-5.6 Sol Max 순이며, Gemini 3.x에서는 오래전부터 **대형 모델 특유의 느낌**이 났음
  - Gemini 3.1 Pro는 **지식 작업**에 매우 뛰어나고 Google이 이 부분을 잘 해냈음  
    Gemini 3.6 Flash의 이미지 분석도 탄탄하지만 코딩이나 에이전트 작업에서는 부족함
  - 3.6 Flash가 24점으로 Sol의 22점보다 높은 걸 보면 매개변수 규모의 대리 지표인지는 확신하기 어려움  
    3.x Flash는 단일 TPU 8i에 들어간다고 알려졌고 처리 속도도 234.7토큰/초로 Sol의 64.4, Opus의 56.3보다 압도적이며, 3.1 Pro도 113.9토큰/초로 훨씬 빠름  
    **AA-Omniscience Accuracy**는 초대형 Fable이 61%로 선두이고 Sol, GPT-5.5, Opus 같은 대형 최전선 모델이 뒤따라 예상에 더 부합함  
    Gemini는 코딩 최고점보다 일반 지식과 운영비 효율에 집중한 듯하며, 정규화된 분야별 점수에서는 소프트웨어만 경쟁력이 떨어짐
  - 답변 거부에 감점하지 않는다면 그다지 유용하지 않음
  - 모델 규모보다 **근거 연결(grounding)** 의 영향이 같거나 더 클 수 있으며, Google은 분명한 이유로 이 부분을 매우 잘함

- 기대하기 전에 **지능 대비 비용 행렬**을 봐야 함: [https://artificialanalysis.ai/models?intelligence-index-toke...](<https://artificialanalysis.ai/models?intelligence-index-token-use=intelligence-vs-output-tokens-per-task#price-cost>)
  - 결과 품질까지 고려하면 **GPT-5.6 Sol Max가 모두보다 저렴하다**는 점이 놀라움
  - Max는 추가 추론량이 매우 많으므로 High에서는 해결하는 작업이 얼마나 줄어드는지 궁금함  
    비용은 상당히 낮아질 듯함

- **Meta Muse Spark**를 새롭게 보게 됐음  
  어느 하나에서 최고는 아니지만 순위표 곳곳의 적정 지점에 자리하며 비용과 성능의 균형이 좋음  
  목록에 없는 Poolside Laguna S의 위치도 궁금하며, 개인적으로는 잘 작동하면서 비용 효율적인 모델에 관심이 큼

- 박빙의 1위라도 검열을 뜻하는 ‘안전장치’가 답변을 거부하거나 다른 모델로 낮추지 않도록 조심해야 한다면 효용이 크게 떨어짐  
  이 때문에 기존 작업 흐름 일부를 빼면 Claude 사용을 거의 중단했으며, 61점과 57점 차이보다 **신뢰성**이 중요함  
  검열과 본인이 직접 겪지는 않은 신원 확인까지 고려하면 Claude는 가장 훼손되고 불안정한 모델이며, 최신 버전의 미미한 벤치마크 최적화는 그만한 가치가 없음
  - 어떤 질문을 하기에 그렇게 자주 검열에 걸리는지 궁금함
  - 직접 써 본 바로는 벤치마크만 노린 모델이 전혀 아님  
    모든 모델에 게임 제작 시험을 적용하는데 **Opus 5는 세대가 바뀐 수준의 도약**처럼 느껴졌고, 벤치마크는 정확한 모습을 보여주지 못하므로 직접 시험해야 함
  - 온라인에서 한도나 모델이 개선됐다는 얘기를 보고 Anthropic에 절대 돈을 내지 않겠다는 원칙을 재검토할 때마다 모델 카드를 확인하고 오히려 확신이 강해짐  
    Anthropic이 왜 **자동·무음 하향 전환**에 그토록 집착하는지 모르겠고, 답변 거부 대신 자동으로 성능을 낮추길 원하는 사용자가 한 명이라도 있는지 의문임
  - Claude Opus 5.0에 시험 환경의 PaaS에서 전역 API 키로 웹 앱을 배포하고 데이터를 가져오라고 했더니, 권한이 넓다는 보안 문제를 이유로 거부했음  
    같은 작업을 Opus 4.5~4.8과 Fable, Codex 5.4·5.5, Sol 5.6은 문제없이 처리했음  
    **Opus 5는 지나치게 조심스러워** 생산적으로 쓰기 어렵고 추가 조정이 필요함
  - 어쩌면 의미 있는 일을 하지 않아서일 수 있으며, Terence Tao는 ‘깨어 있는 AI 모델’ 때문에 불평하지 않음

- Opus 5가 4.8처럼 모든 것을 다시 설명하지 않아 좋음  
  GPT-5.6 Sol은 사소한 일에도 **지나치게 깊게 추론**하는 반면 Opus 5는 훌륭한 모델이며 Anthropic이 잘해냈음
  - Sol에 구현 명세를 줬을 때는 매우 잘 처리해서 이 차이를 몰랐음  
    명세 없이 알아서 하라고 하자 2시간 30분 동안 주간 사용량의 30%를 썼지만, 명세를 주면 30분 동안 2%만 사용했고 결과도 구조·길이·검증·범위·비용 모두 더 나았음  
    Sol을 내버려 두면 통제 불능이 되므로 이제 **Sol이 명세를 작성하고 Terra가 구현**하게 하며, 이 방식이 잘 작동하고 전체 사용량도 줄었음

- 더 흥미로운 결과는 Opus 5가 Fable 5 다음으로 **압도적으로 비싼 모델**이라는 사실임  
  GPT-5.6과 Kimi K3는 절반의 비용으로 1~2% 차이의 비슷한 점수를 냄
  - 차트는 가격에 민감하지 않은 기업 사용자가 주로 쓰는 Max 추론 노력을 기준으로 함  
    Medium에서는 비용이 K3의 거의 절반까지 내려가고, 코딩 작업의 **95%에는 충분할 가능성**이 큼

- 어느 편도 아니지만 이 결과에서는 **GPT-5.6 Sol Max**가 더 좋아 보임  
  거의 같은 성능을 절반가량의 비용으로 제공하며, Opus 5도 GPT-5.6보다 이렇게 비싼 걸 보면 Fable의 가격이 얼마나 높은지 드러남
  - 제대로 비교하려면 **Opus High와 Sol Max**를 비교해야 함
