1P by GN⁺ | ★ favorite | 댓글 1개
  • 평가된 170개 모델 중 Claude Opus 5 Adaptive Reasoning·Max Effort가 Intelligence Index 61점으로 1위를 차지했으며, Xhigh Effort와 Claude Fable 5가 각각 60점으로 뒤를 이음
  • Intelligence Index v4.1은 에이전트 작업·코딩·과학 추론·지식 신뢰성·장문맥 추론을 다루는 9개 평가를 결합하고, 추론 모델의 확장 사고 시간도 성능 측정에 반영함
  • 출력 속도는 Mercury 2가 901.6 tokens/s로 가장 빠르고, 첫 토큰 지연은 Gemini 2.5 Flash-Lite가 0.34초로 가장 짧으며, Llama 4 Scout는 10M 토큰의 최대 문맥 창을 제공함
  • 가격은 토큰 단가뿐 아니라 입력·캐시 적중·캐시 쓰기·추론·답변 토큰을 가중한 작업당 비용으로 비교하며, 캐시 쓰기와 저장 비용은 제공업체마다 다름
  • 공개 가중치 모델 중 GLM-5.2 (max) 가 51점으로 가장 높지만 전체 1위보다 10점 낮아, 모델 선택에는 지능과 함께 비용·속도·지연·문맥 창을 고려해야 함

Claude Opus 5의 지능 순위

  • Claude Opus 5 (Adaptive Reasoning, Max Effort) 는 Intelligence Index 61점으로 평가된 170개 모델 가운데 1위임
  • 상위 5개 모델은 다음과 같음
    • Claude Opus 5 (Adaptive Reasoning, Max Effort): 61점
    • Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60점
    • Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60점
    • GPT-5.6 Sol (max): 59점
    • Claude Opus 5 (Adaptive Reasoning, High Effort): 59점
  • Max Effort 구성은 126개 추론 모델 중에서도 1위이며, 추론 모델은 답변 전에 복잡한 문제를 처리하기 위한 확장 사고를 수행함

Intelligence Index v4.1의 평가 구성

  • Intelligence Index v4.1은 다음 9개 평가를 결합함
    • GDPval-AA v2: 에이전트 기반 실제 업무
    • 𝜏³-Banking: 에이전트 도구 사용
    • Terminal-Bench v2.1: 에이전트 코딩 및 터미널 사용
    • SciCode: 코딩
    • Humanity's Last Exam: 추론 및 지식
    • GPQA Diamond: 과학적 추론
    • CritPt: 물리학 추론
    • AA-Omniscience: 지식 정확도와 비환각률
    • AA-LCR: 장문맥 추론
  • 용도에 따라 종합 지능 점수보다 특정 평가 결과가 더 중요할 수 있음
  • 별도 평가 항목에는 다음 벤치마크도 포함됨
    • AA-Briefcase: 에이전트 지식 업무
    • AutomationBench-AA: 에이전트 SaaS 워크플로
    • Harvey LAB-AA: 법률 에이전트 업무
    • EnterpriseOps-Gym-AA: 에이전트 비즈니스 운영
    • IFBench: 지시 준수
    • APEX-Agents-AA: 장기 에이전트 작업
    • ITBench-AA: Kubernetes 사고 근본 원인 분석
    • MMMU-Pro: 시각적 추론

지식 업무·신뢰성·개방성 지표

  • AA-Briefcase Elo는 분석 품질 Elo, 프레젠테이션 Elo, 평가 기준 통과율을 결합함
    • 통과율은 합성 일대일 대결을 통해 Elo로 변환함
    • Elo와 95% 신뢰구간 경계는 0 미만이 되지 않도록 제한함
  • AA-Omniscience Index는 지식 신뢰성과 환각을 -100~100점으로 측정함
    • 정답에는 보상하고 환각에는 벌점을 부여하지만, 답변 거부에는 벌점이 없음
    • 0점은 정답과 오답 수가 같고, 음수는 오답이 정답보다 많다는 뜻임
  • Openness Index는 모델의 개방성을 0~100의 정규화 점수로 평가하며, 높을수록 더 개방적임
  • 가중치 공개 여부를 구분하고, 가중치는 공개됐지만 상업적 이용에 유료 라이선스 등이 필요한 모델은 Commercial Use Restricted로 표시함

공개 가중치 모델 순위

  • 평가된 170개 모델 중 94개가 공개 가중치 모델임
  • 공개 가중치 모델의 Intelligence Index 상위권은 다음과 같음
    • GLM-5.2 (max): 51점
    • MiniMax-M3: 44점
    • DeepSeek V4 Pro (Reasoning, Max Effort): 44점
  • GLM-5.2 (max)가 공개 가중치 모델 중 가장 높은 점수를 기록함

출력 속도와 작업 처리 시간

  • Mercury 2는 901.6 tokens/s로 출력 속도가 가장 빠름
    • Gemini 3.5 Flash-Lite: 435.1 tokens/s
    • HyperNova 60B 2605: 427.6 tokens/s
    • Granite 4.0 H Small도 상위권에 포함됨
  • 출력 속도는 스트리밍 모델에서 첫 청크를 받은 뒤, 모델이 토큰을 생성하는 동안 수신한 초당 토큰 수
  • Intelligence Index의 작업당 시간은 작업당 출력 토큰 수를 출력 속도로 나누고 각 벤치마크의 상대적 가중치를 적용해 계산함
    • 첫 토큰 도착 시간(TTFT)과 기타 오버헤드는 제외함
  • 자체 API가 있으면 해당 API 성능을 사용하고, Meta Llama처럼 자체 API가 없으면 여러 제공업체의 중앙값을 사용함

지연과 종단 간 응답 시간

  • 첫 답변 토큰 도착 시간이 가장 짧은 모델은 Gemini 2.5 Flash-Lite (Non-reasoning) 로 0.34초임
    • Command A+: 0.42초
    • North Mini Code: 0.49초
    • Gemini 2.5 Flash도 지연이 짧은 모델에 포함됨
  • 첫 토큰 지연은 API 요청 후 첫 답변 토큰을 받을 때까지 걸리는 시간임
    • 추론 모델에서는 답변 전 사고 시간도 포함함
    • 스트리밍을 지원하지 않는 모델에는 전체 응답을 받는 시간이 적용됨
  • 500토큰 종단 간 응답 시간은 다음 요소를 합산함
    • 첫 응답 토큰을 받기까지의 입력 시간
    • 추론 모델이 답변 전에 사용하는 사고 시간
    • 출력 속도에 기반해 500개 답변 토큰을 생성하는 시간
  • 사고 토큰 수는 서로 다른 60개 프롬프트에서 측정한 평균을 사용함

가격과 작업당 비용

  • 가격 비교에는 캐시 적중·입력·출력 토큰의 100만 토큰당 달러 단가를 사용함
  • 목록에서 Devstral 2와 North Mini Code는 100만 토큰당 $0.00으로 표시되며, Gemma 3 4B와 Gemma 3 27B가 뒤를 이음
  • 혼합 단가 기준 가장 저렴한 모델은 다음과 같음
    • Nova Micro: $0.03/1M tokens
    • Sarvam 30B (high): $0.03/1M tokens
    • Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
  • Intelligence Index 작업당 비용은 각 평가의 입력·캐시 적중·캐시 쓰기·추론·답변 토큰 가격을 작업 수로 나누고, Index 내 평가 가중치를 적용함
  • 전체 Index 실행 비용은 반복 실행을 제외한 평가별 토큰 사용량과 각 토큰 유형의 가격으로 계산함
  • 표시된 캐시 혼합 가격은 캐시 적중 비용만 사용하며, 다른 캐시 비용은 제공업체마다 다름
    • Anthropic은 캐시 쓰기 비용을 별도로 부과하며, 5분과 1시간 TTL의 요율이 다르고 1시간이 더 비쌈
    • Google Vertex/Gemini는 캐시 적중 가격 외에 시간당 저장 비용을 부과함
    • 일부 제공업체는 200K 토큰을 넘는 프롬프트에 구간별 가격을 적용함
    • OpenAI와 DeepSeek 등은 일반적으로 쓰기·저장 비용 없이 캐시 적중 가격만 부과함

토큰 사용량과 문맥 창

  • 작업당 출력 토큰 수는 각 평가의 출력 토큰에 Intelligence Index 내 상대적 가중치를 곱한 뒤, 반복을 제외한 작업 수로 나눠 계산함
  • 문맥 창 상위 모델은 다음과 같음
    • Llama 4 Scout: 10M 토큰
    • Grok 4.20 0309: 2M 토큰
    • Gemini 1.5 Pro (May)
    • Grok 4.1 Fast
  • 문맥 창은 입력과 출력 토큰을 합친 최대 한도이며, 출력 토큰 한도는 일반적으로 이보다 훨씬 작고 모델마다 다름
  • 큰 문맥 창은 대량 데이터에서 정보를 검색하고 추론하는 RAG 워크플로와 관련됨

공개 가중치 모델의 크기

  • 모델 크기는 학습 가능한 가중치와 편향을 합한 전체 파라미터와 실제 추론에서 실행되는 활성 파라미터로 구분함
  • Mixture of Experts 모델은 라우팅 메커니즘이 토큰마다 일부 전문가만 선택하므로 활성 파라미터가 전체보다 적음
  • Dense 모델은 모든 파라미터를 사용하므로 활성 파라미터와 전체 파라미터가 같음

비교 범위와 활용법

  • 모델은 지능, 가격, 출력 속도, 첫 토큰 지연, 종단 간 응답 시간, 문맥 창 크기 등 여러 차원에서 비교됨
  • 성능 지표는 586개 모델을 대상으로 표준화된 프롬프트를 사용해 직접 측정함
  • 각 모델의 상세 페이지에서 세부 지표와 유사 모델 간 직접 비교를 확인할 수 있으며, 모델 선택기로 차트에 표시할 모델을 조정할 수 있음

댓글과 토론

Hacker News 의견들
  • 이 순위표는 최종 사용자가 어떤 모델을 언제 쓸지 결정하는 데 사실상 무의미해졌음
    모델마다 특정 분야와 작업에서 강점과 약점이 달라 단일 지표 순위는 쓸모가 없고, 이제는 ‘최고의 모델’ 하나도 없으며 작업 복잡도에 따라 최고 모델이 필요하지 않을 수도 있음
    예컨대 UI 디자인에는 Fable, 백엔드 시스템 설계에는 Sol, 취약점 개발에는 Kimi K3를 쓸 수 있으며, 이런 지표는 결국 모델 회사의 과시용 숫자에 가까움

    • 1년 전 새 ‘최고 모델’이 나와 기대하며 파일 3개를 사소하게 수정하는 간단한 프로그래밍 작업을 시켰고 잘 처리했음
      그런데 같은 계열의 더 오래되고 작은 모델도 잘 처리하면서 3배 빠르고 비용은 9분의 1이었고, 그 순간 깨달음을 얻었음
    • 기술 스택별 벤치마크가 있으면 좋겠음
      2026년에 Elixir/Phoenix 프로젝트를 가장 관용적인 방식으로 잘 처리하는 모델이 무엇인지처럼 다소 주관적이더라도, 모든 모델을 계속 직접 비교하기 어렵고 성능 차이도 큰 상황에서는 유용할 수 있음
    • ‘완전히 무의미하다’거나 ‘유일한 목적’이라는 표현은 과장임
      모든 통계에 왜곡은 있지만 아무것도 모르는 것보다는 낫고, 벤치마크가 여러 작업의 평균을 보여준다는 건 통계가 본래 요약을 위한 것이라는 뜻임
    • 링크를 열어 보면 단일 지표만 있는 게 아니라 판단에 필요한 모든 지표가 실제로 제공됨
    • Artificial Analysis의 작업당 비용이나 환각 발생 빈도 같은 차트에는 가치가 있음
      다만 이를 하나의 결과로 합치면 모든 미묘한 차이가 사라지고 과시용 순위만 남음
  • Google 경영진이라면 일이 많아서뿐 아니라 사람들 앞에 보이기 부끄러워서 사무실에서 자야 하는 것 아닌가 싶음

    • 보조금을 태우며 손해 보지 않는 유일한 업체라서 오히려 편히 잘 수 있음
    • Google은 가장 지능적인 AI보다 모든 제품에서 수익화할 수 있는 속도를 더 중시하는 듯함
      오래전부터 질문에 정확한 답을 가장 빠르게 제공하는 것이 최우선이라고 밝혀 왔음
    • Google이 OpenAI나 Anthropic처럼 지능을 극대화한 모델로 경쟁하려는지도 의문임
      셋 중 AGI를 숭배하며 고행하지 않는 유일한 회사처럼 보임
    • GPQA Diamond 벤치마크에서는 공동 1위임: https://artificialanalysis.ai/evaluations/gpqa-diamond
      어쩌면 이것만이 목표일 수도 있음
    • Gemini 모델도 여러 부문에서 선두이거나 선두권이라, 부끄러울 만큼 뒤처졌다는 결론은 맞지 않아 보임
  • 지능 지수 상위권은 Claude Opus 5 Max 61점, Opus 5 Xhigh 60점, Claude Fable 5 Max와 Opus 4.8 대체 모델 조합 60점, GPT-5.6 Sol Max 59점, Opus 5 High 59점임
    따라서 Opus 5 Xhigh가 Sol Max보다 높고, Opus 5 High는 Sol Max와 같으니 두 모델의 가격과 속도 차이가 궁금함

    • Artificial Analysis의 작업당 지능 대비 비용과 시간 그래프에서는 Opus 5 High와 Sol Max의 비용·시간이 대략 비슷함
      DeepSwe에서는 Opus 5가 Fable을 이기지만 Sol에는 밀리며, FrontierCode에서는 모두 압도하다가 추론 노력을 Medium보다 높이면 Sonnet 수준으로 급락함
    • Opus 5는 Sol Max만큼 지능적이지 않고 일부 작업에서는 Opus 4.8보다도 못해 보임
      특히 피상적으로 접근해 앱이나 프레임워크 전체를 가르쳐 줘야 하며, 이미 다른 형태로 지원되는 기능을 또 추가하는 식의 어리석은 작업부터 시작함
  • 구성 요소 중 AA-Omniscience Index가 흥미로움
    지식 신뢰성과 환각을 측정해 정답에는 보상하고 환각에는 감점하지만 답변 거부에는 감점하지 않으며, 매개변수 규모나 밀도를 대략 보여주는 지표처럼 보임
    순위는 Claude Fable 5 대체 모델 조합, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash, GPT-5.6 Sol Max 순이며, Gemini 3.x에서는 오래전부터 대형 모델 특유의 느낌이 났음

    • Gemini 3.1 Pro는 지식 작업에 매우 뛰어나고 Google이 이 부분을 잘 해냈음
      Gemini 3.6 Flash의 이미지 분석도 탄탄하지만 코딩이나 에이전트 작업에서는 부족함
    • 3.6 Flash가 24점으로 Sol의 22점보다 높은 걸 보면 매개변수 규모의 대리 지표인지는 확신하기 어려움
      3.x Flash는 단일 TPU 8i에 들어간다고 알려졌고 처리 속도도 234.7토큰/초로 Sol의 64.4, Opus의 56.3보다 압도적이며, 3.1 Pro도 113.9토큰/초로 훨씬 빠름
      AA-Omniscience Accuracy는 초대형 Fable이 61%로 선두이고 Sol, GPT-5.5, Opus 같은 대형 최전선 모델이 뒤따라 예상에 더 부합함
      Gemini는 코딩 최고점보다 일반 지식과 운영비 효율에 집중한 듯하며, 정규화된 분야별 점수에서는 소프트웨어만 경쟁력이 떨어짐
    • 답변 거부에 감점하지 않는다면 그다지 유용하지 않음
    • 모델 규모보다 근거 연결(grounding) 의 영향이 같거나 더 클 수 있으며, Google은 분명한 이유로 이 부분을 매우 잘함
  • 기대하기 전에 지능 대비 비용 행렬을 봐야 함: https://artificialanalysis.ai/models?intelligence-index-toke...

    • 결과 품질까지 고려하면 GPT-5.6 Sol Max가 모두보다 저렴하다는 점이 놀라움
    • Max는 추가 추론량이 매우 많으므로 High에서는 해결하는 작업이 얼마나 줄어드는지 궁금함
      비용은 상당히 낮아질 듯함
  • Meta Muse Spark를 새롭게 보게 됐음
    어느 하나에서 최고는 아니지만 순위표 곳곳의 적정 지점에 자리하며 비용과 성능의 균형이 좋음
    목록에 없는 Poolside Laguna S의 위치도 궁금하며, 개인적으로는 잘 작동하면서 비용 효율적인 모델에 관심이 큼

  • 박빙의 1위라도 검열을 뜻하는 ‘안전장치’가 답변을 거부하거나 다른 모델로 낮추지 않도록 조심해야 한다면 효용이 크게 떨어짐
    이 때문에 기존 작업 흐름 일부를 빼면 Claude 사용을 거의 중단했으며, 61점과 57점 차이보다 신뢰성이 중요함
    검열과 본인이 직접 겪지는 않은 신원 확인까지 고려하면 Claude는 가장 훼손되고 불안정한 모델이며, 최신 버전의 미미한 벤치마크 최적화는 그만한 가치가 없음

    • 어떤 질문을 하기에 그렇게 자주 검열에 걸리는지 궁금함
    • 직접 써 본 바로는 벤치마크만 노린 모델이 전혀 아님
      모든 모델에 게임 제작 시험을 적용하는데 Opus 5는 세대가 바뀐 수준의 도약처럼 느껴졌고, 벤치마크는 정확한 모습을 보여주지 못하므로 직접 시험해야 함
    • 온라인에서 한도나 모델이 개선됐다는 얘기를 보고 Anthropic에 절대 돈을 내지 않겠다는 원칙을 재검토할 때마다 모델 카드를 확인하고 오히려 확신이 강해짐
      Anthropic이 왜 자동·무음 하향 전환에 그토록 집착하는지 모르겠고, 답변 거부 대신 자동으로 성능을 낮추길 원하는 사용자가 한 명이라도 있는지 의문임
    • Claude Opus 5.0에 시험 환경의 PaaS에서 전역 API 키로 웹 앱을 배포하고 데이터를 가져오라고 했더니, 권한이 넓다는 보안 문제를 이유로 거부했음
      같은 작업을 Opus 4.5~4.8과 Fable, Codex 5.4·5.5, Sol 5.6은 문제없이 처리했음
      Opus 5는 지나치게 조심스러워 생산적으로 쓰기 어렵고 추가 조정이 필요함
    • 어쩌면 의미 있는 일을 하지 않아서일 수 있으며, Terence Tao는 ‘깨어 있는 AI 모델’ 때문에 불평하지 않음
  • Opus 5가 4.8처럼 모든 것을 다시 설명하지 않아 좋음
    GPT-5.6 Sol은 사소한 일에도 지나치게 깊게 추론하는 반면 Opus 5는 훌륭한 모델이며 Anthropic이 잘해냈음

    • Sol에 구현 명세를 줬을 때는 매우 잘 처리해서 이 차이를 몰랐음
      명세 없이 알아서 하라고 하자 2시간 30분 동안 주간 사용량의 30%를 썼지만, 명세를 주면 30분 동안 2%만 사용했고 결과도 구조·길이·검증·범위·비용 모두 더 나았음
      Sol을 내버려 두면 통제 불능이 되므로 이제 Sol이 명세를 작성하고 Terra가 구현하게 하며, 이 방식이 잘 작동하고 전체 사용량도 줄었음
  • 더 흥미로운 결과는 Opus 5가 Fable 5 다음으로 압도적으로 비싼 모델이라는 사실임
    GPT-5.6과 Kimi K3는 절반의 비용으로 1~2% 차이의 비슷한 점수를 냄

    • 차트는 가격에 민감하지 않은 기업 사용자가 주로 쓰는 Max 추론 노력을 기준으로 함
      Medium에서는 비용이 K3의 거의 절반까지 내려가고, 코딩 작업의 95%에는 충분할 가능성이 큼
  • 어느 편도 아니지만 이 결과에서는 GPT-5.6 Sol Max가 더 좋아 보임
    거의 같은 성능을 절반가량의 비용으로 제공하며, Opus 5도 GPT-5.6보다 이렇게 비싼 걸 보면 Fable의 가격이 얼마나 높은지 드러남

    • 제대로 비교하려면 Opus High와 Sol Max를 비교해야 함