1P by GN⁺ | ★ favorite | 댓글 1개
  • 최대 추론 설정이 AAII에서 50점을 기록해, Kimi K3 (max) 와 GLM-5.2 (max)에 이어 3위임
  • 2,840억 개 전체 파라미터 중 토큰마다 130억 개만 활성화하는 MoE 모델이며, 텍스트 입출력과 100만 토큰 컨텍스트를 지원함
  • API 가격은 100만 토큰당 입력 $0.14, 출력 $0.28, 캐시 적중 $0.003이며, Intelligence Index 전체 평가 비용은 $72.02였음
  • 평가 과정에서 출력 토큰 2억 1,000만 개를 사용해 동급 모델 중앙값 1억 개보다 훨씬 장황했으며, 출력 속도는 아직 공개되지 않음
  • 모델 가중치를 공개하고 MIT 라이선스를 적용해 자체 호스팅과 상업적 이용이 가능하며, 현재 API 제공자는 1곳임

모델 구성과 공개 방식

  • DeepSeek V4 Flash 0731은 2026년 7월 31일 공개된 추론형 오픈 웨이트 모델임
  • 전체 파라미터는 2,840억 개이며, 추론 중 토큰마다 130억 개가 활성화되는 Mixture of Experts(MoE) 구조를 사용함
  • 모델 가중치를 내려받아 자체 호스팅할 수 있음
  • MIT 라이선스를 적용해 상업적 이용이 허용됨
  • 최대 추론 노력(Max Effort)을 사용하는 추론 버전이며, 별도의 비추론 버전이 존재할 수 있음

지능 평가

  • Artificial Analysis Intelligence Index v4.1에서 50점을 기록함
    • Kimi K3 (max), GLM-5.2 (max) 에 이어 3위. 그 뒤로 Kimi K3 (low), MiniMax-M3 가 4/5위
    • 동급 대형 오픈 웨이트 모델 중앙값은 25점임
    • Artificial Analysis는 이를 지능 측면의 선도권 모델군으로 분류함
  • Intelligence Index v4.1은 다음 9개 평가를 결합함
    • GDPval-AA v2: 에이전트형 실제 업무
    • 𝜏³-Banking: 에이전트형 도구 사용
    • Terminal-Bench v2.1: 에이전트형 코딩/터미널 사용
    • SciCode: 코딩
    • Humanity's Last Exam: 추론/지식
    • GPQA Diamond: 과학적 추론
    • CritPt: 물리학 추론
    • AA-Omniscience: 지식 정확도와 환각 억제
    • AA-LCR: 긴 컨텍스트 추론

추가 벤치마크 범위

  • 모델별 세부 용도를 비교할 수 있도록 다음 평가 결과도 제공함
    • AA-Briefcase: 에이전트형 지식 업무
    • AutomationBench-AA: SaaS 업무 자동화
    • Harvey LAB-AA: 법률 에이전트 업무
    • EnterpriseOps-Gym-AA: 기업 운영 업무
    • IFBench: 지시 준수
    • APEX-Agents-AA: 장시간 에이전트 작업
    • ITBench-AA: Kubernetes 장애 원인 분석
    • MMMU-Pro: 시각적 추론
  • DeepSeek V4 Flash 0731은 이미지 입력을 지원하지 않으므로 텍스트 전용 모델이며 멀티모달 모델이 아님

지식 신뢰성과 환각 평가

  • AA-Omniscience Index는 정확한 답변에 점수를 주고 환각에 불이익을 적용하며, 답변 거부에는 불이익을 주지 않음
  • 점수 범위는 -100에서 100까지임
    • 0점은 정답과 오답 수가 같음을 뜻함
    • 음수는 정답보다 오답이 더 많음을 뜻함

토큰 사용량과 응답 특성

  • Intelligence Index 전체 평가에서 2억 1,000만 출력 토큰을 생성함
    • 동급 오픈 웨이트 모델 중앙값은 1억 토큰임
    • Artificial Analysis는 이를 매우 장황한 수준으로 분류함
  • 작업당 출력 토큰 수는 각 벤치마크의 출력량에 Intelligence Index 가중치를 적용하고, 반복 실행을 제외한 작업 수로 나눠 계산함
  • 출력 속도는 아직 측정되지 않아 초당 출력 토큰 수가 공개되지 않음

API 가격과 평가 비용

  • DeepSeek API 기준 가격은 다음과 같음
    • 입력: 100만 토큰당 $0.14
    • 출력: 100만 토큰당 $0.28
    • 캐시 적중: 100만 토큰당 $0.003
  • 캐시 적중/입력/출력을 7:2:1로 혼합하면 100만 토큰당 가격은 $0.06임
  • Intelligence Index 전체 평가 비용은 $72.02였음
  • 요약 영역은 비교 모델 중앙값을 입력 $0.43/출력 $1.20으로 표시하고, FAQ 영역은 입력 $0.58/출력 $2.20으로 표시함
  • 작업당 비용은 입력, 캐시 적중, 캐시 기록, 추론, 최종 답변 토큰 비용을 작업 수로 나눈 뒤 각 벤치마크의 Index 가중치를 적용해 계산함
  • 캐시 기록과 저장 비용은 API 제공자에 따라 별도로 부과될 수 있음

컨텍스트와 제공 범위

  • 컨텍스트 창은 100만 토큰으로, 12포인트 Arial 기준 약 A4 1,500페이지 분량임
  • 대규모 문서 검색과 추론이 필요한 RAG 워크플로우에 사용할 수 있음
  • 텍스트 입력과 텍스트 출력만 지원함
  • 현재 API를 제공하는 사업자는 1곳이며, 제공자별 가격은 달라질 수 있음

댓글과 토론

Hacker News 의견들
  • 모델 가중치가 방금 공개됨: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • DwarfStar 양자화 버전이 기대됨. 128GB MacBook Pro에서 DeepSeek V4 Flash 미리보기를 몇 달간 주력 코딩 에이전트로 사용했는데, 거의 모든 지표에서 GLM 5.2보다 뛰어나 보임
    • 128×128 행렬 곱셈 프리미티브를 갖춘 하드웨어 가속기를 겨냥하는데, H100의 Warp Group Matrix Multiply Accumulate를 뜻하는지 궁금함
    • 165GB 미만 Unsloth GGUF라면 256GB RAM을 갖춘 CPU 전용 시스템 대부분에서 실행 가능함. llama-server로 32GB·48GB·96GB GPU에 최대한 올리고 나머지를 시스템 DRAM에 배치하는 혼합 구성도 가능함
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • 새 DeepSeek 모델은 크리스마스 선물 같음. 저가 API 모델은 DeepSeek가 가장 잘하며, VRAM 가격이 로컬 실행이 가능할 만큼 내려가기 전까지는 이 방식이 최선임
    보조금에 의존하는 구독 모델은 오래가기 어렵고, API 과금이 지속 가능한 사업 모델에 더 가까워 보임

    • 프로젝트 하나에 DeepSeek를 쓰는데, 수천만 토큰을 몇 센트에 사용할 수 있다는 점이 놀라움. 모든 작업에 적합하지는 않지만 특정 작업은 사실상 무료에 가까운 비용으로 탁월하게 처리함
    • 중국이 메모리와 연산 하드웨어를 따라잡아 미국 기업을 가격과 성능 모두에서 압도할 날이 기대됨
    • 동료 개발자들은 Claude 토큰을 한 시간 만에 소진한다고 불평하지만, 나는 DS Flash를 하루 종일 사용함. 가끔 틀리면 그때 어려운 작업에만 Claude 같은 모델을 꺼내면 됨
    • 토큰당으로 따져도 DeepSeek API가 구독보다 비용 효율적일 가능성이 큼. 직접 시험해 보니 Flash는 지시 준수 능력이 크게 좋아졌고 더 능동적으로 변해, 현재 비용 효율 면에서 견줄 모델이 거의 없음
    • 직접 가격을 살펴보면 GPT 5.6 Luna와 같은 결과를 내려면 토큰이 5배 필요하고 초당 토큰 수도 훨씬 낮음. 그래도 DeepSeek의 압박 덕분에 기존 업체들이 계속 최적화하게 된다는 효과는 분명함
  • 기존 주소는 404이며 올바른 URL은 다음으로 보임: https://artificialanalysis.ai/models/deepseek-v4-flash

  • 어제 공개된 OpenAI 차트에 DeepSeek V4 Flash 0731 데이터 포인트를 추가했으며, 가격·성능 프런티어에 위치함
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    원본: https://openai.com/index/advancing-the-price-performance-fro...

  • 공개 벤치마크의 코드 에이전트 작업에 아직 출시되지 않은 DeepSeek Harness 최소 모드를 사용했다는데, 최적화된 코딩 에이전트 하네스도 발표할 계획인지 궁금함
    DSv4 Flash를 reasonix나 pi와 함께 쓰면 토큰 걱정 없이 하루 종일 몇 센트로 코딩할 수 있음. 반면 같은 모델을 Fireworks나 OpenRouter에서 ZDR과 함께 쓰면 이유 없이 비용이 계속 올라감. 사용 데이터 수집을 위해 가격을 보조하는 듯하며, 로컬 실행이 가능해질 날을 기다리는 중임

    • OpenRouter를 통하지 않는다면 어느 제공업체에서 구매하는지 궁금함. OpenRouter에 등록된 제공업체라면 직접 구매할 때와 가격이 같다고 알고 있었음
    • 기술 보고서에서 이미 DeepSeek Harness를 예고했음. 코드 에이전트 작업은 최소 모드, 최대 추론 노력, temperature = 1.0, top_p = 0.95로 평가했으며 하네스는 추후 공개 예정임
  • RTX PRO 6000 96GB 한 장이나 DGX Spark 128GB 사용자에게는 덜 알려진 vllm-moet가 매우 좋은 엔진임. 추론용 대칭 2비트 플레인을 자동 생성하고, 정밀도 복원을 위해 4비트 델타 캐시도 만들며, RAM보다 큰 가중치의 SSD 스트리밍을 지원함
    각 영역에 할당할 VRAM을 정해 속도와 정밀도의 균형을 조절할 수 있고, DS V4 Flash에서 초당 170토큰이 시연됨. 별도 변환 모델 없이 원본 모델을 그대로 사용함
    DGX Spark에서는 sm120sm121 차이를 무시하는 작은 우회가 필요하지만 sm121에서도 실행 가능하므로 몇 시간 투자해 볼 가치가 있음

  • 출력 100만 토큰당 0.28달러에 GLM 5.2·Gemini 3.6급 지능을 제공하며, 업데이트된 Pro 모델도 곧 나올 예정임
    Unsloth 무손실 Q8이 162GB라 실제로 가정에서도 실행할 만한 크기임

    • 그 정도를 가정에서 돌린다니 어떤 집인지 보고 싶음
    • Q8 크기는 약 151GB
  • DeepSeek V4 Flash가 V4 Pro를 능가한다면, 몇 주 안에 Opus 5급 V4 Pro도 기대할 수 있는지 궁금함. Opus보다 뛰어나면 더 좋겠음

    • 만들고 있는 앱에 V4 Flash를 사용 중인데, GPT·Opus·Sonnet만 쓰다가 넘어오니 비용 효율과 성능이 놀라움. 비용이 워낙 낮아 수익이 목적이 아닌 앱에 넉넉한 무료 등급도 제공할 수 있음
      https://trysojourn.app
    • V4 Pro 가격에 Opus 5 성능이라면 믿기 어려울 정도로 훌륭하겠지만, 아마 꿈에 가까울 듯함
    • 업데이트된 V4 Pro 최종판이 곧 공개된다고 밝힌 바 있음
  • 정말 흥미로운 부분은 구조 변경 없이 추가 미세 조정만으로 큰 성능 향상을 이뤘다는 점임. 더 많은 데이터와 연산, 시간을 투입한 결과임
    DS V4 Flash는 경쟁하는 모델군에 비하면 비교적 작으므로, 품질 높은 데이터와 학습 파이프라인을 다른 소형 모델에 적용해도 비슷한 향상을 얻을 가능성이 커 보임

  • 작업당 가격에서 이미 Luna를 약 2배 차이로 앞섬: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • Luna와 특정 작업 유형별로 어떻게 비교되는지도 보고 싶음
    • 비용이 X축이므로 정확히는 DeepSeek V4 Flash 0731 최대 추론이 작업당 약 0.03달러, 지수 50임. OpenAI Luna는 높은 추론이 0.03달러·지수 46, 초고 추론이 0.04달러·지수 49, 최대 추론이 0.07달러·지수 51임
      따라서 Luna는 DeepSeek Flash보다 2~3배 비싸지만 추론 속도는 2~5배 빠르다고 보는 편이 공정함. DeepSeek를 능가하는 가장 저렴한 OpenAI 모델은 Luna 최대 추론으로, 비슷한 성능에 반올림 전 기준 약 3배 비싸지만 속도 역시 거의 3배 빠름
      Artificial Analysis가 DeepSeek와 OpenAI에 모두 진한 파란색을 사용한 것은 특히 오늘 같은 날에는 매우 부적절한 색상 선택임