# DeepSeek V4 Flash 0731의 지능·성능·가격 분석

> Clean Markdown view of GeekNews topic #32020. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=32020](https://news.hada.io/topic?id=32020)
- GeekNews Markdown: [https://news.hada.io/topic/32020.md](https://news.hada.io/topic/32020.md)
- Type: GN+
- Author: [neo](https://news.hada.io/@neo)
- Published: 2026-08-01T01:31:18+09:00
- Updated: 2026-08-01T01:31:18+09:00
- Original source: [artificialanalysis.ai](https://artificialanalysis.ai/models/deepseek-v4-flash)
- Points: 1
- Comments: 1

## Topic Body

- 최대 추론 설정이 AAII에서 50점을 기록해, Kimi K3 (max) 와 GLM-5.2 (max)에 이어 3위임  
- 2,840억 개 전체 파라미터 중 토큰마다 **130억 개만 활성화**하는 MoE 모델이며, 텍스트 입출력과 100만 토큰 컨텍스트를 지원함  
- API 가격은 100만 토큰당 입력 **$0.14**, 출력 **$0.28**, 캐시 적중 $0.003이며, Intelligence Index 전체 평가 비용은 $72.02였음  
- 평가 과정에서 출력 토큰 2억 1,000만 개를 사용해 동급 모델 중앙값 1억 개보다 훨씬 장황했으며, 출력 속도는 아직 공개되지 않음  
- 모델 가중치를 공개하고 **MIT 라이선스**를 적용해 자체 호스팅과 상업적 이용이 가능하며, 현재 API 제공자는 1곳임  
  
---  
  
### 모델 구성과 공개 방식  
  
- **DeepSeek V4 Flash 0731**은 2026년 7월 31일 공개된 추론형 오픈 웨이트 모델임  
- 전체 파라미터는 2,840억 개이며, 추론 중 토큰마다 130억 개가 활성화되는 **Mixture of Experts(MoE)** 구조를 사용함  
- [모델 가중치](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)를 내려받아 자체 호스팅할 수 있음  
- [MIT 라이선스](https://opensource.org/license/mit)를 적용해 상업적 이용이 허용됨  
- 최대 추론 노력(Max Effort)을 사용하는 추론 버전이며, 별도의 비추론 버전이 존재할 수 있음  
  
### 지능 평가  
  
- Artificial Analysis Intelligence Index v4.1에서 **50점**을 기록함  
  - Kimi K3 (max), GLM-5.2 (max) 에 이어 3위. 그 뒤로 Kimi K3 (low), MiniMax-M3 가 4/5위  
  - 동급 대형 오픈 웨이트 모델 중앙값은 25점임  
  - Artificial Analysis는 이를 지능 측면의 선도권 모델군으로 분류함  
- Intelligence Index v4.1은 다음 9개 평가를 결합함  
  - GDPval-AA v2: 에이전트형 실제 업무  
  - 𝜏³-Banking: 에이전트형 도구 사용  
  - Terminal-Bench v2.1: 에이전트형 코딩/터미널 사용  
  - SciCode: 코딩  
  - Humanity's Last Exam: 추론/지식  
  - GPQA Diamond: 과학적 추론  
  - CritPt: 물리학 추론  
  - AA-Omniscience: 지식 정확도와 환각 억제  
  - AA-LCR: 긴 컨텍스트 추론  
  
### 추가 벤치마크 범위  
  
- 모델별 세부 용도를 비교할 수 있도록 다음 평가 결과도 제공함  
  - AA-Briefcase: 에이전트형 지식 업무  
  - AutomationBench-AA: SaaS 업무 자동화  
  - Harvey LAB-AA: 법률 에이전트 업무  
  - EnterpriseOps-Gym-AA: 기업 운영 업무  
  - IFBench: 지시 준수  
  - APEX-Agents-AA: 장시간 에이전트 작업  
  - ITBench-AA: Kubernetes 장애 원인 분석  
  - MMMU-Pro: 시각적 추론  
- DeepSeek V4 Flash 0731은 이미지 입력을 지원하지 않으므로 텍스트 전용 모델이며 멀티모달 모델이 아님  
  
### 지식 신뢰성과 환각 평가  
  
- **AA-Omniscience Index**는 정확한 답변에 점수를 주고 환각에 불이익을 적용하며, 답변 거부에는 불이익을 주지 않음  
- 점수 범위는 -100에서 100까지임  
  - 0점은 정답과 오답 수가 같음을 뜻함  
  - 음수는 정답보다 오답이 더 많음을 뜻함  
  
### 토큰 사용량과 응답 특성  
  
- Intelligence Index 전체 평가에서 **2억 1,000만 출력 토큰**을 생성함  
  - 동급 오픈 웨이트 모델 중앙값은 1억 토큰임  
  - Artificial Analysis는 이를 매우 장황한 수준으로 분류함  
- 작업당 출력 토큰 수는 각 벤치마크의 출력량에 Intelligence Index 가중치를 적용하고, 반복 실행을 제외한 작업 수로 나눠 계산함  
- 출력 속도는 아직 측정되지 않아 초당 출력 토큰 수가 공개되지 않음  
  
### API 가격과 평가 비용  
  
- DeepSeek API 기준 가격은 다음과 같음  
  - 입력: 100만 토큰당 **$0.14**  
  - 출력: 100만 토큰당 **$0.28**  
  - 캐시 적중: 100만 토큰당 **$0.003**  
- 캐시 적중/입력/출력을 7:2:1로 혼합하면 100만 토큰당 가격은 $0.06임  
- Intelligence Index 전체 평가 비용은 **$72.02**였음  
- 요약 영역은 비교 모델 중앙값을 입력 $0.43/출력 $1.20으로 표시하고, FAQ 영역은 입력 $0.58/출력 $2.20으로 표시함  
- 작업당 비용은 입력, 캐시 적중, 캐시 기록, 추론, 최종 답변 토큰 비용을 작업 수로 나눈 뒤 각 벤치마크의 Index 가중치를 적용해 계산함  
- 캐시 기록과 저장 비용은 API 제공자에 따라 별도로 부과될 수 있음  
  
### 컨텍스트와 제공 범위  
  
- 컨텍스트 창은 **100만 토큰**으로, 12포인트 Arial 기준 약 A4 1,500페이지 분량임  
- 대규모 문서 검색과 추론이 필요한 RAG 워크플로우에 사용할 수 있음  
- 텍스트 입력과 텍스트 출력만 지원함  
- 현재 API를 제공하는 사업자는 1곳이며, 제공자별 가격은 달라질 수 있음

## Comments



### Comment 62684

- Author: neo
- Created: 2026-08-01T01:31:20+09:00
- Points: 1

###### [Hacker News 의견들](https://news.ycombinator.com/item?id=49120299) 
- **모델 가중치**가 방금 공개됨: [https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731](<https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731>)
  - DwarfStar 양자화 버전이 기대됨. 128GB MacBook Pro에서 DeepSeek V4 Flash 미리보기를 몇 달간 주력 코딩 에이전트로 사용했는데, 거의 모든 지표에서 **GLM 5.2**보다 뛰어나 보임
  - 128×128 행렬 곱셈 프리미티브를 갖춘 하드웨어 가속기를 겨냥하는데, H100의 **Warp Group Matrix Multiply Accumulate**를 뜻하는지 궁금함
  - **165GB 미만 Unsloth GGUF**라면 256GB RAM을 갖춘 CPU 전용 시스템 대부분에서 실행 가능함. `llama-server`로 32GB·48GB·96GB GPU에 최대한 올리고 나머지를 시스템 DRAM에 배치하는 혼합 구성도 가능함  
    [https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF](<https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF>)

- 새 DeepSeek 모델은 크리스마스 선물 같음. **저가 API 모델**은 DeepSeek가 가장 잘하며, VRAM 가격이 로컬 실행이 가능할 만큼 내려가기 전까지는 이 방식이 최선임  
  보조금에 의존하는 구독 모델은 오래가기 어렵고, API 과금이 지속 가능한 사업 모델에 더 가까워 보임
  - 프로젝트 하나에 DeepSeek를 쓰는데, **수천만 토큰을 몇 센트**에 사용할 수 있다는 점이 놀라움. 모든 작업에 적합하지는 않지만 특정 작업은 사실상 무료에 가까운 비용으로 탁월하게 처리함
  - 중국이 메모리와 연산 하드웨어를 따라잡아 미국 기업을 **가격과 성능 모두에서** 압도할 날이 기대됨
  - 동료 개발자들은 Claude 토큰을 한 시간 만에 소진한다고 불평하지만, 나는 **DS Flash**를 하루 종일 사용함. 가끔 틀리면 그때 어려운 작업에만 Claude 같은 모델을 꺼내면 됨
  - 토큰당으로 따져도 **DeepSeek API**가 구독보다 비용 효율적일 가능성이 큼. 직접 시험해 보니 Flash는 지시 준수 능력이 크게 좋아졌고 더 능동적으로 변해, 현재 비용 효율 면에서 견줄 모델이 거의 없음
  - 직접 가격을 살펴보면 GPT 5.6 Luna와 같은 결과를 내려면 토큰이 **5배** 필요하고 초당 토큰 수도 훨씬 낮음. 그래도 DeepSeek의 압박 덕분에 기존 업체들이 계속 최적화하게 된다는 효과는 분명함

- 기존 주소는 404이며 올바른 URL은 다음으로 보임: [https://artificialanalysis.ai/models/deepseek-v4-flash](<https://artificialanalysis.ai/models/deepseek-v4-flash>)

- 어제 공개된 OpenAI 차트에 **DeepSeek V4 Flash 0731** 데이터 포인트를 추가했으며, 가격·성능 프런티어에 위치함  
  [https://files.parasmittal.com/openai_aa_luna_dsflash.svg](<https://files.parasmittal.com/openai_aa_luna_dsflash.svg>)  
  원본: [https://openai.com/index/advancing-the-price-performance-fro...](<https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/>)

- 공개 벤치마크의 코드 에이전트 작업에 아직 출시되지 않은 **DeepSeek Harness 최소 모드**를 사용했다는데, 최적화된 코딩 에이전트 하네스도 발표할 계획인지 궁금함  
  DSv4 Flash를 reasonix나 pi와 함께 쓰면 토큰 걱정 없이 하루 종일 몇 센트로 코딩할 수 있음. 반면 같은 모델을 Fireworks나 OpenRouter에서 ZDR과 함께 쓰면 이유 없이 비용이 계속 올라감. 사용 데이터 수집을 위해 가격을 보조하는 듯하며, 로컬 실행이 가능해질 날을 기다리는 중임
  - OpenRouter를 통하지 않는다면 어느 제공업체에서 구매하는지 궁금함. OpenRouter에 등록된 제공업체라면 직접 구매할 때와 가격이 같다고 알고 있었음
  - 기술 보고서에서 이미 **DeepSeek Harness**를 예고했음. 코드 에이전트 작업은 최소 모드, 최대 추론 노력, `temperature = 1.0`, `top_p = 0.95`로 평가했으며 하네스는 추후 공개 예정임

- RTX PRO 6000 96GB 한 장이나 DGX Spark 128GB 사용자에게는 덜 알려진 **vllm-moet**가 매우 좋은 엔진임. 추론용 대칭 2비트 플레인을 자동 생성하고, 정밀도 복원을 위해 4비트 델타 캐시도 만들며, RAM보다 큰 가중치의 SSD 스트리밍을 지원함  
  각 영역에 할당할 VRAM을 정해 속도와 정밀도의 균형을 조절할 수 있고, DS V4 Flash에서 **초당 170토큰**이 시연됨. 별도 변환 모델 없이 원본 모델을 그대로 사용함  
  DGX Spark에서는 `sm120`과 `sm121` 차이를 무시하는 작은 우회가 필요하지만 `sm121`에서도 실행 가능하므로 몇 시간 투자해 볼 가치가 있음

- **출력 100만 토큰당 0.28달러**에 GLM 5.2·Gemini 3.6급 지능을 제공하며, 업데이트된 Pro 모델도 곧 나올 예정임  
  Unsloth 무손실 Q8이 162GB라 실제로 가정에서도 실행할 만한 크기임
  - 그 정도를 가정에서 돌린다니 어떤 집인지 보고 싶음
  - Q8 크기는 약 **151GB**임

- DeepSeek V4 Flash가 V4 Pro를 능가한다면, 몇 주 안에 **Opus 5급 V4 Pro**도 기대할 수 있는지 궁금함. Opus보다 뛰어나면 더 좋겠음
  - 만들고 있는 앱에 V4 Flash를 사용 중인데, GPT·Opus·Sonnet만 쓰다가 넘어오니 비용 효율과 성능이 놀라움. 비용이 워낙 낮아 수익이 목적이 아닌 앱에 넉넉한 무료 등급도 제공할 수 있음  
    [https://trysojourn.app](<https://trysojourn.app>)
  - **V4 Pro 가격에 Opus 5 성능**이라면 믿기 어려울 정도로 훌륭하겠지만, 아마 꿈에 가까울 듯함
  - 업데이트된 **V4 Pro 최종판**이 곧 공개된다고 밝힌 바 있음

- 정말 흥미로운 부분은 구조 변경 없이 추가 **미세 조정**만으로 큰 성능 향상을 이뤘다는 점임. 더 많은 데이터와 연산, 시간을 투입한 결과임  
  DS V4 Flash는 경쟁하는 모델군에 비하면 비교적 작으므로, 품질 높은 데이터와 학습 파이프라인을 다른 소형 모델에 적용해도 비슷한 향상을 얻을 가능성이 커 보임

- 작업당 가격에서 이미 Luna를 약 **2배 차이**로 앞섬: [https://artificialanalysis.ai/models/deepseek-v4-flash?intel...](<https://artificialanalysis.ai/models/deepseek-v4-flash?intelligence-comparison=intelligence-vs-cost-per-task#intelligence-comparisons>)
  - Luna와 특정 작업 유형별로 어떻게 비교되는지도 보고 싶음
  - 비용이 X축이므로 정확히는 DeepSeek V4 Flash 0731 최대 추론이 작업당 약 0.03달러, 지수 50임. OpenAI Luna는 높은 추론이 0.03달러·지수 46, 초고 추론이 0.04달러·지수 49, 최대 추론이 0.07달러·지수 51임  
    따라서 Luna는 DeepSeek Flash보다 **2~3배 비싸지만 추론 속도는 2~5배 빠르다**고 보는 편이 공정함. DeepSeek를 능가하는 가장 저렴한 OpenAI 모델은 Luna 최대 추론으로, 비슷한 성능에 반올림 전 기준 약 3배 비싸지만 속도 역시 거의 3배 빠름  
    Artificial Analysis가 DeepSeek와 OpenAI에 모두 진한 파란색을 사용한 것은 특히 오늘 같은 날에는 매우 부적절한 색상 선택임
