- 최대 추론 설정이 AAII에서 50점을 기록해, Kimi K3 (max) 와 GLM-5.2 (max)에 이어 3위임
- 2,840억 개 전체 파라미터 중 토큰마다 130억 개만 활성화하는 MoE 모델이며, 텍스트 입출력과 100만 토큰 컨텍스트를 지원함
- API 가격은 100만 토큰당 입력 $0.14, 출력 $0.28, 캐시 적중 $0.003이며, Intelligence Index 전체 평가 비용은 $72.02였음
- 평가 과정에서 출력 토큰 2억 1,000만 개를 사용해 동급 모델 중앙값 1억 개보다 훨씬 장황했으며, 출력 속도는 아직 공개되지 않음
- 모델 가중치를 공개하고 MIT 라이선스를 적용해 자체 호스팅과 상업적 이용이 가능하며, 현재 API 제공자는 1곳임
모델 구성과 공개 방식
- DeepSeek V4 Flash 0731은 2026년 7월 31일 공개된 추론형 오픈 웨이트 모델임
- 전체 파라미터는 2,840억 개이며, 추론 중 토큰마다 130억 개가 활성화되는 Mixture of Experts(MoE) 구조를 사용함
- 모델 가중치를 내려받아 자체 호스팅할 수 있음
- MIT 라이선스를 적용해 상업적 이용이 허용됨
- 최대 추론 노력(Max Effort)을 사용하는 추론 버전이며, 별도의 비추론 버전이 존재할 수 있음
지능 평가
- Artificial Analysis Intelligence Index v4.1에서 50점을 기록함
- Kimi K3 (max), GLM-5.2 (max) 에 이어 3위. 그 뒤로 Kimi K3 (low), MiniMax-M3 가 4/5위
- 동급 대형 오픈 웨이트 모델 중앙값은 25점임
- Artificial Analysis는 이를 지능 측면의 선도권 모델군으로 분류함
- Intelligence Index v4.1은 다음 9개 평가를 결합함
- GDPval-AA v2: 에이전트형 실제 업무
- 𝜏³-Banking: 에이전트형 도구 사용
- Terminal-Bench v2.1: 에이전트형 코딩/터미널 사용
- SciCode: 코딩
- Humanity's Last Exam: 추론/지식
- GPQA Diamond: 과학적 추론
- CritPt: 물리학 추론
- AA-Omniscience: 지식 정확도와 환각 억제
- AA-LCR: 긴 컨텍스트 추론
추가 벤치마크 범위
- 모델별 세부 용도를 비교할 수 있도록 다음 평가 결과도 제공함
- AA-Briefcase: 에이전트형 지식 업무
- AutomationBench-AA: SaaS 업무 자동화
- Harvey LAB-AA: 법률 에이전트 업무
- EnterpriseOps-Gym-AA: 기업 운영 업무
- IFBench: 지시 준수
- APEX-Agents-AA: 장시간 에이전트 작업
- ITBench-AA: Kubernetes 장애 원인 분석
- MMMU-Pro: 시각적 추론
- DeepSeek V4 Flash 0731은 이미지 입력을 지원하지 않으므로 텍스트 전용 모델이며 멀티모달 모델이 아님
지식 신뢰성과 환각 평가
- AA-Omniscience Index는 정확한 답변에 점수를 주고 환각에 불이익을 적용하며, 답변 거부에는 불이익을 주지 않음
- 점수 범위는 -100에서 100까지임
- 0점은 정답과 오답 수가 같음을 뜻함
- 음수는 정답보다 오답이 더 많음을 뜻함
토큰 사용량과 응답 특성
- Intelligence Index 전체 평가에서 2억 1,000만 출력 토큰을 생성함
- 동급 오픈 웨이트 모델 중앙값은 1억 토큰임
- Artificial Analysis는 이를 매우 장황한 수준으로 분류함
- 작업당 출력 토큰 수는 각 벤치마크의 출력량에 Intelligence Index 가중치를 적용하고, 반복 실행을 제외한 작업 수로 나눠 계산함
- 출력 속도는 아직 측정되지 않아 초당 출력 토큰 수가 공개되지 않음
API 가격과 평가 비용
- DeepSeek API 기준 가격은 다음과 같음
- 입력: 100만 토큰당 $0.14
- 출력: 100만 토큰당 $0.28
- 캐시 적중: 100만 토큰당 $0.003
- 캐시 적중/입력/출력을 7:2:1로 혼합하면 100만 토큰당 가격은 $0.06임
- Intelligence Index 전체 평가 비용은 $72.02였음
- 요약 영역은 비교 모델 중앙값을 입력 $0.43/출력 $1.20으로 표시하고, FAQ 영역은 입력 $0.58/출력 $2.20으로 표시함
- 작업당 비용은 입력, 캐시 적중, 캐시 기록, 추론, 최종 답변 토큰 비용을 작업 수로 나눈 뒤 각 벤치마크의 Index 가중치를 적용해 계산함
- 캐시 기록과 저장 비용은 API 제공자에 따라 별도로 부과될 수 있음
컨텍스트와 제공 범위
- 컨텍스트 창은 100만 토큰으로, 12포인트 Arial 기준 약 A4 1,500페이지 분량임
- 대규모 문서 검색과 추론이 필요한 RAG 워크플로우에 사용할 수 있음
- 텍스트 입력과 텍스트 출력만 지원함
- 현재 API를 제공하는 사업자는 1곳이며, 제공자별 가격은 달라질 수 있음