- DeepSeek-V4-Flash API 정식 버전이 2026년 7월 31일 공개 베타로 출시됐으며, 기존 호출 방식에서 모델 이름만
deepseek-v4-flash로 지정해 사용할 수 있음 - 에이전트 성능은 V4-Pro-Preview를 크게 앞섰고 Terminal Bench 2.1에서 82.7점을 비롯해 Cybergym 76.7, Toolathlon verified 70.3, DSBench-FullStack 68.7을 기록함
- 코드 에이전트 벤치마크는 출시 예정인 DeepSeek Harness 최소 모드에서 max effort,
top_p=0.95,temperature=1.0조건으로 측정됨 - 정식 V4-Flash는 Responses API 형식을 기본 지원하고 Codex에 맞게 조정됐으며, Preview와 동일한 모델 구조·크기에 재후처리 학습만 적용함
- 변경 범위는 V4-Flash API로 한정되며 V4-Pro API와 APP/WEB 모델은 유지되고, V4-Pro 정식 버전은 곧 출시될 예정임
공개 베타 출시와 API 사용법
- DeepSeek-V4-Flash API 정식 버전이 2026년 7월 31일 공개 베타로 출시됨
- 기존 호출 방식은 그대로 유지되며, 모델 매개변수를
deepseek-v4-flash로 설정하면 최신 버전을 이용할 수 있음 - V4 계열은 기존과 같은
base_url에서 OpenAI ChatCompletions 및 Anthropic 인터페이스로 제공됨- V4-Pro는
deepseek-v4-pro, V4-Flash는deepseek-v4-flash를 사용함 - 기존 모델 이름인
deepseek-chat과deepseek-reasoner는 2026년 7월 24일 중단 예정이었음 - 전환 기간에는 두 이름이 각각 V4-Flash의 비사고 모드와 사고 모드를 가리켰음
- V4-Pro는
에이전트 벤치마크 결과
- V4-Flash 정식 버전은 에이전트 성능에서 V4-Pro-Preview를 크게 웃도는 결과를 기록함
- Terminal Bench 2.1: 82.7
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench Public: 25.1
- DSBench-FullStack: 68.7
- DSBench-Hard: 59.6
- 공개 벤치마크의 코드 에이전트 과제는 출시 예정인 DeepSeek Harness 최소 모드로 측정됨
- effort 수준은 max이며
top_p=0.95,temperature=1.0으로 설정함
- effort 수준은 max이며
- DSBench-FullStack은 내부 풀스택 개발 테스트 세트이고, DSBench-Hard는 내부 코딩 에이전트 고난도 문제 세트임
Responses API와 Codex 연동
- 정식 V4-Flash는 Responses API 형식을 기본 지원하며 Codex에 맞게 조정됨
- Codex 연동에 필요한 설정은 공식 문서에서 확인할 수 있음
모델 변경 범위
DeepSeek-V4-Flash-0731은 V4-Flash-Preview와 동일한 모델 구조와 크기를 유지함- 모델 자체의 구조 변경 없이 재후처리 학습만 적용됨
- 업데이트는 DeepSeek-V4-Flash API에만 적용됨
- DeepSeek-V4-Pro API는 변경되지 않음
- APP/WEB에서 제공되는 모델도 그대로 유지됨
- DeepSeek-V4-Pro 정식 버전은 곧 출시될 예정임