# DeepSeek-V4-Flash 업데이트

> Clean Markdown view of GeekNews topic #32016. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=32016](https://news.hada.io/topic?id=32016)
- GeekNews Markdown: [https://news.hada.io/topic/32016.md](https://news.hada.io/topic/32016.md)
- Type: GN+
- Author: [neo](https://news.hada.io/@neo)
- Published: 2026-07-31T21:31:39+09:00
- Updated: 2026-07-31T21:31:39+09:00
- Original source: [api-docs.deepseek.com](https://api-docs.deepseek.com/updates/)
- Points: 1
- Comments: 1

## Topic Body

- **DeepSeek-V4-Flash API 정식 버전**이 2026년 7월 31일 공개 베타로 출시됐으며, 기존 호출 방식에서 모델 이름만 `deepseek-v4-flash`로 지정해 사용할 수 있음
- 에이전트 성능은 V4-Pro-Preview를 크게 앞섰고 **Terminal Bench 2.1에서 82.7점**을 비롯해 Cybergym 76.7, Toolathlon verified 70.3, DSBench-FullStack 68.7을 기록함
- 코드 에이전트 벤치마크는 출시 예정인 **DeepSeek Harness 최소 모드**에서 max effort, `top_p=0.95`, `temperature=1.0` 조건으로 측정됨
- 정식 V4-Flash는 **Responses API 형식을 기본 지원**하고 Codex에 맞게 조정됐으며, Preview와 동일한 모델 구조·크기에 재후처리 학습만 적용함
- 변경 범위는 **V4-Flash API로 한정**되며 V4-Pro API와 APP/WEB 모델은 유지되고, V4-Pro 정식 버전은 곧 출시될 예정임

---

### 공개 베타 출시와 API 사용법
- **DeepSeek-V4-Flash API 정식 버전**이 2026년 7월 31일 공개 베타로 출시됨
- 기존 호출 방식은 그대로 유지되며, 모델 매개변수를 `deepseek-v4-flash`로 설정하면 최신 버전을 이용할 수 있음
- V4 계열은 기존과 같은 `base_url`에서 OpenAI ChatCompletions 및 Anthropic 인터페이스로 제공됨
  - V4-Pro는 `deepseek-v4-pro`, V4-Flash는 `deepseek-v4-flash`를 사용함
  - 기존 모델 이름인 `deepseek-chat`과 `deepseek-reasoner`는 2026년 7월 24일 중단 예정이었음
  - 전환 기간에는 두 이름이 각각 V4-Flash의 비사고 모드와 사고 모드를 가리켰음

### 에이전트 벤치마크 결과
- V4-Flash 정식 버전은 **에이전트 성능에서 V4-Pro-Preview를 크게 웃도는 결과**를 기록함
  - Terminal Bench 2.1: 82.7
  - NL2Repo: 54.2
  - Cybergym: 76.7
  - DeepSWE: 54.4
  - Toolathlon verified: 70.3
  - Agent Last Exam: 25.2
  - Automation Bench Public: 25.1
  - DSBench-FullStack: 68.7
  - DSBench-Hard: 59.6
- 공개 벤치마크의 코드 에이전트 과제는 출시 예정인 **DeepSeek Harness 최소 모드**로 측정됨
  - effort 수준은 max이며 `top_p=0.95`, `temperature=1.0`으로 설정함
- DSBench-FullStack은 내부 풀스택 개발 테스트 세트이고, DSBench-Hard는 내부 코딩 에이전트 고난도 문제 세트임

### Responses API와 Codex 연동
- 정식 V4-Flash는 **Responses API 형식을 기본 지원**하며 Codex에 맞게 조정됨
- Codex 연동에 필요한 설정은 [공식 문서](https://api-docs.deepseek.com/quick_start/agent_integrations/codex)에서 확인할 수 있음

### 모델 변경 범위
- `DeepSeek-V4-Flash-0731`은 V4-Flash-Preview와 **동일한 모델 구조와 크기**를 유지함
- 모델 자체의 구조 변경 없이 재후처리 학습만 적용됨
- 업데이트는 DeepSeek-V4-Flash API에만 적용됨
  - DeepSeek-V4-Pro API는 변경되지 않음
  - APP/WEB에서 제공되는 모델도 그대로 유지됨
- **DeepSeek-V4-Pro 정식 버전**은 곧 출시될 예정임

## Comments



### Comment 62676

- Author: neo
- Created: 2026-07-31T21:31:40+09:00
- Points: 1

###### [Hacker News 의견들](https://news.ycombinator.com/item?id=49119559) 
- 개인적으로 K3보다 더 기대됨. **DSV4 모델**은 서빙 비용이 매우 낮아, 성능이 향상될수록 더 많은 작업에서 ‘충분히 좋은’ 모델이 될 수 있음  
  DeepSeek는 오랫동안 Pro 버전을 매우 저렴하게 제공했고 OpenCode 등과 연동했으므로, 실제 개발 작업 데이터도 많이 확보했을 가능성이 큼. 이를 사후 학습에 활용하면 추가 개선도 가능함  
  K3를 DSV4로 증류했을 때 얼마나 더 좋아질지도 궁금함. 저렴하고 빠른 모델은 공급자 마음대로 사라지지 않고 성능을 계속 활용할 수 있다는 점에서 커뮤니티에 특히 유익함. 적어도 Flash는 **1만 달러 미만 장비**로도 집에서 실행할 수 있지만, GLM이나 K3 대형 모델은 현실적으로 어려움
  - 학습 데이터 제공에 동의할 수 있는 공급자는 **DeepSeek와 Moonshot**뿐임
  - DwarfStar와 결합하면 쓸 만한 **로컬 AI**가 가능할 것으로 기대함

- 작업의 **90%를 Flash**로 처리하고 있음. 이유는 모르겠지만 Pro보다 낫고, 매우 저렴하면서 빠름  
  변경량을 1,000줄 이하로 유지하고 아키텍처 결정은 직접 내리면 최첨단 모델과 차이를 거의 느끼지 못함. 나머지 10%는 버그·보안 문제를 찾거나 더 나은 구조를 검토하는 데 쓰며, Flash도 꽤 잘하지만 교차 검증하고 있음  
  작은 변경에 5~10분씩 기다리는 것보다 빠른 반복이 훨씬 나음. 최근 Kimi와 GLM은 불필요하게 오래 추론해 느렸음. 의존성, 로그, 성능 덤프처럼 많은 데이터를 한도 걱정 없이 넣을 수 있고, **바이너리 리버스 엔지니어링**에서도 보안 제한에 걸리지 않음
  - 프롬프트 표현이 약해서인지 Codex로 사용한 OpenAI 모델들은 바이너리 리버스 엔지니어링을 거부한 적이 없음. 지금도 Codex와 서드파티 펌웨어를 분석 중인데 제한에 한 번도 걸리지 않았음  
    반면 보안과 무관한 프롬프트까지 거절당한다는 경우도 있어, 플랫폼별·사용자별 차이가 이렇게 큰 것인지 궁금함
  - **DeepSeek V4 Flash**는 대부분의 작업에 충분하고 응답도 빠름. 토큰은 주로 미국의 FireWorks.ai에서 구매하지만 DeepSeek에도 대량으로 선결제해 둠  
    Claude Code보다 토큰을 적게 쓰는 OpenCode를 주로 사용하며, DeepSeek 자체 코딩 하네스 출시도 기대 중임
  - 전반적으로 좋지만 OpenRouter에서는 **출력 토큰 한도**가 지나치게 빡빡함. 추론의 함정에 빠지면 한도 내에서 스스로 빠져나오지 못하지만, 그래도 Kimi 모델을 대체했음

- 개인용 일상 에이전트 작업 대부분에 DeepSeek를 사용한 최근 30일 기록은 **비용 4.55달러**, API 요청 3,467회, 토큰 323,183,886개임  
  소규모 팀을 이끄는 엔지니어로서 품질 기준이 높고 개인 프로젝트에도 같은 기준을 적용하지만, 코딩과 검토 작업에서는 전혀 실망하지 않았음. 그 밖의 작업에는 다른 모델을 사용함
  - LLM으로 코드 검토를 할 때 어떤 방식과 프롬프트를 사용하는지 궁금함. 답변 품질이 상당히 낮았는데, 내 사용법이 원인인지 알고 싶음
  - 이 정도 **토큰 캐싱**을 달성하려면 어떤 하네스를 사용하는지 궁금함
  - 환각이 많지는 않은지, 있다면 작업 흐름에 어떤 영향을 주는지 궁금함
  - 품질이 뛰어나지는 않으며, 대부분의 LLM도 마찬가지임

- 이제 pi 안의 거의 모든 작업을 **Flash**로 실행함. 적절한 MCP 서버, 컨텍스트 축소 도구, 스킬을 갖추면 어떤 작업도 구현할 수 있음  
  일부 세션은 30턴 이상 걸리지만 빠르고 저렴해, 한 시간 동안 작업해도 약 0.5달러면 충분함. 다만 다중 하위 에이전트 작업 흐름에서는 계획·검토·오라클 역할에 더 비싼 모델도 사용함  
  느린 Opus 구독은 몇 주째 쓰지 않았음. 휴대폰에서도 동작하고 MCP와 스킬을 지원하는 자체 호스팅 OpenWebUI 채팅도 구축해 Perplexity를 완전히 대체했으며, 호스팅과 구독 비용은 월 약 18달러임
  - 나도 **pi + DeepSeek** 조합에 할 일 추적과 토큰 절약용 맞춤 도구를 다수 붙이고, 매우 어려운 작업에만 최첨단 모델을 사용함. 이 구성이 필요한 기능을 모두 충족함
  - pi에 사용할 만한 **확장 기능**을 추천받고 싶음
  - 이번 업데이트에서 체감되는 개선이 있는지 궁금함
  - pi에서 `top_p`와 `temperature`를 설정하는 방법이 궁금함

- 벤치마크가 실제 사용 성능을 제대로 반영한다면 놀라운 모델임. **300B 모델**이 이전 DS4 Pro 미리보기 모델의 1.8T 매개변수 성능을 넘고 GPT 5.6 Luna보다도 나아 보임  
  가격 인하 후의 Luna보다 여전히 저렴함
  - **DeepSWE**에서는 DeepSeek가 54.4%, Luna가 67%임

- **200B 모델**이 GLM-5.2와 경쟁하고 Opus 4.8에 근접한 것은 상당히 인상적임  
  이 수치가 범용 성능으로도 이어지고 DeepSeek의 뛰어난 캐싱까지 더해진다면 사용량이 매우 많아질 듯함
  - 단순히 200B 모델인 것뿐 아니라 용량도 **160GiB**에 불과함

- 더 명확히 구분하도록 `v4.1-Flash`라고 부르지 못할 이유가 무엇이었는지 궁금함

- 속도와 낮은 가격을 유지하면서도 이미 충분히 쓸 만한 **deepseek-v4-pro의 성능을 넘어선다면** 매우 유망함  
  deepseek-v4-flash는 이미 가격 대비 성능이 가장 좋은 모델이었으므로 지능/비용 지표에서 격차가 더 벌어질 듯함. 다만 DeepSeek API의 저렴한 비용은 코드베이스 정보를 중국에 넘기는 대가이기도 함
  - 적어도 한 벤치마크에서는 **GLM 5.2보다 우수하다**고 함

- 비싼 작업에는 Opus 대신 **Kimi K3**, 일반 작업에는 Sonnet 대신 **DSV4 Flash**를 사용하는 구성이 합리적인지 궁금함
  - deepseek-v4-pro의 업데이트 버전이 곧 나올 듯하며, DSV4 Flash의 큰 개선 폭을 보면 지능과 비용 모두에서 Kimi K3를 앞설 가능성이 큼
  - 충분히 합리적임. DSV4 Flash로 코딩이나 서버 점검을 한 시간 수행해도 순수 API 비용이 약 **0.30달러**라 매번 놀라움
  - 백그라운드에서 두 모델 사이를 전환하도록 내 **모델 라우터**를 사용할 수 있음

- 코딩 외 용도의 에이전트에 DSv4를 사용하는 사례가 궁금함. 특히 **GPT-5.4 mini**로 분류나 범주화 등을 처리하던 사용자가 DSv4를 어떻게 활용하는지 알고 싶음
