- DeepSeek-R1-0528은 후훈련 계산 자원 확대와 알고리듬 최적화로 DeepSeek R1의 추론·추리 성능을 끌어올린 마이너 업그레이드임
- 수학·프로그래밍·일반 논리 벤치마크 전반에서 향상됐으며, 전체 성능이 O3와 Gemini 2.5 Pro에 가까운 수준으로 제시됨
- AIME 2025 정확도는 70.0%에서 87.5% 로 올랐고, AIME 테스트셋의 질문당 평균 사용 토큰도 12K에서 23K로 늘어남
- 새 버전은 환각률 감소, 함수 호출 강화, 바이브 코딩 경험 개선을 포함하며 시스템 프롬프트를 지원하고
<think>\n 강제 삽입이 필요 없어짐
- DeepSeek-R1-0528의 사고 과정을 Qwen3 8B Base에 증류한 DeepSeek-R1-0528-Qwen3-8B도 공개됐으며, MIT License로 상업적 사용과 증류를 지원함
DeepSeek-R1-0528의 핵심 변경점
- DeepSeek-R1-0528은 DeepSeek R1의 마이너 버전 업그레이드임
- 후훈련 단계에서 계산 자원을 늘리고 알고리듬 최적화 메커니즘을 도입해 추론 깊이와 추리 능력을 개선함
- 수학, 프로그래밍, 일반 논리 등 여러 벤치마크에서 성능이 향상됐고, 전체 성능은 O3와 Gemini 2.5 Pro 같은 선도 모델에 가까워짐
- 복잡한 추론 작업에서 이전 버전 대비 개선 폭이 큼
- AIME 2025 정확도는 70.0%에서 87.5%로 상승함
- AIME 테스트셋의 질문당 평균 토큰 사용량은 12K에서 23K로 늘어남
- 개선 범위에는 환각률 감소, 함수 호출 지원 강화, 바이브 코딩 경험 개선도 포함됨
벤치마크 결과
- 모든 모델의 최대 생성 길이는 64K 토큰으로 설정됨
- 샘플링이 필요한 벤치마크에서는 temperature 0.6, top-p 0.95를 사용하고 쿼리당 16개 응답을 생성해 pass@1을 추정함
-
일반 성능
- MMLU-Redux EM은 DeepSeek R1 92.9에서 DeepSeek R1 0528 93.4로 상승함
- MMLU-Pro EM은 84.0에서 85.0으로 올랐음
- GPQA-Diamond Pass@1은 71.5에서 81.0으로 상승함
- SimpleQA Correct는 30.1에서 27.8로 하락함
- FRAMES Acc.는 82.5에서 83.0으로 소폭 상승함
- Humanity's Last Exam Pass@1은 8.5에서 17.7로 높아짐
-
코드 성능
- LiveCodeBench 2408-2505 Pass@1은 63.5에서 73.3으로 상승함
- Codeforces-Div1 Rating은 1530에서 1930으로 높아짐
- SWE Verified Resolved는 49.2에서 57.6으로 상승함
- Aider-Polyglot Acc.는 53.3에서 71.6으로 크게 올랐음
-
수학 성능
- AIME 2024 Pass@1은 79.8에서 91.4로 상승함
- AIME 2025 Pass@1은 70.0에서 87.5로 높아짐
- HMMT 2025 Pass@1은 41.7에서 79.4로 상승함
- CNMO 2024 Pass@1은 78.8에서 86.9로 올랐음
-
도구 사용 성능
- BFCL_v3_MultiTurn Acc는 37.0임
- Tau-Bench Pass@1은 Airline 53.5, Retail 63.9임
DeepSeek-R1-0528-Qwen3-8B
- DeepSeek는 DeepSeek-R1-0528의 사고 과정(chain-of-thought) 을 Qwen3 8B Base 후훈련에 증류해 DeepSeek-R1-0528-Qwen3-8B를 만들었음
- 이 모델은 AIME 2024에서 오픈소스 모델 중 SOTA 성능을 달성함
- Qwen3 8B보다 +10.0% 높음
- Qwen3-235B-thinking 성능과 맞먹음
- DeepSeek-R1-0528의 사고 과정은 추론 모델의 학술 연구와 소형 모델 중심 산업 개발 모두에 중요할 것으로 평가됨
- 비교 결과:
- DeepSeek-R1-0528-Qwen3-8B는 AIME 24 86.0, AIME 25 76.3, HMMT Feb 25 61.5, GPQA Diamond 61.1, LiveCodeBench 2408-2505 60.5를 기록함
- Qwen3-8B는 AIME 24 76.0, AIME 25 67.3, GPQA Diamond 62.0을 기록함
- Qwen3-235B-A22B는 AIME 24 85.7, AIME 25 81.5, HMMT Feb 25 62.5, GPQA Diamond 71.1, LiveCodeBench 66.5를 기록함
사용 경로와 로컬 실행
- DeepSeek-R1은 DeepSeek 공식 웹사이트 chat.deepseek.com에서 사용할 수 있으며, DeepThink 버튼을 켤 수 있음
- OpenAI 호환 API는 platform.deepseek.com에서 제공됨
- 로컬 실행 정보는 DeepSeek-R1 저장소에서 확인할 수 있음
- DeepSeek-R1 이전 버전과 비교해 사용 권장사항이 바뀜
- 시스템 프롬프트를 이제 지원함
- 모델을 사고 패턴으로 강제하기 위해 출력 시작에
<think>\n을 추가할 필요가 없음
- DeepSeek-R1-0528-Qwen3-8B의 모델 아키텍처는 Qwen3-8B와 같지만, 토크나이저 설정은 DeepSeek-R1-0528과 동일함
- DeepSeek-R1-0528-Qwen3-8B는 Qwen3-8B와 같은 방식으로 실행할 수 있음
공식 프롬프트와 생성 설정
- 공식 DeepSeek 웹·앱은 특정 날짜가 포함된 같은 시스템 프롬프트를 사용함
该助手为DeepSeek-R1,由深度求索公司创造。
今天是{current date}。
该助手为DeepSeek-R1,由深度求索公司创造。
今天是2025年5月28日,星期一。
- 웹과 앱 환경에서 temperature 파라미터 T_model은 0.6으로 설정됨
- 파일 업로드용 프롬프트는
{file_name}, {file_content}, {question} 인자를 사용함
[file name]: {file_name}
[file content begin]
{file_content}
[file content end]
{question}
- 웹 검색 프롬프트는
{search_results}, {cur_date}, {question} 인자를 사용하며, 중국어 쿼리와 영어 쿼리에 별도 템플릿을 적용함
- 검색 답변 템플릿은 검색 결과를
[webpage X begin]...[webpage X end] 형식으로 다루고, 관련 문장 끝에 [citation:X] 형식의 인용을 붙이도록 요구함
라이선스와 인용
- 코드 저장소는 MIT License를 따름
- DeepSeek-R1 모델 사용도 MIT License를 따름
- DeepSeek-R1 시리즈는 Base와 Chat을 포함해 상업적 사용과 증류를 지원함
- 인용 항목은
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning이며, arXiv eprint는 2501.12948임