1P by GN⁺ | ★ favorite | 댓글 1개
  • DeepSeek-R1-0528은 후훈련 계산 자원 확대와 알고리듬 최적화로 DeepSeek R1의 추론·추리 성능을 끌어올린 마이너 업그레이드임
  • 수학·프로그래밍·일반 논리 벤치마크 전반에서 향상됐으며, 전체 성능이 O3Gemini 2.5 Pro에 가까운 수준으로 제시됨
  • AIME 2025 정확도는 70.0%에서 87.5% 로 올랐고, AIME 테스트셋의 질문당 평균 사용 토큰도 12K에서 23K로 늘어남
  • 새 버전은 환각률 감소, 함수 호출 강화, 바이브 코딩 경험 개선을 포함하며 시스템 프롬프트를 지원하고 <think>\n 강제 삽입이 필요 없어짐
  • DeepSeek-R1-0528의 사고 과정을 Qwen3 8B Base에 증류한 DeepSeek-R1-0528-Qwen3-8B도 공개됐으며, MIT License로 상업적 사용과 증류를 지원함

DeepSeek-R1-0528의 핵심 변경점

  • DeepSeek-R1-0528은 DeepSeek R1의 마이너 버전 업그레이드임
  • 후훈련 단계에서 계산 자원을 늘리고 알고리듬 최적화 메커니즘을 도입해 추론 깊이와 추리 능력을 개선함
  • 수학, 프로그래밍, 일반 논리 등 여러 벤치마크에서 성능이 향상됐고, 전체 성능은 O3와 Gemini 2.5 Pro 같은 선도 모델에 가까워짐
  • 복잡한 추론 작업에서 이전 버전 대비 개선 폭이 큼
    • AIME 2025 정확도는 70.0%에서 87.5%로 상승함
    • AIME 테스트셋의 질문당 평균 토큰 사용량은 12K에서 23K로 늘어남
  • 개선 범위에는 환각률 감소, 함수 호출 지원 강화, 바이브 코딩 경험 개선도 포함됨

벤치마크 결과

  • 모든 모델의 최대 생성 길이는 64K 토큰으로 설정됨
  • 샘플링이 필요한 벤치마크에서는 temperature 0.6, top-p 0.95를 사용하고 쿼리당 16개 응답을 생성해 pass@1을 추정함
  • 일반 성능

    • MMLU-Redux EM은 DeepSeek R1 92.9에서 DeepSeek R1 0528 93.4로 상승함
    • MMLU-Pro EM은 84.0에서 85.0으로 올랐음
    • GPQA-Diamond Pass@1은 71.5에서 81.0으로 상승함
    • SimpleQA Correct는 30.1에서 27.8로 하락함
    • FRAMES Acc.는 82.5에서 83.0으로 소폭 상승함
    • Humanity's Last Exam Pass@1은 8.5에서 17.7로 높아짐
  • 코드 성능

    • LiveCodeBench 2408-2505 Pass@1은 63.5에서 73.3으로 상승함
    • Codeforces-Div1 Rating은 1530에서 1930으로 높아짐
    • SWE Verified Resolved는 49.2에서 57.6으로 상승함
    • Aider-Polyglot Acc.는 53.3에서 71.6으로 크게 올랐음
  • 수학 성능

    • AIME 2024 Pass@1은 79.8에서 91.4로 상승함
    • AIME 2025 Pass@1은 70.0에서 87.5로 높아짐
    • HMMT 2025 Pass@1은 41.7에서 79.4로 상승함
    • CNMO 2024 Pass@1은 78.8에서 86.9로 올랐음
  • 도구 사용 성능

    • BFCL_v3_MultiTurn Acc는 37.0
    • Tau-Bench Pass@1은 Airline 53.5, Retail 63.9

DeepSeek-R1-0528-Qwen3-8B

  • DeepSeek는 DeepSeek-R1-0528의 사고 과정(chain-of-thought) 을 Qwen3 8B Base 후훈련에 증류해 DeepSeek-R1-0528-Qwen3-8B를 만들었음
  • 이 모델은 AIME 2024에서 오픈소스 모델 중 SOTA 성능을 달성함
    • Qwen3 8B보다 +10.0% 높음
    • Qwen3-235B-thinking 성능과 맞먹음
  • DeepSeek-R1-0528의 사고 과정은 추론 모델의 학술 연구와 소형 모델 중심 산업 개발 모두에 중요할 것으로 평가됨
  • 비교 결과:
    • DeepSeek-R1-0528-Qwen3-8B는 AIME 24 86.0, AIME 25 76.3, HMMT Feb 25 61.5, GPQA Diamond 61.1, LiveCodeBench 2408-2505 60.5를 기록함
    • Qwen3-8B는 AIME 24 76.0, AIME 25 67.3, GPQA Diamond 62.0을 기록함
    • Qwen3-235B-A22B는 AIME 24 85.7, AIME 25 81.5, HMMT Feb 25 62.5, GPQA Diamond 71.1, LiveCodeBench 66.5를 기록함

사용 경로와 로컬 실행

  • DeepSeek-R1은 DeepSeek 공식 웹사이트 chat.deepseek.com에서 사용할 수 있으며, DeepThink 버튼을 켤 수 있음
  • OpenAI 호환 API는 platform.deepseek.com에서 제공됨
  • 로컬 실행 정보는 DeepSeek-R1 저장소에서 확인할 수 있음
  • DeepSeek-R1 이전 버전과 비교해 사용 권장사항이 바뀜
    • 시스템 프롬프트를 이제 지원함
    • 모델을 사고 패턴으로 강제하기 위해 출력 시작에 <think>\n을 추가할 필요가 없음
  • DeepSeek-R1-0528-Qwen3-8B의 모델 아키텍처는 Qwen3-8B와 같지만, 토크나이저 설정은 DeepSeek-R1-0528과 동일함
  • DeepSeek-R1-0528-Qwen3-8B는 Qwen3-8B와 같은 방식으로 실행할 수 있음

공식 프롬프트와 생성 설정

  • 공식 DeepSeek 웹·앱은 특정 날짜가 포함된 같은 시스템 프롬프트를 사용함
该助手为DeepSeek-R1,由深度求索公司创造。
今天是{current date}。
  • 예시는 다음과 같음
该助手为DeepSeek-R1,由深度求索公司创造。
今天是2025年5月28日,星期一。
  • 웹과 앱 환경에서 temperature 파라미터 T_model은 0.6으로 설정됨
  • 파일 업로드용 프롬프트는 {file_name}, {file_content}, {question} 인자를 사용함
[file name]: {file_name}
[file content begin]
{file_content}
[file content end]
{question}
  • 웹 검색 프롬프트는 {search_results}, {cur_date}, {question} 인자를 사용하며, 중국어 쿼리와 영어 쿼리에 별도 템플릿을 적용함
  • 검색 답변 템플릿은 검색 결과를 [webpage X begin]...[webpage X end] 형식으로 다루고, 관련 문장 끝에 [citation:X] 형식의 인용을 붙이도록 요구함

라이선스와 인용

  • 코드 저장소는 MIT License를 따름
  • DeepSeek-R1 모델 사용도 MIT License를 따름
  • DeepSeek-R1 시리즈는 Base와 Chat을 포함해 상업적 사용증류를 지원함
  • 인용 항목은 DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning이며, arXiv eprint는 2501.12948

댓글과 토론

Hacker News 의견들
  • 오래 걸리지도 않았고, OpenRouter를 통해 7개 제공업체에서 바로 쓸 수 있게 됨
    https://openrouter.ai/deepseek/deepseek-r1-0528/providers
    원래 DeepSeek R1의 5월 28일 업데이트로, 성능은 OpenAI o1급인데 오픈 소스이며 추론 토큰도 완전히 공개되어 있음. 671B 매개변수 규모이고 추론 1회당 37B가 활성화됨

    • 그래도 어떤 학습 자료로 훈련했는지는 안 보이니, 소스에서 재현 가능한 오픈 소스라기보다 오픈 가중치에 가까움
      예전에 Hugging Face의 "Open R1" 프로젝트가 자체 학습 자료 목록을 모으고 있었는데, 아직 활발해 보이지만 어디까지 갔는지는 모르겠음
      https://github.com/huggingface/open-r1
    • 내려받을 수 있는 모델이 있는지 궁금함. OpenRouter에 익숙하지 않고 Ollama에서도 모델이 안 보임
    • 이건 오픈 소스가 아님
      https://www.downloadableisnotopensource.org/
    • 오픈 가중치
  • 관련 정보를 거의 찾을 수 없음. 곧 벤치마크가 나오면 좋겠음. Mistral이 토렌트 마그넷 링크만 트윗하던 시절이 떠오름

    • 이제 벤치마크는 헛수고처럼 보임. 모델을 일반화에 집중하기보다 이미 공개된 특정 시험에 맞춰 과도하게 튜닝하는 쪽으로 가고 있음
      Hugging Face에도 순위표가 있는데, 여러 흔한 오픈 소스 모델을 미세조정한 모델들이 상위권을 차지하지만 실제로 널리 쓰이는 것 같지는 않음
      https://huggingface.co/open-llm-leaderboard
    • 여기에는 "Overall"과 "Median" 점수를 보여주는 표가 있지만, 정확히 무엇을 시험했는지 맥락이 없음. 최신 모델들과 비슷한 수준으로 보이고 비용상 장점도 있어 보이지만, 원래 R1처럼 느리다는 단점이 있음. 아마 생각 토큰을 많이 쓰기 때문일 것 같음
      https://www.reddit.com/media?url=https%3A%2F%2Fpreview.redd.it%2Fdeepseek-r1-0528-v0-09patvqurk3f1.jpeg%3Fwidth%3D1080%26format%3Dpjpg%26auto%3Dwebp%26s%3D38580df0e04cb8e29921a6a55b24a7f76b5b30ff
    • 보통 DeepSeek는 모델을 공개한 뒤 하루쯤 지나 논문을 올리는 것 같음
      왜 조금만 기다렸다가 맞춰서 공개하지 못하는지는 모르겠음. 뉴스 흐름이 좀 어수선해짐
    • 비슷한 느낌임. 워낙 맞닿아 있는 회사들이라 DeepSeek가 의도적으로 Mistral식 공개를 떠올리게 한 것일 수도 있음
  • DeepSeek가 별다른 홍보 없이 큰 개선이 담긴 업데이트를 툭 떨어뜨리는 방식이 좋음

    • 진짜 궁금해서 묻는데, 큰 개선이라는 걸 어떻게 아는지 모르겠음. 어디 벤치마크가 있나?
    • OpenAI가 늘 해왔고 Anthropic도 최근 시작한 방식보다 훨씬 낫다. 새 모델이 얼마나 무서운지, 탈출하고 속이고 메인프레임을 해킹하려 했으며 정렬 담당자에게 잠자리 이야기를 해줬다는 식의 복잡한 서사를 쓰는 것 말임
    • 나도 좋긴 한데, 최소한 벤치마크 수치 몇 개는 있으면 좋겠음
    • WeChat에서는 발표를 한 것 같음
    • 하필 Nvidia 실적 발표일에 맞춰서 나왔네. 당연히 우연이겠지
  • 순수한 호기심인데, 보통 사람이 이걸 아주 느리게라도 쓰려면 하드웨어가 어느 정도 필요할까? 아니면 똑똑한 사람들이 마법 숫자를 붙여 우리 대중을 위해 작게 만들어주지 않으면 아예 불가능한가?

    • 오프로딩과 1.58비트 양자화로 DeepSeek R1을 로컬 기기에서 돌리게 만들었음 :)
      https://unsloth.ai/blog/deepseekr1-dynamic
      새 버전도 작업 중임
    • M3 Ultra 512GB에서는 4비트 양자화 버전을 돌릴 수 있음. 다만 꽤 비쌈. 다른 선택지는 빠른 CPU와 DDR5 RAM 500GB인데, 이것도 싸지 않고 M3 Ultra보다 느림. 또는 Nvidia 카드를 여러 장 사서 VRAM 약 500GB를 맞출 수 있는데, 아마 가장 비싸지만 가장 빠른 방법임
    • 듀얼 소켓 서버 보드에 DDR5 RAM 768GB 정도, 12채널 메모리, 프롬프트 처리를 위한 16GB 이상 GPU가 필요함. 초당 8~10토큰으로 돌리는 데만 몇천 달러가 듦
    • 중고 듀얼 소켓 Xeon에 DDR4 768GB를 붙인 2천 달러짜리 장비가 있는데, 4비트 양자화 버전이 초당 약 1.5토큰으로 돌아감
    • OpenRouter에서는 아마 무료로 쓸 수 있을 것 같음
      이미 685B 매개변수 DeepSeek V3도 무료로 있음
      https://openrouter.ai/deepseek/deepseek-chat-v3-0324:free
  • 로컬 LLM을 어떤 용도로 쓰고 있는지 궁금함. 실제로 효율을 높여주는 실용 도구를 만든 사람이 있나? 조금 실험해봤지만 유용한 애플리케이션 아이디어를 얻기가 어려움

    • 비정상 거래량을 평가하는 신호 추적기가 있음. 해당 신호를 바탕으로 로컬 에이전트가 API로 뉴스 항목을 받아 무슨 일이 일어나는지 판단함. 큰 도움이 되고, 원격 앱으로 하면 하루에 몇 달러씩 써야 하므로 기존 하드웨어에서 돌리고 있음
    • 데이터를 유출하고 싶지 않은 사람이라면 누구나 해당됨. 비밀을 아무 외국 회사에 맡기는 데 사람들이 괜찮아한다는 게 오히려 놀라움
    • 업무상 데이터 정제를 많이 하는데, 특히 조금 지저분한 데이터에서는 작은 모델도 꽤 유용함
      예를 들어 문자열에서 우편번호 같은 정보를 추출하거나, 여러 언어로 적힌 국가명을 번역해 표준화할 수 있음. 스페인어, 이탈리아어, 프랑스어 국가명을 영어로 맞추는 식임
      더 고급 활용 사례도 있겠지만, 이런 용도만으로도 유용했음
    • 코딩 도구의 AI 자동완성 속도 때문에도 가치가 있음. 내 그래픽 카드까지 왕복하는 시간이 네트워크를 타고 나가는 것보다 훨씬 빠름
    • 민감한 데이터를 다루는 회사라면 LLM 관련 작업을 로컬에서 처리하는 걸 반길 수밖에 없음
  • 관심 있는 사람을 위해 1비트 동적 양자화 파일을 몇 개 만들어둠
    https://huggingface.co/unsloth/DeepSeek-R1-0528-GGUF
    713GB에서 185GB로 74% 작아짐
    마법 주문 -ot ".ffn_.*_exps.=CPU"를 쓰면 MoE 층을 RAM으로 오프로딩해서, MoE가 아닌 부분은 16K 문맥에서 VRAM 24GB 미만에 들어감. 나머지는 RAM과 디스크에 놓임

  • 지금 공개된 내용만으로는 판단할 게 많지 않음. 최신 R1 릴리스는 기대할 만하다고 봄. 685B 매개변수인데 모델 카드도 없고, 릴리스 노트나 변경점, 문맥 창 정보도 없음. 원래 R1은 출력이 인상적이지만 거기까지 가는 데 토큰을 정말 많이 태움. 더 자세히 알게 되길 기다리는 중임

  • 이런 식의 국제적 참여가 치열한 기술 경쟁에서 보이는 건 멋짐. 흥미롭고, 자본주의가 이래야 한다고 생각함
    미국에서 유행하는 해자 만들기와 경쟁사 인수 집착은 지루하고 뻔하고 따분해졌음. 회사들이 최고가 되려고 애쓸 때 세상이 이익을 얻음

  • DeepSeek는 예전 iOS 버전 덕분에 iPod Touch에서도 돌아가는 몇 안 되는 LLM 중 하나처럼 보임

  • 671B 매개변수라니. 로컬에서 돌리기는 어려워 보임

    • 실제로 이걸 로컬에서 돌리는 작은 커뮤니티가 있긴 함. 보통 GPU보다 싸기 때문에 CPU/RAM, 특히 아주 많은 RAM으로 돌림