news 2026/9/26 3:19:06

DeepSeek-R1 模型下载指南:3 种方式,从选型到本地部署

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DeepSeek-R1 模型下载指南:3 种方式,从选型到本地部署

DeepSeek-R1 模型下载指南:3 种方式,从选型到本地部署

【免费下载链接】DeepSeek-R1探索新一代推理模型,DeepSeek-R1系列以大规模强化学习为基础,实现自主推理,表现卓越,推理行为强大且独特。开源共享,助力研究社区深入探索LLM推理能力,推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1

DeepSeek-R1 是 DeepSeek 开源的推理模型:6710 亿总参数(激活 370 亿),采用 MoE 混合专家架构,官方上下文 128K。这个体量的 DeepSeek-R1 模型下载不是几分钟的事——全量权重被切成 163 个分片,总容量约 688GB,对磁盘和网络稳定性都是实打实的考验。本文用"先选型、再下载、后校验、最后跑起来"的顺序,把三种下载方式、完整性和常用推理参数一次讲清,帮你避开大文件下载里最常见的坑。

下载 DeepSeek-R1 模型前,先想清楚两个问题

大多数人在第一步就踩坑:直接开始拉 688GB 的全量权重,然后发现显存不够跑、硬盘不够放、或者transformers加载后报错。所以动手之前,先回答两个问题。

问题一:你用的是哪一代模型?官方开源了两个核心模型:DeepSeek-R1(加入冷启动数据 + 两阶段强化学习,效果对标 o1)和 DeepSeek-R1-Zero(纯强化学习训练,行为更"原始")。另外还有一套蒸馏模型:用 DeepSeek-R1 生成的推理数据,微调出的 6 个中小规模模型(1.5B / 7B / 8B / 14B / 32B / 70B),它们在普通硬件上就能跑,性价比最高。

问题二:你的硬件扛得住吗?全量模型是 FP8 权重 + MoE 结构,单机消费级显卡基本没有部署空间,需要多卡集群;个人电脑和服务器更现实的路线是选蒸馏版。

蒸馏模型底座模型权重约需空间 (BF16)大致硬件门槛
DeepSeek-R1-Distill-Qwen-1.5BQwen2.5-Math-1.5B约 3GB单张 8GB 显卡
DeepSeek-R1-Distill-Qwen-7BQwen2.5-Math-7B约 15GB单张 24GB 显卡
DeepSeek-R1-Distill-Llama-8BLlama-3.1-8B约 16GB单张 24GB 显卡
DeepSeek-R1-Distill-Qwen-14BQwen2.5-14B约 28GB单张 48GB 或双卡
DeepSeek-R1-Distill-Qwen-32BQwen2.5-32B约 64GB双卡 24GB 起(量化可更低)
DeepSeek-R1-Distill-Llama-70BLlama-3.3-70B-Instruct约 140GB多卡服务器

结论很简单:想本地跑,先下蒸馏版(本文以 32B 为例);做研究复现,才去下 688GB 的全量 R1。磁盘建议留 1.5 倍余量——下载过程会有临时文件。

3 种下载方式:对比与选择

三种方式的取舍如下,按"最省事 → 最可控"排列:

方式适合场景断点续传并行加速备注
git clone + Git LFS想要完整仓库(含 README、LICENSE、代码文件)支持受 LFS 限制需要预装 Git LFS
huggingface_hub 库只下权重,可编程控制支持可调并发数推荐,可筛选文件
手动下载单个文件只要一两个小文件(如 config.json)需自行处理多线程自行实现适合临时取文件

方式一:git clone 拉取完整仓库

先安装 Git LFS(大文件版本控制工具,没有它克隆下来只有几百字节的占位文件):

sudo apt-get install git-lfs && git lfs install

然后克隆镜像仓库,命令会后台拉取全部 LFS 文件,可以挂长连接跑:

git clone https://gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1

克隆完成后目录结构大致如下:config.json(模型结构配置)、generation_config.json(生成参数)、configuration_deepseek.py和modeling_deepseek.py(远程推理代码,trust_remote_code=True时会用到)、tokenizer.json/tokenizer_config.json(分词器)、163 个model-XXXXX-of-000163.safetensors权重分片,以及model.safetensors.index.json(分片索引)。

方式二:用 huggingface_hub 下载(推荐)

官方模型发布在 HuggingFace 平台,snapshot_download是官方提供的下载入口,支持断点续传和多文件并发。这段代码做什么:把整个 DeepSeek-R1 仓库下载到当前目录下的./DeepSeek-R1,8 个并发线程拉取。

from huggingface_hub import snapshot_download path = snapshot_download( repo_id="deepseek-ai/DeepSeek-R1", local_dir="./DeepSeek-R1", max_workers=8, ) print("下载完成:", path)

如果只下蒸馏版,把repo_id换成对应的仓库名(如deepseek-ai/DeepSeek-R1-Distill-Qwen-32B)即可,思路完全一致。中途断网后重新运行同一段代码,会跳过已完成的分片继续下载。

方式三:只取单个文件

偶尔只需要config.json看结构,或者拿某个分片补传,直接用浏览器或curl从仓库的原始文件地址下载即可,注意把resolve后的文件名写对。取完文件后建议和本地已有文件做大小比对,防止传输截断。

怎么确认下载是完整的

688GB 的文件传一半很难用肉眼发现。仓库里自带model.safetensors.index.json,它记录了每个参数张量位于哪个分片,正好可以当"清单"来核对。这段代码做什么:读索引文件,检查它引用的每个分片是否都真实存在于本地目录。

import json, os model_dir = "./DeepSeek-R1" index = json.load(open(os.path.join(model_dir, "model.safetensors.index.json"))) shards = set(index["weight_map"].values()) # 应恰好 163 个 missing = [f for f in shards if not os.path.exists(os.path.join(model_dir, f))] print("分片总数:", len(shards), "| 缺失:", missing if missing else "无")

核对标准有两条:分片数等于 163;没有任何缺失文件。另外提醒一个隐蔽坑——如果你用 git 克隆但没装 Git LFS,分片会只有几百字节且内容是 LFS 指针文本(以version https://git-lfs.github.com开头),此时每个分片大小应该在 GB 量级,一比对就能发现异常。

官方基准成绩:这个模型值不值得下

DeepSeek-R1 的推理能力是它被大量下载的原因。下面是官方报告中的几项代表性成绩(Pass@1),可以直观看出和闭源模型的差距:

基准测试DeepSeek-R1o1-miniGPT-4o
MATH-500(数学)97.390.074.6
AIME 2024(奥数)79.863.69.3
LiveCodeBench(代码)65.953.834.2
MMLU(综合知识)90.885.287.2

蒸馏版同样能打:32B 版本在 AIME 2024 上拿到 72.6,超过 o1-mini 的 63.6;Llama-70B 版的 MATH-500 达 94.5,是稠密模型里的第一梯队。所以如果你的硬件只够 32B,能力损失并没有硬件差距看起来那么大。

拿到权重后怎么跑起来

先说一个容易误解的点:全量 R1/R1-Zero 目前官方尚未支持直接用 transformers 加载,官方指引是参考 DeepSeek-V3 仓库的部署方案,门槛是多机多卡。而蒸馏版是标准结构,vLLM 一条命令起服务:

vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \ --tensor-parallel-size 2 \ --max-model-len 32768 \ --enforce-eager

这条命令做什么:以 2 卡张量并行方式启动 32B 蒸馏版的推理服务,最大上下文 32768,--enforce-eager关闭 CUDA graph 以保证首次部署稳定。SGLang 路线同理:python3 -m sglang.launch_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --trust-remote-code --tp 2。

显存紧张时可以考虑量化加载(如 8-bit / 4-bit),以少量精度损失换容量,但官方基准成绩都是在未量化下测得,严肃评测请保留原始精度。

关键参数:不设置对,效果会打折扣

仓库里的generation_config.json已经给出了官方采样参数,实际使用时务必对齐,这几条来自官方使用建议:

  • temperature 取 0.5~0.7,推荐 0.6,top_p 0.95。温度开太高会陷入无限重复或输出乱码。
  • 不要加 system prompt。这类模型的指令要全部放在用户消息里,加了系统提示反而影响推理质量。
  • 数学题提示词里加一句:"Please reason step by step, and put your final answer within \boxed{}."
  • 强制以<think>\n开头:部分提问会让模型跳过思考过程直接答,在输出开头固定加<think>前缀可以保证它进入完整推理。
  • 评估能力时多跑几次取平均,单次结果波动较大。

常见问题排查

  • 磁盘不够:全量约 688GB + 临时空间,先df -h确认;个人机器请改下蒸馏版。
  • 克隆下来的分片只有几百字节:没装 Git LFS,执行git lfs install后重新克隆,或用git lfs pull补拉。
  • 下载中途断网:三种方式都支持续传——git 重新 clone 会跳过已有对象;huggingface_hub 重跑同一命令自动续传;手动下载用带Range请求头的补传。
  • 加载时报错找不到远程代码:确认configuration_deepseek.py、modeling_deepseek.py都在模型目录里,并开启trust_remote_code=True。
  • 输出开始复读或跑题:优先检查 temperature 是否超出 0.5~0.7 区间。

下一步

如果你只是想尽快看到效果:选 32B 蒸馏版,用上面的 huggingface_hub 或 git 方式下完,vLLM 起服务,按"temperature 0.6、无 system prompt、<think>开头"三件套提问。如果你要复现官方成绩或做研究,再规划 688GB 磁盘和多卡集群去拉全量权重。模型许可为 MIT,允许商用和衍生使用(蒸馏版各自沿用 Qwen / Llama 底座的附加条款,见仓库LICENSE)。

【免费下载链接】DeepSeek-R1探索新一代推理模型,DeepSeek-R1系列以大规模强化学习为基础,实现自主推理,表现卓越,推理行为强大且独特。开源共享,助力研究社区深入探索LLM推理能力,推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/26 3:18:12

恶劣天气室外三维重建实战:高斯Splatting全流程与避坑指南

简介&#xff1a;本资源面向计算机视觉与三维重建方向的研究者、开发者及高年级学生&#xff0c;提供一套在雨、雾、雪等恶劣天气条件下实现室外场景三维重建的完整项目实战包。核心采用高斯Splatting算法&#xff0c;通过高斯核函数的平滑与插值处理&#xff0c;有效抑制天气元…

作者头像 李华
网站建设 2026/9/26 3:18:03

AI短剧工业化流水线:6步可落地的全流程生产方法论

1. 这不是“AI视频课”&#xff0c;而是一套可落地的短剧工业化流水线最近在B站刷到一个标题特别扎眼的教程&#xff1a;“【LibTV教程】目前B站最详细的一站式制作教程&#xff01;从剧本、分镜、人物生成、视频、配音到剪辑完整演示&#xff0c;零基础手把手操作&#xff0c;…

作者头像 李华
网站建设 2026/9/26 3:16:08

MySQL四大NULL处理函数实战指南:IF、IFNULL、NULLIF、ISNULL深度解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/26 3:15:20

MWORKS物理建模:破解RLC谐振与信号调理的工程失真

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/26 3:14:58

医学影像多标签文本分类实战解析与 Kaggle 入门建模

这道 Kaggle 案例虽然平台元数据极少,但任务形态很适合作为多标签文本分类的完整练习。文章重点不放在题面信息本身,而是放在如何从稀缺说明中还原任务结构,识别文本字段与标签组织方式,并建立可提交、可验证、可迭代的分类流程。 多标签文本分类在医疗场景并不只是竞赛练…

作者头像 李华