DeepSeek-R1 模型下载指南:3 种方式,从选型到本地部署
【免费下载链接】DeepSeek-R1探索新一代推理模型,DeepSeek-R1系列以大规模强化学习为基础,实现自主推理,表现卓越,推理行为强大且独特。开源共享,助力研究社区深入探索LLM推理能力,推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1
DeepSeek-R1 是 DeepSeek 开源的推理模型:6710 亿总参数(激活 370 亿),采用 MoE 混合专家架构,官方上下文 128K。这个体量的 DeepSeek-R1 模型下载不是几分钟的事——全量权重被切成 163 个分片,总容量约 688GB,对磁盘和网络稳定性都是实打实的考验。本文用"先选型、再下载、后校验、最后跑起来"的顺序,把三种下载方式、完整性和常用推理参数一次讲清,帮你避开大文件下载里最常见的坑。
下载 DeepSeek-R1 模型前,先想清楚两个问题
大多数人在第一步就踩坑:直接开始拉 688GB 的全量权重,然后发现显存不够跑、硬盘不够放、或者transformers加载后报错。所以动手之前,先回答两个问题。
问题一:你用的是哪一代模型?官方开源了两个核心模型:DeepSeek-R1(加入冷启动数据 + 两阶段强化学习,效果对标 o1)和 DeepSeek-R1-Zero(纯强化学习训练,行为更"原始")。另外还有一套蒸馏模型:用 DeepSeek-R1 生成的推理数据,微调出的 6 个中小规模模型(1.5B / 7B / 8B / 14B / 32B / 70B),它们在普通硬件上就能跑,性价比最高。
问题二:你的硬件扛得住吗?全量模型是 FP8 权重 + MoE 结构,单机消费级显卡基本没有部署空间,需要多卡集群;个人电脑和服务器更现实的路线是选蒸馏版。
| 蒸馏模型 | 底座模型 | 权重约需空间 (BF16) | 大致硬件门槛 |
|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | Qwen2.5-Math-1.5B | 约 3GB | 单张 8GB 显卡 |
| DeepSeek-R1-Distill-Qwen-7B | Qwen2.5-Math-7B | 约 15GB | 单张 24GB 显卡 |
| DeepSeek-R1-Distill-Llama-8B | Llama-3.1-8B | 约 16GB | 单张 24GB 显卡 |
| DeepSeek-R1-Distill-Qwen-14B | Qwen2.5-14B | 约 28GB | 单张 48GB 或双卡 |
| DeepSeek-R1-Distill-Qwen-32B | Qwen2.5-32B | 约 64GB | 双卡 24GB 起(量化可更低) |
| DeepSeek-R1-Distill-Llama-70B | Llama-3.3-70B-Instruct | 约 140GB | 多卡服务器 |
结论很简单:想本地跑,先下蒸馏版(本文以 32B 为例);做研究复现,才去下 688GB 的全量 R1。磁盘建议留 1.5 倍余量——下载过程会有临时文件。
3 种下载方式:对比与选择
三种方式的取舍如下,按"最省事 → 最可控"排列:
| 方式 | 适合场景 | 断点续传 | 并行加速 | 备注 |
|---|---|---|---|---|
| git clone + Git LFS | 想要完整仓库(含 README、LICENSE、代码文件) | 支持 | 受 LFS 限制 | 需要预装 Git LFS |
| huggingface_hub 库 | 只下权重,可编程控制 | 支持 | 可调并发数 | 推荐,可筛选文件 |
| 手动下载单个文件 | 只要一两个小文件(如 config.json) | 需自行处理 | 多线程自行实现 | 适合临时取文件 |
方式一:git clone 拉取完整仓库
先安装 Git LFS(大文件版本控制工具,没有它克隆下来只有几百字节的占位文件):
sudo apt-get install git-lfs && git lfs install然后克隆镜像仓库,命令会后台拉取全部 LFS 文件,可以挂长连接跑:
git clone https://gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1克隆完成后目录结构大致如下:config.json(模型结构配置)、generation_config.json(生成参数)、configuration_deepseek.py和modeling_deepseek.py(远程推理代码,trust_remote_code=True时会用到)、tokenizer.json/tokenizer_config.json(分词器)、163 个model-XXXXX-of-000163.safetensors权重分片,以及model.safetensors.index.json(分片索引)。
方式二:用 huggingface_hub 下载(推荐)
官方模型发布在 HuggingFace 平台,snapshot_download是官方提供的下载入口,支持断点续传和多文件并发。这段代码做什么:把整个 DeepSeek-R1 仓库下载到当前目录下的./DeepSeek-R1,8 个并发线程拉取。
from huggingface_hub import snapshot_download path = snapshot_download( repo_id="deepseek-ai/DeepSeek-R1", local_dir="./DeepSeek-R1", max_workers=8, ) print("下载完成:", path)如果只下蒸馏版,把repo_id换成对应的仓库名(如deepseek-ai/DeepSeek-R1-Distill-Qwen-32B)即可,思路完全一致。中途断网后重新运行同一段代码,会跳过已完成的分片继续下载。
方式三:只取单个文件
偶尔只需要config.json看结构,或者拿某个分片补传,直接用浏览器或curl从仓库的原始文件地址下载即可,注意把resolve后的文件名写对。取完文件后建议和本地已有文件做大小比对,防止传输截断。
怎么确认下载是完整的
688GB 的文件传一半很难用肉眼发现。仓库里自带model.safetensors.index.json,它记录了每个参数张量位于哪个分片,正好可以当"清单"来核对。这段代码做什么:读索引文件,检查它引用的每个分片是否都真实存在于本地目录。
import json, os model_dir = "./DeepSeek-R1" index = json.load(open(os.path.join(model_dir, "model.safetensors.index.json"))) shards = set(index["weight_map"].values()) # 应恰好 163 个 missing = [f for f in shards if not os.path.exists(os.path.join(model_dir, f))] print("分片总数:", len(shards), "| 缺失:", missing if missing else "无")核对标准有两条:分片数等于 163;没有任何缺失文件。另外提醒一个隐蔽坑——如果你用 git 克隆但没装 Git LFS,分片会只有几百字节且内容是 LFS 指针文本(以version https://git-lfs.github.com开头),此时每个分片大小应该在 GB 量级,一比对就能发现异常。
官方基准成绩:这个模型值不值得下
DeepSeek-R1 的推理能力是它被大量下载的原因。下面是官方报告中的几项代表性成绩(Pass@1),可以直观看出和闭源模型的差距:
| 基准测试 | DeepSeek-R1 | o1-mini | GPT-4o |
|---|---|---|---|
| MATH-500(数学) | 97.3 | 90.0 | 74.6 |
| AIME 2024(奥数) | 79.8 | 63.6 | 9.3 |
| LiveCodeBench(代码) | 65.9 | 53.8 | 34.2 |
| MMLU(综合知识) | 90.8 | 85.2 | 87.2 |
蒸馏版同样能打:32B 版本在 AIME 2024 上拿到 72.6,超过 o1-mini 的 63.6;Llama-70B 版的 MATH-500 达 94.5,是稠密模型里的第一梯队。所以如果你的硬件只够 32B,能力损失并没有硬件差距看起来那么大。
拿到权重后怎么跑起来
先说一个容易误解的点:全量 R1/R1-Zero 目前官方尚未支持直接用 transformers 加载,官方指引是参考 DeepSeek-V3 仓库的部署方案,门槛是多机多卡。而蒸馏版是标准结构,vLLM 一条命令起服务:
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \ --tensor-parallel-size 2 \ --max-model-len 32768 \ --enforce-eager这条命令做什么:以 2 卡张量并行方式启动 32B 蒸馏版的推理服务,最大上下文 32768,--enforce-eager关闭 CUDA graph 以保证首次部署稳定。SGLang 路线同理:python3 -m sglang.launch_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --trust-remote-code --tp 2。
显存紧张时可以考虑量化加载(如 8-bit / 4-bit),以少量精度损失换容量,但官方基准成绩都是在未量化下测得,严肃评测请保留原始精度。
关键参数:不设置对,效果会打折扣
仓库里的generation_config.json已经给出了官方采样参数,实际使用时务必对齐,这几条来自官方使用建议:
- temperature 取 0.5~0.7,推荐 0.6,top_p 0.95。温度开太高会陷入无限重复或输出乱码。
- 不要加 system prompt。这类模型的指令要全部放在用户消息里,加了系统提示反而影响推理质量。
- 数学题提示词里加一句:"Please reason step by step, and put your final answer within \boxed{}."
- 强制以
<think>\n开头:部分提问会让模型跳过思考过程直接答,在输出开头固定加<think>前缀可以保证它进入完整推理。 - 评估能力时多跑几次取平均,单次结果波动较大。
常见问题排查
- 磁盘不够:全量约 688GB + 临时空间,先
df -h确认;个人机器请改下蒸馏版。 - 克隆下来的分片只有几百字节:没装 Git LFS,执行
git lfs install后重新克隆,或用git lfs pull补拉。 - 下载中途断网:三种方式都支持续传——git 重新 clone 会跳过已有对象;huggingface_hub 重跑同一命令自动续传;手动下载用带
Range请求头的补传。 - 加载时报错找不到远程代码:确认
configuration_deepseek.py、modeling_deepseek.py都在模型目录里,并开启trust_remote_code=True。 - 输出开始复读或跑题:优先检查 temperature 是否超出 0.5~0.7 区间。
下一步
如果你只是想尽快看到效果:选 32B 蒸馏版,用上面的 huggingface_hub 或 git 方式下完,vLLM 起服务,按"temperature 0.6、无 system prompt、<think>开头"三件套提问。如果你要复现官方成绩或做研究,再规划 688GB 磁盘和多卡集群去拉全量权重。模型许可为 MIT,允许商用和衍生使用(蒸馏版各自沿用 Qwen / Llama 底座的附加条款,见仓库LICENSE)。
【免费下载链接】DeepSeek-R1探索新一代推理模型,DeepSeek-R1系列以大规模强化学习为基础,实现自主推理,表现卓越,推理行为强大且独特。开源共享,助力研究社区深入探索LLM推理能力,推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考