Llama 3 本地推理入门指南:权重下载与首次运行完整步骤
【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3
想在本地跑起 Meta 的 Llama 3 大模型,最常见的拦路虎有两道:一是模型权重不公开直连,必须通过官方渠道申请;二是下载完成后,新手往往不清楚用哪条命令验证模型真的能推理。Meta Llama 3 是 Meta 官方发布的开源大语言模型,提供 8B 与 70B 两种规格、预训练与指令微调两类版本。这篇 Llama 3 本地推理指南将以 8B 指令微调版为例,带你从克隆仓库到成功输出对话结果完整走一遍。
一分钟认识 Llama 3 项目
Meta Llama 3 官方仓库提供了完整的模型推理代码:加载权重、构建生成器、执行对话补全,核心逻辑都封装在纯 Python 包里,配合 PyTorch 即可本地运行。仓库同时附带了下载脚本和两个可直接运行的示例,是了解 Llama 3 推理流程的最佳起点。
核心文件速览:
- download.sh:官方权重下载脚本,支持断点续传与 MD5 校验
- example_chat_completion.py:对话补全示例,适合指令微调模型
- llama/:模型加载与生成核心代码(含
model.py、tokenizer.py、generation.py)
前置准备清单
- 系统环境:Linux 或 macOS,已安装 Python 3 及 PyTorch(建议带 CUDA 环境)
- 命令行工具:
wget与md5sum(下载脚本的依赖,见 README 前置条件) - 磁盘空间:建议预留 20GB 以上(8B 模型,fp16 权重约 16GB);70B 模型约需 140GB
- 访问授权:在 Meta Llama 官网完成注册并接受许可协议,审批通过后会收到一封含下载链接(Presigned URL)的邮件
- 网络条件:模型文件为数十 GB 级大文件,需稳定的大带宽网络
实操走通:五步跑通 Llama 3 对话推理
1. 克隆仓库并安装依赖
git clone https://gitcode.com/GitHub_Trending/ll/llama3 cd llama3 pip install -e .安装完成后,llama包及其依赖(torch、fairscale、fire 等,见 requirements.txt)即可被示例脚本导入,安装成功的标志是不再报ModuleNotFoundError。
2. 获取官方下载链接
前往 Meta Llama 官网的下载页面,注册账号并勾选同意 License 与 Use Policy,提交申请。审批通过后,用邮箱收到的链接,不要用浏览器"复制链接"按钮,手动从邮件正文中完整复制该 URL(见 README 提示)。
3. 运行 download.sh 下载模型
bash download.sh脚本会提示输入上一步的 URL,以及要下载的模型列表。输入8B-instruct仅下载 8B 指令微调版;直接回车则下载全部四个版本(约数百 GB,新手不建议)。预期输出为wget进度条,最终生成Meta-Llama-3-8B-Instruct/目录。
4. 校验文件完整性
cd Meta-Llama-3-8B-Instruct && md5sum -c checklist.chk脚本在每次下载后也会自动执行该校验;预期输出为consolidated.0.pth: OK,表示权重文件完整无误。
5. 运行对话推理示例
torchrun --nproc_per_node 1 example_chat_completion.py \ --ckpt_dir Meta-Llama-3-8B-Instruct/ \ --tokenizer_path Meta-Llama-3-8B-Instruct/tokenizer.model \ --max_seq_len 512 --max_batch_size 6该命令加载模型并执行 4 组内置对话,预期输出中会出现Assistant:开头的回答(例如蛋黄酱的配方、巴黎旅游推荐),以==================================分隔各轮对话。
⚠️
--nproc_per_node需与模型的并行度 MP 值一致:8B 模型填 1,70B 模型填 8(见 README Inference 章节)。显存不足时,调小--max_seq_len与--max_batch_size即可。
结果判定:怎样的输出算成功
- 下载成功:
Meta-Llama-3-8B-Instruct/目录下存在consolidated.0.pth、params.json、tokenizer.model、checklist.chk四个文件 - 校验通过:
md5sum -c checklist.chk输出OK而非FAILED - 推理成功:示例脚本打印出模型生成的对话内容,且无
CUDA out of memory等报错
高频问题答疑
| 现象 | 原因 | 处理 |
|---|---|---|
403: Forbidden | 邮件中的链接有效期仅 24 小时,或下载次数已用尽 | 重新申请一个新的 Presigned URL 再跑脚本 |
校验FAILED | 网络传输导致文件损坏 | 删除对应.pth文件,重新运行bash download.sh(支持断点续传) |
CUDA out of memory | 序列长度或批大小超出显存 | 减小--max_seq_len、--max_batch_size,或改用 8B 模型 |
torchrun: command not found | 未安装 PyTorch 或终端环境不对 | 确认当前环境已执行pip install -e .且包含 torch |
| 加载模型极慢 | 首次推理需将数十 GB 权重载入内存/显存 | 属正常现象,耐心等待;后续启动会复用已缓存的部分 |
写在最后
本文的核心路径是:申请授权拿到下载链接 →download.sh下载并校验 →example_chat_completion.py验证推理。想进一步探索,建议阅读 MODEL_CARD.md 了解各规格模型的上下文长度与评测表现,使用 example_text_completion.py 体验预训练模型的文本续写,并严格遵守 USE_POLICY.md 中的使用政策。
【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考