news 2026/9/3 12:11:53

Llama 3 本地推理入门指南:权重下载与首次运行完整步骤

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Llama 3 本地推理入门指南:权重下载与首次运行完整步骤

Llama 3 本地推理入门指南:权重下载与首次运行完整步骤

【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3

想在本地跑起 Meta 的 Llama 3 大模型,最常见的拦路虎有两道:一是模型权重不公开直连,必须通过官方渠道申请;二是下载完成后,新手往往不清楚用哪条命令验证模型真的能推理。Meta Llama 3 是 Meta 官方发布的开源大语言模型,提供 8B 与 70B 两种规格、预训练与指令微调两类版本。这篇 Llama 3 本地推理指南将以 8B 指令微调版为例,带你从克隆仓库到成功输出对话结果完整走一遍。

一分钟认识 Llama 3 项目

Meta Llama 3 官方仓库提供了完整的模型推理代码:加载权重、构建生成器、执行对话补全,核心逻辑都封装在纯 Python 包里,配合 PyTorch 即可本地运行。仓库同时附带了下载脚本和两个可直接运行的示例,是了解 Llama 3 推理流程的最佳起点。

核心文件速览:

  • download.sh:官方权重下载脚本,支持断点续传与 MD5 校验
  • example_chat_completion.py:对话补全示例,适合指令微调模型
  • llama/:模型加载与生成核心代码(含model.pytokenizer.pygeneration.py

前置准备清单

  • 系统环境:Linux 或 macOS,已安装 Python 3 及 PyTorch(建议带 CUDA 环境)
  • 命令行工具wgetmd5sum(下载脚本的依赖,见 README 前置条件)
  • 磁盘空间:建议预留 20GB 以上(8B 模型,fp16 权重约 16GB);70B 模型约需 140GB
  • 访问授权:在 Meta Llama 官网完成注册并接受许可协议,审批通过后会收到一封含下载链接(Presigned URL)的邮件
  • 网络条件:模型文件为数十 GB 级大文件,需稳定的大带宽网络

实操走通:五步跑通 Llama 3 对话推理

1. 克隆仓库并安装依赖

git clone https://gitcode.com/GitHub_Trending/ll/llama3 cd llama3 pip install -e .

安装完成后,llama包及其依赖(torch、fairscale、fire 等,见 requirements.txt)即可被示例脚本导入,安装成功的标志是不再报ModuleNotFoundError

2. 获取官方下载链接

前往 Meta Llama 官网的下载页面,注册账号并勾选同意 License 与 Use Policy,提交申请。审批通过后,用邮箱收到的链接,不要用浏览器"复制链接"按钮,手动从邮件正文中完整复制该 URL(见 README 提示)。

3. 运行 download.sh 下载模型

bash download.sh

脚本会提示输入上一步的 URL,以及要下载的模型列表。输入8B-instruct仅下载 8B 指令微调版;直接回车则下载全部四个版本(约数百 GB,新手不建议)。预期输出为wget进度条,最终生成Meta-Llama-3-8B-Instruct/目录。

4. 校验文件完整性

cd Meta-Llama-3-8B-Instruct && md5sum -c checklist.chk

脚本在每次下载后也会自动执行该校验;预期输出为consolidated.0.pth: OK,表示权重文件完整无误。

5. 运行对话推理示例

torchrun --nproc_per_node 1 example_chat_completion.py \ --ckpt_dir Meta-Llama-3-8B-Instruct/ \ --tokenizer_path Meta-Llama-3-8B-Instruct/tokenizer.model \ --max_seq_len 512 --max_batch_size 6

该命令加载模型并执行 4 组内置对话,预期输出中会出现Assistant:开头的回答(例如蛋黄酱的配方、巴黎旅游推荐),以==================================分隔各轮对话。

⚠️--nproc_per_node需与模型的并行度 MP 值一致:8B 模型填 1,70B 模型填 8(见 README Inference 章节)。显存不足时,调小--max_seq_len--max_batch_size即可。

结果判定:怎样的输出算成功

  • 下载成功Meta-Llama-3-8B-Instruct/目录下存在consolidated.0.pthparams.jsontokenizer.modelchecklist.chk四个文件
  • 校验通过md5sum -c checklist.chk输出OK而非FAILED
  • 推理成功:示例脚本打印出模型生成的对话内容,且无CUDA out of memory等报错

高频问题答疑

现象原因处理
403: Forbidden邮件中的链接有效期仅 24 小时,或下载次数已用尽重新申请一个新的 Presigned URL 再跑脚本
校验FAILED网络传输导致文件损坏删除对应.pth文件,重新运行bash download.sh(支持断点续传)
CUDA out of memory序列长度或批大小超出显存减小--max_seq_len--max_batch_size,或改用 8B 模型
torchrun: command not found未安装 PyTorch 或终端环境不对确认当前环境已执行pip install -e .且包含 torch
加载模型极慢首次推理需将数十 GB 权重载入内存/显存属正常现象,耐心等待;后续启动会复用已缓存的部分

写在最后

本文的核心路径是:申请授权拿到下载链接 →download.sh下载并校验 →example_chat_completion.py验证推理。想进一步探索,建议阅读 MODEL_CARD.md 了解各规格模型的上下文长度与评测表现,使用 example_text_completion.py 体验预训练模型的文本续写,并严格遵守 USE_POLICY.md 中的使用政策。

【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/3 12:09:05

MSPM0G3507嵌入式循迹小车:硬件抗干扰与鲁棒PID实战

简介:本资源是2024年全国大学生电子设计竞赛H题三轮智能循迹小车的完整开源实现,面向嵌入式初学者、电赛备赛学生及STM/MSP系列微控制器实践者,聚焦智能车系统开发中的传感器融合、闭环运动控制与软硬件协同调试等核心问题。压缩包共38个文件…

作者头像 李华
网站建设 2026/9/3 12:07:02

2026机械移动硬盘选购指南:CMR、SMART与多系统兼容全解析

如果你现在还在犹豫“2026 年了,SSD 都降到这个价格了,为什么还要买机械移动硬盘”,那说明你对移动存储的需求大概率仍停留在“拷几个文档、装几个绿色软件”的阶段。真正需要机械移动硬盘的用户,要的是另一件事:在硬盘…

作者头像 李华
网站建设 2026/9/3 12:06:34

【计算机毕业设计单片机案例】基于 STM32 与 ESP8266 的车载物联网监测控制系统设计 基于 STM32 的车载舵机天窗与散热风扇联动控制系统设计(013606)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

作者头像 李华
网站建设 2026/9/3 12:05:11

AI角色一致性实战:从LoRA到ControlNet的多场景稳定生成方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华