Llama 3 本地推理入门指南:权重下载与首次运行完整步骤

发布时间:2026/9/3 12:11:59
Llama 3 本地推理入门指南:权重下载与首次运行完整步骤 Llama 3 本地推理入门指南权重下载与首次运行完整步骤【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3想在本地跑起 Meta 的 Llama 3 大模型最常见的拦路虎有两道一是模型权重不公开直连必须通过官方渠道申请二是下载完成后新手往往不清楚用哪条命令验证模型真的能推理。Meta Llama 3 是 Meta 官方发布的开源大语言模型提供 8B 与 70B 两种规格、预训练与指令微调两类版本。这篇 Llama 3 本地推理指南将以 8B 指令微调版为例带你从克隆仓库到成功输出对话结果完整走一遍。一分钟认识 Llama 3 项目Meta Llama 3 官方仓库提供了完整的模型推理代码加载权重、构建生成器、执行对话补全核心逻辑都封装在纯 Python 包里配合 PyTorch 即可本地运行。仓库同时附带了下载脚本和两个可直接运行的示例是了解 Llama 3 推理流程的最佳起点。核心文件速览download.sh官方权重下载脚本支持断点续传与 MD5 校验example_chat_completion.py对话补全示例适合指令微调模型llama/模型加载与生成核心代码含model.py、tokenizer.py、generation.py前置准备清单系统环境Linux 或 macOS已安装 Python 3 及 PyTorch建议带 CUDA 环境命令行工具wget与md5sum下载脚本的依赖见 README 前置条件磁盘空间建议预留 20GB 以上8B 模型fp16 权重约 16GB70B 模型约需 140GB访问授权在 Meta Llama 官网完成注册并接受许可协议审批通过后会收到一封含下载链接Presigned URL的邮件网络条件模型文件为数十 GB 级大文件需稳定的大带宽网络实操走通五步跑通 Llama 3 对话推理1. 克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/ll/llama3 cd llama3 pip install -e .安装完成后llama包及其依赖torch、fairscale、fire 等见 requirements.txt即可被示例脚本导入安装成功的标志是不再报ModuleNotFoundError。2. 获取官方下载链接前往 Meta Llama 官网的下载页面注册账号并勾选同意 License 与 Use Policy提交申请。审批通过后用邮箱收到的链接不要用浏览器复制链接按钮手动从邮件正文中完整复制该 URL见 README 提示。3. 运行 download.sh 下载模型bash download.sh脚本会提示输入上一步的 URL以及要下载的模型列表。输入8B-instruct仅下载 8B 指令微调版直接回车则下载全部四个版本约数百 GB新手不建议。预期输出为wget进度条最终生成Meta-Llama-3-8B-Instruct/目录。4. 校验文件完整性cd Meta-Llama-3-8B-Instruct md5sum -c checklist.chk脚本在每次下载后也会自动执行该校验预期输出为consolidated.0.pth: OK表示权重文件完整无误。5. 运行对话推理示例torchrun --nproc_per_node 1 example_chat_completion.py \ --ckpt_dir Meta-Llama-3-8B-Instruct/ \ --tokenizer_path Meta-Llama-3-8B-Instruct/tokenizer.model \ --max_seq_len 512 --max_batch_size 6该命令加载模型并执行 4 组内置对话预期输出中会出现Assistant:开头的回答例如蛋黄酱的配方、巴黎旅游推荐以分隔各轮对话。⚠️--nproc_per_node需与模型的并行度 MP 值一致8B 模型填 170B 模型填 8见 README Inference 章节。显存不足时调小--max_seq_len与--max_batch_size即可。结果判定怎样的输出算成功下载成功Meta-Llama-3-8B-Instruct/目录下存在consolidated.0.pth、params.json、tokenizer.model、checklist.chk四个文件校验通过md5sum -c checklist.chk输出OK而非FAILED推理成功示例脚本打印出模型生成的对话内容且无CUDA out of memory等报错高频问题答疑现象原因处理403: Forbidden邮件中的链接有效期仅 24 小时或下载次数已用尽重新申请一个新的 Presigned URL 再跑脚本校验FAILED网络传输导致文件损坏删除对应.pth文件重新运行bash download.sh支持断点续传CUDA out of memory序列长度或批大小超出显存减小--max_seq_len、--max_batch_size或改用 8B 模型torchrun: command not found未安装 PyTorch 或终端环境不对确认当前环境已执行pip install -e .且包含 torch加载模型极慢首次推理需将数十 GB 权重载入内存/显存属正常现象耐心等待后续启动会复用已缓存的部分写在最后本文的核心路径是申请授权拿到下载链接 →download.sh下载并校验 →example_chat_completion.py验证推理。想进一步探索建议阅读 MODEL_CARD.md 了解各规格模型的上下文长度与评测表现使用 example_text_completion.py 体验预训练模型的文本续写并严格遵守 USE_POLICY.md 中的使用政策。【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考