
AMD GPU 平台部署大模型全流程实战基于 Ryzen AI 300 与 lemonade-server 运行 Gemma3 / Qwen3【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm导读本文是《开源大模型食用指南》仓库中 AMD GPU 平台支持模型列表 的完整技术解析与实战深化聚焦如何在 AMD Ryzen AI 300 系列平台锐龙 AI Max 395/370上通过 NPU 驱动、Ryzen AI 软件与 lemonade-server SDK 完成大模型的本地化部署与推理。读完本文你将掌握 AMD 平台的通用环境配置方法、gemma3-4b-it 与 Qwen3-8B 两个模型的完整部署链路模型下载 → 服务启动 → OpenAI 兼容接口调用并能基于 Lemonade API 自行构建 FastAPI 推理服务。一、AMD 硬件平台支持总览本仓库的 AMD 专区专门收录了在 AMD GPU 平台上经过测试和验证的大语言模型部署教程为每个支持的模型提供了 AMD 环境配置指南、部署步骤和优化建议。所有教程均在实际 AMD 硬件环境中验证通过确保能够在 AMD 平台上顺利运行。目前教程主要支持以下三类 AMD 硬件平台平台类别代表型号AMD Ryzen AI 300 系列AI Max 395、AI Max 370、AI Max 385AMD Radeon RX 系列RX 7900 XTX、RX 7900 XT、RX 6900 XT 等AMD Instinct 计算卡MI210、MI250、MI300 系列其中仓库内完整配套了图文教程、且当前文档明确标注“已支持”的模型共 3 篇教程覆盖两个模型模型教程贡献者谷歌 Gemma3gemma3-4b-itgemma3-4b-it AMD 环境准备、gemma3-4b-it 模型服务部署陈榆Qwen3Qwen3-8BQwen3-8B AMD部署调用陈榆说明上述教程的实测环境为Windows 11 CPU AI 395 内存 128G的 AMD Ryzen AI 300 平台该主机由 AMD University Program 支持提供NPU 路径依赖 Ryzen AI 300 系列 Windows 11 电脑及对应驱动Radeon RX 与 Instinct 系列主要对应 Linux ROCm 路径仓库当前以 Ryzen AI 300 系列教程最为完整。二、AMD 环境配置通用指南在进入具体模型部署之前先建立 AMD 平台的通用环境基线。1. 系统要求操作系统Windows 11 64-bit推荐Ryzen AI NPU 路径的主战场Linux Ubuntu 20.04部分支持主要面向 ROCm GPU 路径硬件要求AMD Ryzen AI 300 系列或更新处理器最低 16GB 内存推荐 32GB存储至少 50GB 可用空间2. 驱动安装AMD Ryzen AI NPU 驱动下载并安装最新的 AMD Ryzen AI 软件包确保 NPU 驱动正确安装和识别AMD GPU 驱动安装 AMD Software: Adrenalin EditionWindows安装 ROCm 平台Linux 环境3. 软件环境Python 环境# 推荐使用 Python 3.9 conda create -n amd_llm python3.9 conda activate amd_llm # 更换 pypi 源加速安装 pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple核心依赖torchAMD ROCm 版本transformershuggingface_hublemonade-serverRyzen AI 平台专用三、核心硬件解读Strix Halo 与锐龙 AI Max 395在动手配置之前理解目标硬件的能力边界有助于我们选择合适的部署策略。仓库的 Gemma3 环境准备文档对 AMD Strix Halo 处理器做了详细解读AMD Strix Halo 处理器被誉为划时代产品其旗舰型号锐龙 AI Max 395拥有当前消费级平台中最强的集显性能可媲美桌面级独立显卡采用全新Zen5 架构 CPU、RDNA3.5 架构 GPU、XDNA2 架构 NPU三合一设计其中NPU AI 引擎算力高达 50 TOPS锐龙 AI Max 系列可搭配最多 128GB LPDDR5X-8000 统一内存内存带宽高达256GB/s可分配最多96GB 作为专属显存从而能在本地直接运行百亿级参数的大模型尤其是对 MoE 专家模型特别友好。这一“CPU GPU NPU 统一内存”的异构架构正是 lemonade-server 中 NPU / Hybrid 混合执行模式prompt 在 NPU 处理、剩余 token 在 iGPU 计算发挥性能的硬件基础。四、实战一gemma3-4b-it 在 AMD 平台的完整部署本节完整还原 gemma3-4b-it AMD 环境准备 与 gemma3-4b-it 模型服务部署 两篇教程的完整链路。4.1 NPU 安装与配置先决条件Ryzen AI 软件支持带有神经网络处理单元NPU的 AMD 处理器安装前系统必须满足以下依赖依赖项版本要求Windows 11build 22621.3527Visual Studio2022cmakeversion 3.26Python 发行版推荐 Miniforge最新版本⚠重要提示Visual Studio 2022 Community务必确保安装了“使用 C 的桌面开发”工作负载Miniforge确保在系统 PATH 环境变量中设置以下路径之一path\to\miniforge3\condabinpath\to\miniforge3\Scripts\path\to\miniforge3\系统 PATH 变量应在“环境变量”窗口的“系统变量”部分设置所有安装程序均请使用管理员权限打开运行安装 NPU 驱动程序下载 NPU 驱动程序下载并安装 NPU 驱动程序版本32.0.203.280或更新版本如 32.0.203.304安装步骤解压下载的 ZIP 文件以管理员模式打开终端执行.\npu_sw_installer.exe文件验证安装打开任务管理器 → 性能 → NPU0确认 NPU MCDM 驱动程序已正确安装版本32.0.203.280日期5/16/2025或版本32.0.203.304日期10/07/2025安装 Ryzen AI 软件下载 Ryzen AI 软件安装程序ryzenai-lt-1.6.1.exe启动 EXE 安装程序并按安装向导操作接受许可协议条款提供 Ryzen AI 安装的目标文件夹默认C:\Program Files\RyzenAI\1.6.1指定 conda 环境的名称默认ryzen-ai-1.6.1完成后Ryzen AI 软件包即安装在安装程序创建的 conda 环境中。测试安装quicktestRyzen AI 软件安装文件夹包含用于验证软件是否正确安装的测试位于quicktest子文件夹中# 1. 在 Windows 开始菜单搜索 Miniforge Prompt打开 Conda 命令提示符 # 2. 激活安装程序创建的 conda 环境 conda activate env_name # 默认为 ryzen-ai-1.6.1 # 3. 运行安装测试 cd %RYZEN_AI_INSTALLATION_PATH%/quicktest python quicktest.pyquicktest.py会设置环境并运行一个简单的 CNN 模型。成功运行时将看到类似以下输出表明模型正在 NPU 上运行Ryzen AI 软件安装成功[Vitis AI EP] No. of Operators : NPU 398 VITIS_EP_CPU 2 [Vitis AI EP] No. of Subgraphs : NPU 1 Actually running on NPU 1 Test Passed注意Ryzen AI 软件安装文件夹的完整路径存储在RYZEN_AI_INSTALLATION_PATH环境变量中。4.2 安装 lemonade-serverNPU 驱动与 Ryzen AI 软件就绪后下载并安装 lemonade-server选择 Windows 11 App Server 安装类型安装完成后在 Python 环境中换源并安装依赖# 升级pip python -m pip install --upgrade pip # 更换 pypi 源加速库的安装 pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple pip install -U huggingface_hub pip install lemonade-sdk[dev]4.3 模型下载在 Windows Powershell 下配置 HuggingFace 镜像站加速模型下载$env:HF_ENDPOINT https://hf-mirror.com使用huggingface_hub中的snapshot_download函数下载模型第一个参数为模型名称参数cache_dir为模型的下载路径。新建download_model.py文件并写入以下内容该脚本通用性极强Qwen3 一节同样复用它#!/usr/bin/env python 使用 Python API 下载 Hugging Face 模型 import os from huggingface_hub import snapshot_download def download_model(repo_id: str, local_dir: str None, resume_download: bool True): 下载 Hugging Face 模型 Args: repo_id: 模型仓库ID例如 ggml-org/gemma-3-4b-it-GGUF local_dir: 本地保存目录如果为None则使用默认缓存目录 resume_download: 是否支持断点续传 print(f开始下载模型: {repo_id}) print(f保存位置: {local_dir if local_dir else 默认缓存目录}) try: # 如果指定了本地目录使用它否则使用默认缓存 if local_dir: cache_dir os.path.dirname(local_dir) if os.path.dirname(local_dir) else None local_dir_use local_dir else: cache_dir None local_dir_use None # 下载模型 downloaded_path snapshot_download( repo_idrepo_id, local_dirlocal_dir_use, cache_dircache_dir, resume_downloadresume_download, local_files_onlyFalse ) print(f\n✓ 模型下载完成) print(f保存路径: {downloaded_path}) return downloaded_path except Exception as e: print(f\n✗ 下载失败: {str(e)}) raise if __name__ __main__: import sys # 默认下载的模型 repo_id ggml-org/gemma-3-4b-it-GGUF # 如果提供了命令行参数使用它作为模型ID if len(sys.argv) 1: repo_id sys.argv[1] # 可选指定本地保存目录 local_dir None if len(sys.argv) 2: local_dir sys.argv[2] download_model(repo_id, local_dir)保存文件后执行下载python download_model.py ggml-org/gemma-3-4b-it-GGUF C:\Users\aup\.cache\huggingface\hub\gemma-3-4b-it-GGUF这里下载的是GGUF 格式的 Gemma3-4b-it 模型由 ggml-org 提供便于 lemonade-server 中 llama.cpp 推理引擎直接加载。4.4 支持的硬件加速器与推理引擎lemonade-server 的加速器支持可总结为两大类别加速器能力说明NPU Hybrid面向 Ryzen AI 300 系列设备的 NPU 功能支持混合执行prompt 在 NPU 处理剩余 token 在 iGPU 计算GPU支持集成显卡iGPU和独立显卡dGPU通过 Vulkan、ROCm、Metal 二进制文件提供支持支持的推理引擎共有四个推理引擎说明OnnxRuntime GenAI (OGA)微软推出的引擎运行 .onnx 格式模型支持 NPU 等硬件llamacpp社区驱动引擎支持 GPU 加速、数千个 .gguf 模型支持 VLM 和 MoE 模型FastFlowLM面向 Ryzen AI 300 NPU 优化、支持 .q4nx 与 VLM 模型的引擎早期访问阶段Hugging Face (HF)基于 transformers 库运行 .safetensors 权重用于 PyTorch 引擎注意当前版本 Lemonade Server 暂不为基准测试等 CLI 任务提供 GPU 支持。4.5 启动服务安装完成后在菜单栏里搜索 Lemonade Server 启动点击菜单中对应的图标菜单包含 Open app、Load Model、Unload Model、Port、Context Size、Documentation、Show Logs、Quit Lemonade 等选项。在应用主界面的左侧 Model Manager 中选中Gemma-3-4b-it-GGUF模型即可启动服务服务会对外输出兼容 OpenAI 格式的接口默认监听http://localhost:8000/api/v1。4.6 服务测试新建test.py文件并写入以下内容使用 OpenAI 官方客户端库发起请求# Client library provided by OpenAI to automate request # and response processing with the server from openai import OpenAI # The base_url points to an LLM server, which can either be # local (localhost address) or cloud-based (web address) base_url fhttp://localhost:8000/api/v1 # The client instance here provides APIs to request # LLM invocations from the server client OpenAI( base_urlbase_url, api_keylemonade, # required, but unused in Lemonade ) # The messages list provides the history of messages from # the system, assistant, and user roles messages [ {role:system, content:You are a helpful assistant.}, {role:user, content:Hi, how are you?}, ] # This is the API call that sends the messages history to # the servers specific LLM model # It returns a completion, which is OpenAIs way of referring # to the LLMs reponse to the messages completion client.chat.completions.create( modelGemma-3-4b-it-GGUF, messagesmessages, ) # This code gets the LLMs response from the completion # and prints it to the screen response completion.choices[0].message.content print(response)运行python test.py即可获得模型返回的对话结果。整个过程的关键点在于只要服务地址、API Key 占位与 model 名称与 lemonade-server 中加载的模型一致任何 OpenAI SDK 兼容的应用都能无缝接入这也是该方案可作为本地 LLM 后端服务基础设施的原因。五、实战二Qwen3-8B 在 AMD 平台的部署与自建 API本节对应仓库文档 Qwen3-8B AMD部署调用。与 Gemma3 使用 GGUF 格式不同Qwen3-8B 走的是ONNX HybridNPU/GPU 混合路线其模型仓库为amd/Qwen3-8B-awq-quant-onnx-hybrid——AMD 官方提供的AWQ 量化 ONNX 格式 Hybrid 混合执行版本。5.1 环境准备与模型下载基础环境Windows 11 CPU AI 395 内存 128G与依赖安装、lemonade-server 下载安装步骤与 Gemma3 完全一致python -m pip install --upgrade pip pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple pip install -U huggingface_hub pip install lemonade-sdk[dev]使用上文第四节中的download_model.py脚本替换模型仓库 ID 下载 Qwen3-8Bpython download_model.py amd/Qwen3-8B-awq-quant-onnx-hybrid C:\Users\aup\.cache\huggingface\hub\models--amd--Qwen3-8B-awq-quant-onnx-hybrid5.2 启动服务同样在菜单栏启动 Lemonade Server在 Model Manager 中选中Qwen3-8B-Hybrid模型即可启动对外输出 OpenAI 兼容服务接口从界面可以看到模型管理器按推理引擎分类展示如 FastFlowLM NPU、Llama.cpp GPU、ONNX Runtime CPU 等还支持搜索与 “Add a model” 手动添加模型底部 Server Logs 会实时输出GET /api/v1/health等健康检查请求日志便于确认服务状态。5.3 服务测试requests 方式新建test.py文件以最简洁的requests方式验证服务完全模仿 curl 请求#!/usr/bin/env python 简洁版本的 API 测试脚本 完全模仿 curl 请求 import requests # 发送 POST 请求完全对应 curl 命令 response requests.post( http://localhost:8000/api/v1/chat/completions, headers{Content-Type: application/json}, json{ model: Qwen3-8B-Hybrid, messages: [{role: user, content: Hello!}] } ) # 打印响应 print(fStatus: {response.status_code}) print(fResponse: {response.json()})运行后返回结果包含完整的 OpenAI 风格响应结构值得注意的是返回结果中除了choices[0].message.content外还包含reasoning_content字段模型的思维链过程以及usage的 token 统计如prompt_tokens: 10, completion_tokens: 111, total_tokens: 121——这是 Qwen3 系列模型在 OpenAI 兼容接口下的典型特征。5.4 用 Lemonade API 构建 FastAPI 推理服务lemonade-server 自带的界面服务可以满足单机对话与接口测试但如果想把 AMD 平台的推理能力封装成独立 API 服务供其他应用调用则需要直接使用Lemonade Python SDK。文档提供了一份完整的 FastAPI 实现其核心调用链为lemonade.api.from_pretrained(repo_id, recipeoga-hybrid)加载模型与 tokenizerrecipe参数指定 ONNX GenAI Hybrid 混合推理配方lemonade.tools.server.serve.StopOnEvent配合 transformers 的StoppingCriteriaList实现基于事件的中止生成lemonade.tools.oga.utils.OrtGenaiStreamerONNX Runtime GenAI 的流式生成器用于逐 token 收集输出。完整代码实现如下新建api.pyfrom fastapi import FastAPI, Request from contextlib import asynccontextmanager from threading import Thread, Event from transformers import StoppingCriteriaList from lemonade.tools.server.serve import StopOnEvent from lemonade.api import from_pretrained from lemonade.tools.oga.utils import OrtGenaiStreamer import uvicorn import json import datetime import logging import queue import uuid import asyncio # 配置日志 logging.basicConfig(levellogging.INFO) logger logging.getLogger(__name__) # 全局模型变量 model None tokenizer None # 任务队列和结果字典 task_queue queue.Queue() result_dict {} worker_thread None worker_running False # --- 模型加载逻辑 --- def load_models(): global model, tokenizer try: logger.info(正在加载模型...) model, tokenizer from_pretrained( amd/Qwen3-8B-awq-quant-onnx-hybrid, recipeoga-hybrid, ) logger.info(模型加载完成) except Exception as e: logger.error(f模型加载失败: {str(e)}) raise # --- 工作线程函数 --- def worker_thread_func(): 长期运行的工作线程从队列中获取任务并处理 global model, tokenizer, task_queue, result_dict, worker_running logger.info(工作线程已启动) worker_running True while worker_running: try: # 从队列中获取任务阻塞等待 task task_queue.get(timeout1.0) if task is None: # 收到停止信号 break task_id, prompt_text, max_new_tokens task try: # 使用 chat.py 中的推理方式 input_ids tokenizer(prompt_text, return_tensorspt).input_ids # 使用流式生成器收集完整响应 streamer OrtGenaiStreamer(tokenizer) stop_event Event() stopping_criteria StoppingCriteriaList([StopOnEvent(stop_event)]) generation_kwargs { input_ids: input_ids, streamer: streamer, max_new_tokens: max_new_tokens, stopping_criteria: stopping_criteria, } # 在工作线程中创建子线程来运行 generate # streamer 需要在另一个线程中读取而 generate 在子线程中运行 generate_thread Thread(targetmodel.generate, kwargsgeneration_kwargs) generate_thread.start() # 在工作线程中收集完整响应从 streamer 读取 response for new_text in streamer: response new_text # 等待生成线程完成 generate_thread.join() # 将结果存入结果字典 result_dict[task_id] { success: True, response: response } except Exception as e: logger.error(f处理任务 {task_id} 时出错: {str(e)}) result_dict[task_id] { success: False, error: str(e) } # 标记任务完成 task_queue.task_done() except queue.Empty: # 队列为空继续循环 continue except Exception as e: logger.error(f工作线程错误: {str(e)}) continue logger.info(工作线程已停止) # --- FastAPI应用 --- asynccontextmanager async def lifespan(app: FastAPI): global worker_thread, worker_running try: load_models() # 启动工作线程 worker_thread Thread(targetworker_thread_func, daemonTrue) worker_thread.start() logger.info(工作线程已启动) yield except Exception as e: logger.error(f服务初始化失败: {str(e)}) raise finally: # 停止工作线程 worker_running False if worker_thread and worker_thread.is_alive(): task_queue.put(None) # 发送停止信号 worker_thread.join(timeout5) logger.info(工作线程已停止) app FastAPI(lifespanlifespan) # 处理POST请求的端点 app.post(/) async def create_item(request: Request): global task_queue, result_dict # 声明全局变量 json_post_raw await request.json() # 获取POST请求的JSON数据 json_post json.dumps(json_post_raw) # 将JSON数据转换为字符串 json_post_list json.loads(json_post) # 将字符串转换为Python对象 prompt json_post_list.get(prompt) # 获取请求中的提示 history json_post_list.get(history, []) # 获取请求中的历史记录 max_new_tokens json_post_list.get(max_new_tokens, 1024) # 获取最大token数默认1024 # 构建提示文本处理历史记录 if history: conversation_text for item in history: if isinstance(item, list) and len(item) 2: user_msg, assistant_msg item conversation_text fUser: {user_msg}\nAssistant: {assistant_msg}\n prompt_text f{conversation_text}User: {prompt}\nAssistant: else: prompt_text prompt try: # 生成唯一任务ID task_id str(uuid.uuid4()) # 将任务放入队列 task_queue.put((task_id, prompt_text, max_new_tokens)) logger.info(f任务 {task_id} 已加入队列) # 等待结果轮询检查结果字典 max_wait_time 300 # 最大等待时间秒 wait_interval 0.1 # 轮询间隔秒 elapsed_time 0 while task_id not in result_dict: if elapsed_time max_wait_time: raise TimeoutError(f任务 {task_id} 超时) await asyncio.sleep(wait_interval) elapsed_time wait_interval # 获取结果 result result_dict.pop(task_id) if result[success]: response result[response] now datetime.datetime.now() # 获取当前时间 time now.strftime(%Y-%m-%d %H:%M:%S) # 格式化时间为字符串 # 构建响应JSON answer { response: response, status: 200, time: time } # 构建日志信息 log [ time ] , prompt: prompt_text , response: repr(response) logger.info(log) # 打印日志 return answer # 返回响应 else: raise Exception(result.get(error, 未知错误)) except Exception as e: logger.error(f处理请求时出错: {str(e)}) now datetime.datetime.now() time now.strftime(%Y-%m-%d %H:%M:%S) return { response: f错误: {str(e)}, status: 500, time: time } # 主函数入口 if __name__ __main__: # 模型加载在 lifespan 中自动完成 # 启动FastAPI应用 # 用6006端口可以将autodl的端口映射到本地从而在本地使用api uvicorn.run(app, host0.0.0.0, port6006, workers1) # 在指定端口和主机上启动应用从源码结构可以梳理出该服务的几个关键设计异步接口 同步推理解耦HTTP 请求处理是异步的async def create_item而model.generate是阻塞式同步调用因此文档采用任务队列 工作线程模式将两者解耦避免事件循环被推理阻塞流式生成聚合OrtGenaiStreamer在生成线程中逐 token 产出文本工作线程从 streamer 中聚合出完整响应后再写回result_dict兼顾了流式接口的实时性与 HTTP 一次性响应的完整性多轮对话支持请求体可通过history字段传入[[user_msg, assistant_msg], ...]形式的对话历史服务端拼接为User: .../Assistant: ...的提示文本可调生成参数max_new_tokens默认 1024超时保护为 300 秒端口约定文档默认监听0.0.0.0:6006注释说明该端口便于 AutoDL 等平台将端口映射到本地使用。启动后即可通过任意 HTTP 客户端向其 POST{prompt: ...}获取推理结果将 AMD 平台的大模型能力封装为独立可复用的服务。六、性能优化建议结合通用指南与实战经验在 AMD 平台上可获得明显收益的优化方向包括1. 内存优化充分利用统一内存架构合理分配系统内存和显存锐龙 AI Max 系列最多可将 96GB 统一内存分配为专属显存对于大模型建议使用32GB 内存配置本文实测环境为 128G。2. NPU 加速在支持的硬件上启用NPU 推理加速XDNA2 架构 NPU 算力达 50 TOPS使用lemonade-server SDK获得最佳性能优先选择 Hybrid 混合执行模式prompt 在 NPU 处理token 生成在 iGPU 计算。3. 模型量化使用INT4/INT8 量化减少内存占用如 Qwen3-8B 的 AWQ 量化 ONNX 版本在保证精度的前提下提升推理速度。七、常见问题排查Q1: 如何检查我的 AMD 设备是否被正确识别可以使用以下命令检查硬件支持情况# 检查 NPU 设备 python -c import lemonade; print(lemonade.get_device_info()) # 检查 GPU 设备ROCm rocm-smiQ2: NPU 无法识别或加载模型失败怎么办按以下顺序排查确认芯片型号为AI 395 或 AI 370Ryzen AI 300 系列——这是当前 lemonade-server NPU 路径明确支持的两款芯片确认已先安装NPU 驱动程序版本 32.0.203.280 或更新并可在任务管理器 → 性能 → NPU0 中看到设备运行quicktest.py验证 Ryzen AI 软件安装是否成功应输出Test Passed确认模型仓库与 lemonade-server 中加载的模型名一致如Gemma-3-4b-it-GGUF、Qwen3-8B-Hybrid。Q3: 下载模型速度慢或失败怎么办在 Windows Powershell 设置镜像$env:HF_ENDPOINT https://hf-mirror.com使用snapshot_download的resume_downloadTrue参数下载脚本已内置实现断点续传。八、为 AMD 平台贡献新教程欢迎通过提交 PR 的方式为仓库贡献更多 AMD 平台的模型教程仓库特别期待更多 AMD GPU 型号的支持教程Radeon RX、Instinct 系列Linux ROCm 环境的部署指南性能优化和基准测试结果。同时support_model_amd.md 与 support_model_Ascend.md、support_model.md 共同构成了仓库的多硬件平台支持索引读者可对照查阅不同平台的部署路径。如果你有特定 AMD 平台的模型部署需求或建议欢迎通过 Issue 或 PR 联系。附仓库内相关资源索引资源路径AMD 平台支持模型总览support_model_amd.mdGemma3 AMD 环境准备NPU 驱动 Ryzen AI 软件 quicktestmodels_amd/gemma3/1-gemma3-4b-it AMD环境准备.mdGemma3 模型服务部署lemonade-server 全流程models_amd/gemma3/2-gemma3-4b-it 模型服务部署.mdQwen3-8B lemonade SDK 部署调用含 FastAPI 服务示例models_amd/qwen3/1-Qwen3-8B-AMD部署调用.mdAMD 专区在项目首页的入口README.md“AMD GPU 专区”章节【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考