Windows-Ollama安装➕本地部署大模型全流程

发布时间:2026/8/24 15:21:16
Windows-Ollama安装➕本地部署大模型全流程 一、环境准备个人环境Win10、Python 3.9硬件配置4GB 显存、8 核 CPU、16G 内存5121024 固态硬盘建议模型配置7B7B约 28.81 tokens/s【使用ollama run qwen2.5:7b--verbose计算】下载 Ollama 安装包https://ollama.com/【如果太慢可以选择手机开个代理下载完传回电脑安装】在安装包目录下打开 CMD输入OllamaSetup.exe /DIRD:\Ollama。避免安装在 C 盘安装完成后无需登录选择本地使用即可。配置ollama 模型安装目录D:\Ollama 下新建 models文件夹配置系统环境变量配置ollama 主机地址开放http请求二、验证安装结果1、 cmd 输入ollama -v 查看TOC1、ollama官网搜索你想本地部署的大模型3、以qwen3.8 27b版本举例复制cli命令行执行执行前run换成pull如果报错中断了pull支持断点续传如果下载慢需要一些小魔法等待安装完毕即可3、下载完毕后执行ollama run 模型名称将会自动运行大模型。三、拉取大模型【魔搭社区版】如果频繁出现卡顿长时间未下载完毕可考虑该版本。1、以Qwen_Qwen3.5-9B-GGUF模型为例打开魔搭社区 搜索相关模型的GGUF版本前面的bit是参数位宽根据自己机器的性能选择位宽太高容易带不动太低会胡说八道。所以我选择IQ4_XS点击直接下载即可。2、下载完毕后将GGUF包挪到D:\Ollama\models文件夹中并增加Modelfile配置# Modelfile Qwen_Qwen3.5-9B-IQ4_XS.gguf# 适配硬件GTX1650Ti‑4G显存、整机16G内存用于论文写作场景FROM ./Qwen_Qwen3.5-9B-IQ4_XS.gguf# num_gpu将前15层模型加载进NVIDIA显存4G显存安全上限防止爆显存报错PARAMETER num_gpu16# num_ctx上下文窗口最大token数≈8192单次可处理约6000汉字不要设置过高避免内存暴涨PARAMETER num_ctx8192# num_threadCPU推理线程数控制后台CPU负载降低内存占用峰值PARAMETER num_thread7# Qwen系列标准对话模板格式不可修改负责拼接系统提示词、用户提问、模型回复TEMPLATE{{.System}}用户:{{.Prompt}}助手:# 系统人设CryAI助手学术论文专用提示词严谨作答不确定内容主动标注风险SYSTEM你是 CryAI 大模型助手请以严谨学术文风直接输出最终回答**禁止输出草稿、推理过程、自检步骤等中间内容不要展示思考过程输出简洁正式。遇到不确定的内容务必标注疑点提示用户复核信息。**3、执行ollama导入命令执行前将其他进程应用全部关闭防止内存不足【内存充足的大佬请忽略】ollama create Qwen3.5-9B-IQ4_XS-fModelfile4、运行大模型并检查参数是否正确执行命令ollama run Qwen3.5-9B-IQ4_XS:latest后输入/show parameters5、如果需要修改Modelfile内容重新create加载一下即可