Ollama 本地大模型部署实战:从下载到接入 IDE、Web 和 API 的完整配置指南

发布时间:2026/9/27 13:38:12
Ollama 本地大模型部署实战:从下载到接入 IDE、Web 和 API 的完整配置指南 1. 为什么我最后还是把 Ollama 装回了本机先说结论Ollama 是一个把本地大模型跑起来的运行时工具一条ollama run就能在终端对话同时它会在127.0.0.1:11434暴露一套 HTTP 接口让 IDE 插件、Web 界面、你自己的脚本都能复用同一个模型。它适合三类人想省 API 账单的重度编码用户、代码不能出内网的开发者、以及想离线写点东西的人。我自己的场景很典型白天用云端模型处理复杂推理晚上写业务代码时补全请求量特别大按 token 算下来一个月账单不低。后来把补全这类高频低难度的活交给本地 8B 模型重活继续走云端成本立刻降下来。但这里有个现实问题——本地模型和云端模型往往要用两套配置、两个 Key、两个地址切来切去很烦。所以这篇除了讲 Ollama 从下载到接入 IDE、Web、API 的完整链路还会讲怎么用 TaoToken 做统一 Key 通道让本地和云端在同一个配置里共存。整篇的路径是装 Ollama → 拉模型 → 终端验证 → 接 IDE → 搭 Web UI → 调 API → 排错。命令都能直接复制配置骨架也给全。2. 装 Ollama 与拉取第一个模型2.1 三个平台的安装方式macOS 用 Homebrew 最省事brew install ollamaLinux 用官方脚本它会顺带配好 systemd 服务并开机自启curl -fsSL https://ollama.com/install.sh | shWindows 去官网下载.exe装完托盘常驻命令行工具也一起装好。装完先确认版本和服务ollama --version ollama serve正常会看到Listening on 127.0.0.1:11434。这个地址就是后面所有接入的入口记住它。2.2 选模型先看显存再谈参数参数量越大越聪明但显存吃得也越狠。Q4 量化下的大致参考8B 约 5–6 GB 显存14B 约 9–10 GB32B 要 20 GB 以上。显存不够时 Ollama 会自动退到 CPU 推理速度会掉一个数量级所以别硬上。第一次玩直接qwen3:8b写代码选qwen3-coder:8b只有 8 GB 显存就退到qwen3:4b。拉取ollama pull qwen3:8b ollama run qwen3:8b进去后随便问一句/bye退出。管理命令记几个就够ollama list看已下载、ollama ps看当前加载到显存的是哪个、ollama rm删模型。3. 接入 IDEVS Code Continue 的 config 骨架本地模型最高频的用途就是补全和代码问答。VS Code 装 Continue 插件后配置文件在~/.continue/config.yaml。下面这份骨架可以直接抄注意provider写ollamaapiBase指向本地models: - name: Local Qwen3 Coder provider: ollama model: qwen3-coder:8b apiBase: http://localhost:11434 roles: - autocomplete - chat - edit保存后重启窗口右上角出现 Continue 面板。补全用 Tab 接受CtrlL开侧边栏对话选中代码CtrlI做内联编辑。这里有个我踩过的坑补全和对话最好拆成两个模型。补全用qwen3-coder:1.5b这种小模型响应快、不占显存对话和编辑再用 8B。如果全塞一个 8B补全延迟会明显拖慢打字节奏。3.1 用 TaoToken 统一 Key 通道本地模型和云端模型共存时最烦的是配置分散。TaoToken 提供 OpenAI 兼容的统一入口你可以把它当成一个Key 通道本地走localhost:11434云端走 TaoToken 的地址两边在同一个 Continue 配置里并列。先到控制台创建 Key地址是https://taotoken.net/api注意 API 调用不加 UTM 参数。然后在 Continue 里追加一个云端模型- name: Cloud via TaoToken provider: openai model: claude-sonnet-4-5 apiBase: https://taotoken.net/api/v1 apiKey: sk-你的TaoToken密钥 roles: - chat - edit这样在 Continue 面板里用/model就能随时切换本地和云端业务代码和插件配置都不用动。如果你长期做编码和 Agent 类任务可以考虑 Coding Plan额度模型更适合高频调用只是想先验证模型效果用模型对话页面直接试就行。4. 搭 Web UIOpen WebUI 对接 Ollama终端和 IDE 之外一个带历史记录、多会话、文件上传的浏览器界面体验会好很多。Open WebUI 用 Docker 一条命令起docker run -d -p 3000:8080 \ -e OLLAMA_BASE_URLhttp://host.docker.internal:11434 \ -v open-webui:/app/backend/data \ --name open-webui --restart always \ ghcr.io/open-webui/open-webui:main关键在OLLAMA_BASE_URLmacOS 和 Windows 的 Docker Desktop 用host.docker.internal指向宿主机Linux 改成--networkhost并把地址写成http://127.0.0.1:11434。起来后浏览器开http://localhost:3000首次注册管理员顶部下拉选qwen3:8b就能聊。如果想让局域网里手机或同事的电脑也能用把 Ollama 监听地址放开export OLLAMA_HOST0.0.0.0 ollama serve注意暴露到局域网等于所有人都能用你的模型和算力务必配合防火墙限制来源 IP别直接开到公网。5. 用 curl 验证 API 连通性Ollama 有两套接口原生/api/chat和 OpenAI 兼容的/v1/chat/completions。后者更推荐因为换云端时只改base_url和api_key代码零改动。先用 curl 确认服务活着curl http://localhost:11434/api/chat -d { model: qwen3:8b, messages: [{role: user, content: 11等于几}], stream: false }再验证 OpenAI 兼容层curl http://localhost:11434/v1/chat/completions \ -H Content-Type: application/json \ -d { model: qwen3:8b, messages: [{role: user, content: 用一句话解释什么是递归}] }本地服务不校验 Keyapi_key随便填ollama即可。Python 侧用 OpenAI SDK 流式调用from openai import OpenAI client OpenAI( base_urlhttp://localhost:11434/v1, api_keyollama, ) stream client.chat.completions.create( modelqwen3:8b, messages[{role: user, content: 用三句话介绍大模型量化}], streamTrue, ) for chunk in stream: print(chunk.choices[0].delta.content or , end, flushTrue)成功的话你会看到文字一段段吐出来。如果要把这段代码切到云端只改base_url为 TaoToken 的https://taotoken.net/api/v1、api_key换成你的 Key、model换成云端模型名其余不动。这就是 OpenAI 兼容接口的价值。6. 本篇常见报错排查ollama: command not found环境变量没生效重开终端或手动把安装路径加进 PATH。拉模型超时或失败网络问题检查本机网络配置或换时间段重试。生成时显存 OOM换更小模型、更低量化或把num_ctx从 8192 降到 4096显存占用会明显下降。速度只有几 tokens/s大概率在跑 CPU。用ollama ps看模型所在设备列确认 GPU 驱动正常。Open WebUI 连不上 Ollama九成是OLLAMA_BASE_URL写错macOS/Windows 必须用host.docker.internalLinux 用127.0.0.1配 host 网络。Continue 补全没反应确认模型支持autocomplete角色换 code 系列模型试试。回复总是英文用 Modelfile 设系统提示词比如SYSTEM 请始终用中文回答。端口 11434 被占用lsof -i :11434查占用进程或改OLLAMA_HOST换端口。云端模型报 401检查 TaoToken Key 是否填对、apiBase是否带了/v1。接入细节可以对照接入文档Key 在 API Keys 页面管理。7. 本地和云端怎么分工跑通之后最实用的姿势是两者共存IDE 补全走本地小模型隐私敏感和离线场景走本地 8B复杂推理和长文生成走云端。TaoToken 在这里的作用是把云端那部分收敛成一个统一 Key 通道本地和云端在同一个 Continue 配置里并列切换只改一行model名。下一步可以试三件事用ollama create配合 Modelfile 定制专属模型、把 Function Calling 接成一个真实 Agent、或者用 LangChain 搭个本地 RAG。先把本文的 curl 验证跑通后面都好办。