如何快速搭建本地OpenAI兼容API:Colibrì coli serve 部署与 Anthropic 协议对接完整教程

发布时间:2026/9/1 10:05:29
如何快速搭建本地OpenAI兼容API:Colibrì coli serve 部署与 Anthropic 协议对接完整教程 如何快速搭建本地OpenAI兼容APIColibrì coli serve 部署与 Anthropic 协议对接完整教程【免费下载链接】colibriRun frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 项目地址: https://gitcode.com/gh_mirrors/colibri3/colibriColibrì 是一个纯 C、零依赖的本地 MoE 大模型推理引擎把 VRAM、RAM 和磁盘当成同一套推理层级让 744B 到 2.8T 参数的模型跑在你能拥有的硬件上。只需一条coli serve命令它就能在你自己的机器上搭建本地 OpenAI 兼容 API并原生提供Anthropic Messages 协议端点——Claude Code、Anthropic SDK 等客户端可以不经任何中间件直连本地大模型。本文带你从零完成部署、验证与对接全流程。准备工作硬件与软件最低要求项目最低要求推荐配置内存RAM~16 GB24 GB 以上磁盘空间~380 GBGLM-5.2 int4 模型高速 NVMe SSD操作系统Linux / Windows 10-11 / macOS任意工具Python 3 C 编译器 makegit—⚠️不需要 GPU。GPU 只会让它更快速度主要由磁盘读取带宽决定因为模型专家experts是从磁盘按需流式加载的。 只想快速体验可选用更小的模型Qwen3.6 容器约 20 GBOLMoE 约 7 GB同样使用coli serve这套前端。三步快速部署 coli serve 本地推理服务第 1 步获取 Colibrì 引擎免编译或源码构建官方为 Linux、macOS 和 Windows 发布预编译归档解压即用无需编译器解压后得到引擎二进制和coli启动器只需安装 Python 3coli启动器和 API 网关是 Python 脚本引擎本身是纯 C。也可以从源码构建以获得针对你 CPU 的最优二进制git clone https://gitcode.com/gh_mirrors/colibri3/colibri cd colibri/c ./setup.sh # 自动检查 gcc/OpenMP构建引擎并运行自检看到engine self-test: 32/32即表示引擎工作正常。完整平台步骤见 docs/quickstart.md。第 2 步准备模型文件以参考模型 GLM-5.2744B为例使用预转换的 int4 容器gs64 构建 int8 MTP 头约 372 GB放在快速磁盘上如/nvme/glm52_i4。下载地址及从 FP8 源码自行转换的命令./coli convert --model /nvme/glm52_i4分片下载、可断点续传详见 docs/quickstart.md。coli会自动读取模型的config.json选择对应引擎二进制所以 GLM-5.2、Kimi K3、DeepSeek V4、Qwen3.6、Inkling、OLMoE 各家族共用同一套coli serve命令无需改任何配置。第 3 步一条命令启动 OpenAI 兼容 API 服务cd colibri/c COLI_MODEL/nvme/glm52_i4 COLI_API_KEYlocal-secret ./coli serve \ --host 127.0.0.1 --port 8000 --model-id glm-5.2-colibri关键参数说明--host/--port默认绑定本机回环地址对外暴露前务必设置COLI_API_KEY--model-idAPI 中model字段要填写的模型名任意字符串均可--kv-slots N分配最多 16 个独立 KV 上下文进阶配置见下文COLI_API_KEY只有设置后才强制鉴权不设则 API 免密钥客户端可随便填占位值。用coli web --model /nvme/glm52_i4可替换serve——两者服务同一端口web只是额外打开浏览器显示仪表盘验证 OpenAI 兼容 API5 分钟跑通 /v1/chat/completions服务已实现GET /v1/models、POST /v1/chat/completions、GET /health等端点支持 JSON 响应、SSE 流式、usage 统计、max_tokens、temperature、top_p及最多 4 个自定义stop序列。直接用curl冒烟测试curl http://127.0.0.1:8000/v1/chat/completions \ -H Authorization: Bearer local-secret \ -H Content-Type: application/json \ -d {model: glm-5.2-colibri, messages: [{role: user, content: Hello}], stream: true}除标准 OpenAI 响应外Colibrì 还额外附加一个colibri扩展字段内含实时推理指标tok/s、专家命中率、每 GPU 驻留专家数等。其他客户端只需按三件套配置即可接入Base URLhttp://localhost:8000/v1Modelglm-5.2-colibriAPI key 任意非空字符串——aider、Continue、Cline、Roo、OpenAI 官方 SDK 全都适用具体示例见 docs/api.md。Anthropic 协议对接让 Claude Code 直连本地大模型同一个服务在同一端口上同时提供 Anthropic Messages API 端点POST /v1/messages无需任何额外开关。这是一个翻译层而非第二套引擎路径网关把 Anthropic 格式的请求重写为 OpenAI 形态交给既有推理路径再把结果翻译回 Anthropic 协议响应c/openai_server.py 中anthropic_to_openai与anthropic_generation实现。支持的能力包括system 提示词字符串或 text 块与多轮user/assistant消息完整命名事件流式序列message_start→content_block_*→message_delta→message_stop长 prefill 期间自动发送协议ping保活客户端不会误判超时stop_reason映射stop→end_turn、length→max_tokens、tool_calls→tool_use与 Anthropic 风格的usage字段x-api-key与Authorization: Bearer两种鉴权均有效扩展思考模式{thinking: {type: enabled}}会映射到对应架构的推理协议。先验证 Anthropic 端点curl http://127.0.0.1:8000/v1/messages \ -H x-api-key: local -H content-type: application/json \ -d {model:glm-5.2-colibri,max_tokens:128, messages:[{role:user,content:Hello}]}Claude Code 对接只需三行环境变量export ANTHROPIC_BASE_URLhttp://localhost:8000 export ANTHROPIC_API_KEYlocal # 仅在设置了 COLI_API_KEY 时才被校验 export ANTHROPIC_MODELglm-5.2-colibri claude⚠️避坑提醒Claude Code 的系统提示词 工具目录很大常达 10–20k token在磁盘流式 CPU 路径上prefill 阶段会有较长的静默等待才出第一个 token——这是 prompt 体积决定的成本并非挂死。建议先用上面的小curl冒烟测试如客户端可裁剪系统前缀与工具目录尽量裁掉。更多端点细节与cache_slot用法见 docs/api.md引擎与服务器的内部行协议见 docs/serve_protocol.md。进阶配置KV 槽位、并发队列与工具调用支持独立 KV 上下文coli serve --kv-slots NN≤16分配独立序列上下文请求通过可选字段cache_slot指定槽位。每个槽位拥有自己的 token 历史、压缩 MLA KV 与崩溃安全持久化文件.coli_kv无状态的 HTTP 多轮请求可跨请求甚至跨重启复用前缀缓存。注意默认 4096 token 上下文下每个槽位占数百 MB按需开启。有界 FIFO 队列同一模型常驻一个进程并发请求排队而非加载多份副本。--max-queue N默认 8与--queue-timeout默认 300 秒可调队列满或超时返回 OpenAI 风格的 HTTP 429GET /health查看活跃/排队/拒绝计数。工具调用支持矩阵Anthropictools/tool_use与 OpenAItools语义一致按引擎支持情况翻译为原生格式引擎OpenAItoolsAnthropictool_use原生格式GLM-5.2✅✅tool_call块DeepSeek V4✅✅DSML 工具块Kimi K3✅✅XTML 块Inkling❌❌返回 HTTP 400OLMoE❌❌返回 HTTP 400不支持的选项不会被静默忽略而是显式报错Anthropic 路径的stop_sequences、top_k、非文本内容块图片/文档均返回 400错误使用 Anthropic 自身的{type:error,...}包裹格式测试覆盖见 c/tests/test_anthropic_messages.py。性能预期与避坑指南同一引擎、同一 int4 容器硬件只决定专家驻留在哪一层——实测解码速度随硬件配置呈阶梯分布6× RTX 5090 全驻留约 5.8–6.8 tok/s128 GB 纯 CPU 桌面机约 1.8 tok/s热缓存25 GB 小机器0.05–0.1 tok/s——慢是诚实的代价模型语义与精度不变磁盘越快 tok/s 越高--topp 0.85可减少每 token 的专家读取量且基本无损质量首次启动需加载约 10 GB 常驻权重稍作等待./coli doctor可只读检查环境是否就绪coli stop一键停止服务。相关文件导航资料路径API 网关OpenAI Anthropic 双协议c/openai_server.pyCLI 启动器coli serve入口c/coliOpenAI 兼容 API / KV 槽位 / Web 仪表盘文档docs/api.md引擎 ⇄ 服务行协议参考docs/serve_protocol.md从零上手快速指南docs/quickstart.mdAnthropic 端点测试用例c/tests/test_anthropic_messages.py全部环境变量清单docs/ENVIRONMENT.md总结Colibrì 用一条coli serve命令就把你手头的机器变成了一个同时说 OpenAI 和 Anthropic 两种协议的本地大模型 API 服务标准库 Python 网关 零依赖 C 引擎KV 缓存跨请求复用流式响应附带私有遥测字段Claude Code 三行环境变量即可直连。模型再大也只是速度的问题而不是可用性的问题——这正是本地部署的终极自由。【免费下载链接】colibriRun frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 项目地址: https://gitcode.com/gh_mirrors/colibri3/colibri创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考