Colibrì简介:纯C零依赖推理引擎如何在个人电脑上跑起744B到2.8T的MoE大模型

发布时间:2026/9/2 13:04:28
Colibrì简介:纯C零依赖推理引擎如何在个人电脑上跑起744B到2.8T的MoE大模型 Colibrì简介纯C零依赖推理引擎如何在个人电脑上跑起744B到2.8T的MoE大模型【免费下载链接】colibriRun frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 项目地址: https://gitcode.com/gh_mirrors/colibri3/colibriColibrì 是一个用纯 C 语言编写、零依赖的本地推理引擎它把硬盘、内存、显存当成同一条内存阶梯让 744B 到 2.8T 参数的前沿 MoE 混合专家大模型GLM-5.2、Kimi K3、Inkling 等无需 GPU、无需云服务就能在你自己的个人电脑上跑起来——引擎本体只有一个 C 文件程序只有几百 KB。什么是 Colibrì一个蜂鸟级的本地大模型引擎 名字来自蜂鸟colibrì 是意大利语重量只有几克却能悬停飞行、一天访问上千朵花。Colibrì 做的正是同样的事——用 25 GB 内存、12 核 CPU 和一点磁盘耐心让 7440 亿参数的大模型在你家电脑上活过来。它当前支持 7 个模型家族覆盖从 7B 到 2.8T 的完整区间模型家族总参数 / 激活参数权重体积说明GLM-5.2744B / 40B~372 GB参考模型int4 容器Kimi K32.8T / 104B~1.6 TB原版 MXFP4 权重直接流式读取无需转换Inkling975B / 41B~469 GBThinking Machines 出品DeepSeek V4 Flash284B / 13B~167 GB原生 fp4 专家 fp8 稠密层GLM-5.3-Flash321B / 40B~195 GB带视觉能力Qwen3.635B / 3B~20 GB入门级好选择全 RAM 驻留即可OLMoE7B / 1B~7 GB最轻量8 GB 内存即可运行值得强调的是这些模型全都不强制需要 GPU。GPU 只决定多快磁盘带宽才决定能不能跑。引擎本体是纯 Cc/colibri.c运行期零 Python、零 BLAS 依赖Python 只在一次性模型转换和可选的 API 网关中出场。为什么流式推理可行每个 token 只激活 5% 的模型Colibrì 能小马拉大车的秘密在于 MoE 模型本身的稀疏性。以 GLM-5.2744B为例每个 token 只激活约 40B 参数5.4%而且相邻 token 之间真正变化的只有约 11 GB 的路由专家权重。所以大模型不需要装进内存——它只需要被放置placement稠密部分注意力、共享专家、嵌入层约 17B 参数以 int4 常驻内存约 9.9 GB19,456 个路由专家75 层 MoE × 256每个约 19 MB放在磁盘上约 370 GB按需流式读取。官方把这个核心算法比作权重界的 JIT 编译器JIT 从不编译整个程序只在实际运行到热路径时即时编译Colibrì 也从不把整个参数空间驻留内存只在路由器证明某专家被需要的那一刻才把它从存储阶梯上暂存到位。三级内存阶梯显存、内存、NVMe 是一体的Colibrì 把 VRAM、RAM、NVMe SSD 当成同一推理层级中的三个放置档位快内存不够时降低的是速度而不是模型的语义——引擎有硬性保证永远不会悄悄改变模型精度或路由语义。更妙的是它带一个学习缓存引擎会记录你的工作流实际路由到哪些专家写入.coli_usage每轮更新并自动把最热的专家钉在最快的档位上——换句话说Colibrì 用得多就真的会变快。在双 SSD 场景下还能把模型完整镜像到第二块盘两块盘合计带宽流式读取专家且镜像副本永远只读、字节一致不改变任何 token 输出。每个 token 的五步路径路由 → 合并 → 放置 → 重叠 → 学习每一层的每个 token 都走相同的五步流水线设计目标是放置只决定速度路由Route路由器给 256 个专家打分保留 top-8合并Union批量位置合并专家列表每个唯一专家只读一次batch-union放置PlaceVRAM/RAM 命中的专家立即计算未命中的从 NVMe 流式读取重叠Overlap驻留专家计算的同时异步 I/O 池读入缺失专家前瞻线程预取下一层专家路由在一层之前有 71.6% 的可预测性学习Learn用量计数更新热专家重新排档引擎随使用越来越快。工程细节也都很抠每个专家的三个矩阵相邻存储、一次pread读完O_DIRECT绕过页缓存实测某主机解码提速 34%MLA 注意力把 KV 状态压缩到每 token 576 个浮点数比标准 KV 小57 倍并能跨重启持久化.coli_kv——重启后对话温启动零重预填。同一台引擎的性能阶梯从 0.05 到 6.8 tok/sTiny engine, immense model 不是口号而是可复现的实测数据。同一引擎、同一 int4 容器硬件只改变专家的居住地25 GB 内存的笔记本0.05–0.1 tok/s冷启动全磁盘流式——这是项目起步时的诚实地板单张 RTX 5070 Ti 32 GB1.07 tok/sGPU 驻留管线128 GB 纯 CPU 台式机约 1.8 tok/s温缓存6 × RTX 5090 全驻留5.8–6.8 tok/sTTFT 约 13 秒。质量同样被测量而非假设int4 容器的量化代价、标度粒度消融实验都记录在 docs/benchmarks.md 中前向传播还对transformers参照做了 token 级校验。Web 仪表盘像看大脑一样看你的大模型运行./coli web会启动 OpenAI 兼容 API 加本地 Web 仪表盘744B 模型的实时 token 指标、每轮耗时分解、VRAM/RAM/磁盘三级条形图一目了然最有名的是Brain 页面把 19,456 个专家画成一个活的皮层——颜色代表存储档位亮度代表路由热度每个被路由的专家当轮闪白悬停还能看到该专家的主题亲和度比如poetry 38%、medicine 16%而Atlas 页面则把实测专家图谱做成三维星系——13,260 个被刻画的专家中1,041 个复制专家按主题诗歌、法律、中文、SQL…聚集成簇位置由实测路由亲和度决定可拖拽旋转。快速上手三步在个人电脑上跑起 744B 模型最低要求约 16 GB 内存、380 GB 空闲磁盘放 GLM-5.2 int4、Linux/Windows/macOS 任一系统。不需要 GPU。第一步获取引擎推荐下载预编译发布包Linux / macOS / Windows 都有解压即用只需装一个 Python 3给启动器用mkdir colibri tar xzf colibri-v1.8.0-linux-x86_64.tar.gz -C colibri cd colibri python3 coli info # engine ready ✓想从源码构建的话需要 gcc/clang OpenMPgit clone https://gitcode.com/gh_mirrors/colibri3/colibri cd colibri/c ./setup.sh # 自动检查编译器、构建引擎、跑自检第二步获取模型GLM-5.2 的 int4 转换版约 372 GB建议放在快速 NVMe 盘上也可以用一条命令从 FP8 源分片下载并转换全程无需 756 GB 同时落盘./coli convert --model /nvme/glm52_i4第三步运行COLI_MODEL/nvme/glm52_i4 ./coli chat # 终端交互式聊天 COLI_MODEL/nvme/glm52_i4 ./coli doctor # 只读环境体检 COLI_MODEL/nvme/glm52_i4 ./coli plan # 查看 VRAM/RAM/磁盘放置计划 ./coli web --model /nvme/glm52_i4 # API Web 仪表盘coli会读取模型的config.json自动选择对应引擎二进制——换模型时命令行完全不变把COLI_MODEL指向对应目录即可这是一个家族一个 C 文件架构带来的统一体验。完整分平台教程见 docs/quickstart.md。项目结构与核心代码位置整个仓库的组织思路非常清晰——每个模型家族一个 C 文件共享单头文件修复一处问题所有引擎同时受益模块路径作用GLM-5.2 引擎c/colibri.c核心引擎单文件Kimi K3 引擎c/kimi_k3.c2.8T 模型原生 MXFP4 流式DeepSeek V4 引擎c/deepseek_v4.c原生 fp4 专家 fp8 稠密层流式专家缓存c/expert_store.h权重 JIT 的核心路由遥测c/route_trace.h.coli_usage学习缓存CUDA / Metal / Vulkan 后端c/backend_cuda.cu、c/backend_vulkan.c可选加速层资源规划器c/resource_plan.pycoli plan/coli doctor背后基准与社区数据docs/benchmarks.md全量硬件实测表调优指南docs/tuning.md放置、预取、学习缓存调优实验记录docs/experiments/如 glm52-6x5090-2026-07-12.md写在最后不只是引擎更是开放的研究平台Colibrì 的定位很特别它既是今天就能跑的推理引擎也是开放的推理系统研究平台。它把每个优化都当作假设直到受控的端到端 A/B 实验证明它有效微基准的快不算数真实机器上的端到端数字才算数。负结果也被鼓励公开——一个控制良好的失败比一个来路不明的漂亮数字更有价值。对于普通用户你第一次拥有前沿级模型——不是租 API 背后的智能而是握住它探测它、测量它、改进它。对于开发者引擎小到一个人就能读完下一个有价值的优化可能就来自动手测量的人。这正是Tiny engine, immense model的完整含义。【免费下载链接】colibriRun frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 项目地址: https://gitcode.com/gh_mirrors/colibri3/colibri创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考