Strata 接入 Claude Code:用本地125B模型驱动编码Agent的完整配置指南

发布时间:2026/10/1 16:15:54
Strata 接入 Claude Code:用本地125B模型驱动编码Agent的完整配置指南 Strata 接入 Claude Code用本地125B模型驱动编码Agent的完整配置指南【免费下载链接】StrataQwen3.8-Flash-Next (125B MoE) on a 8GB NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/StrataStrata是一款免费开源的本地推理引擎让 1250 亿参数的Qwen3.8-Flash-Next125B MoE大模型直接跑在你的游戏本上并通过 Anthropic 兼容 API 无缝接入Claude Code编码 Agent——无需任何云端订阅一条命令即可完成配置。本文覆盖从安装到调参的全部步骤。1. 为什么用本地 125B 模型驱动编码 Agent编码 Agent 的工作模式是读大量代码 → 思考 → 改代码 → 验证对长上下文和推理能力要求很高。Strata 正是为这类场景优化的速度够快在 RTX 507012 GB上编码模型 Coder 输出 51 tok/s、读取提示 1,870 tok/s比人类阅读还快上下文够长最高支持 262K tokens整个中型代码库可以一次性喂进去成本为零模型完全本地运行Agent 可以不限次地反复调用不花一分钱。2. 硬件要求与一键安装2.1 硬件门槛项目最低要求显卡NVIDIA RTX 30/40/50 系12 GB 显存起步内存32 GB跑 Coder 编码版 64 GB跑满血版磁盘约 80 GB 空闲空间SSD 可显著加快首次启动系统Windows 10/11 或 Linux驱动只需自行安装最新的 NVIDIA 驱动其余全自动2.2 一键安装获取项目git clone https://gitcode.com/gh_mirrors/strata11/StrataWindows 也可下载压缩包解压Windows 双击 START-HERE.batLinux 执行 setup.sh回答几个问题模型大小、上下文长度、是否开启图片理解全程回车即推荐项首次启动会自动下载模型约 70 GB支持断点续传然后浏览器自动打开http://127.0.0.1:8080。⚠️ 首次启动时电脑可能卡顿 1-3 分钟引擎要把 30 多 GB 载入内存并锁给显卡这是正常现象请耐心等待不要关闭窗口。3. 把 Claude Code 指向 Strata核心配置Strata 的 API 服务在 serve/server.py 中同时实现了两种协议编码 Agent 走的是 Anthropic Messages 端点API端点Anthropic Messages流式/非流式支持工具调用POST /v1/messagesOpenAI Chat CompletionsPOST /v1/chat/completions模型列表 / 健康检查GET /v1/models、GET /healthClaude Code 通过Anthropic 兼容接口接入只需 3 个环境变量export ANTHROPIC_BASE_URLhttp://127.0.0.1:8080 export ANTHROPIC_MODELclaude-sonnet-4-5-20250929 export ANTHROPIC_AUTH_TOKENstrata各参数含义ANTHROPIC_BASE_URL指向本地 Strata 服务端口 8080可用--port修改ANTHROPIC_MODELClaude Code 只接受它认识的 Claude 模型名写一个你熟悉的即可——Strata 完全忽略这个名字实际用的都是你本地装的 125B 模型ANTHROPIC_AUTH_TOKEN任意字符串即可如果你在strata-model.json里配置过api_key这里填同样的值。Windows PowerShell 用户$env:ANTHROPIC_BASE_URLhttp://127.0.0.1:8080 $env:ANTHROPIC_MODELclaude-sonnet-4-5-20250929 $env:ANTHROPIC_AUTH_TOKENstrata需要长期生效时把变量写入系统环境变量Windows「高级系统设置」或~/.bashrc/~/.zshrc即可。3.1 验证接入是否成功在 Claude Code 里随便问一句或直接用 curl 验证本地 APIcurl http://127.0.0.1:8080/v1/chat/completions -H Content-Type: application/json -d {model:strata,messages:[{role:user,content:你好}]}能收到回复说明 125B 模型已经在本地为你接单了。接下来在任意项目目录里启动claude即可把 Strata 当作你的模型后端开始写代码。4. 推理深度Thinking编码任务怎么调Qwen3.8-Flash-Next 会先思考再回答Strata 支持四档推理深度none / low / medium / high默认high。Claude Code 发起的每次请求都会携带 thinking 配置Strata 会自动把 Anthropic 的budget_tokens换算成对应档位2K 为 low、8K 为 medium、更多为 high实现见 serve/frontend.py。档位速度适用场景none最快简单问答、格式调整跳过思考直接回答low快日常编码思考保持简短medium中常规开发任务high默认较慢疑难 bug、架构设计最准确 一个实用技巧日常小改动可把 Claude Code 的推理力度设为 low 抢时间遇到硬骨头再调回 high——思考档位是训练出来的指令而非硬性 token 上限简单问题上各档思考都很短。5. 长上下文与 Agent 会话的三个关键细节编码 Agent 一次会话动辄几十轮对话下面三点能显著减少卡壳上下文超限会被直接拒绝请求超过设定上下文时 Strata 返回 400 而不是静默截断。对话过长就新开一个会话或重新运行安装脚本选择更大的上下文8K-262K 可选。fit_max_tokens开关部分 Agent 总是索要很大的输出上限可能撞上 400。在strata-model.json里加上fit_max_tokens: true见 serve/server.py让 Strata 自动把输出上限压缩到剩余空间而不是直接报错。会话缓存自动生效继续对话时引擎只读取新增部分系统提示词2048 tokens 以上还会被永久缓存所以 Agent 的每个新请求启动都在秒级而不是每次从头读几千个 tokens 的系统提示。6. 用 Monitor 面板盯着你的 125B 模型干活服务启动后浏览器自动打开 Strata 应用Monitor页实时显示上下文填充率、GPU 负载、专家缓存温度、每条请求的耗时与速度——非常适合边跑 Claude Code 边观察模型状态。左侧是 Monitor 面板右侧是编码 Agent 正在写代码的现场想深入排查时GET /status会告诉你引擎此刻在做什么读提示 / 回答中 / 已产出 tokens 数GET /metrics则返回 Monitor 面板的全部数据。7. 常见问题排查症状原因与处理首次启动电脑卡死几分钟正常现象载入 30-55 GB 到内存等待即可别关窗口Claude Code 报连接错误确认 Strata 窗口还开着、8080 端口没被占用提示 port in use 说明已在运行找一下窗口回复很卡、磁盘灯狂闪内存不足关闭其他程序或换更小的模型档位Q2_0 / IQ2_XSengine stopped unexpectedly通常是内存不足重发一次消息Strata 会自动重启引擎400 上下文超限开新会话、加大上下文或开启fit_max_tokens提示 NVIDIA 驱动过旧更新驱动后重启再跑一次安装脚本完整排障表见 docs/DETAILS.md。8. 写在最后至此你的 Claude Code 已经由一台本地 125B 服务器驱动免费、私有、离线可用且速度远超阅读速度。想继续深挖可以看看推理引擎如何把 24,576 个专家在 GPU / 内存 / SSD 三级分层调度README.md 的 How does it work 一节以及完整性能数据docs/DETAILS.md和论文docs/paper/Strata-Paper.pdf。关键资源速查接入说明docs/DETAILS.mdUsing it → Claude Code 一节API 服务源码serve/server.py推理等级映射serve/frontend.py一键安装入口START-HERE.batWindows/ setup.shLinux【免费下载链接】StrataQwen3.8-Flash-Next (125B MoE) on a 8GB NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考