WeKnora 本地部署指南:1 台机器搭起免联网的离线知识库

发布时间:2026/9/13 5:23:34
WeKnora 本地部署指南:1 台机器搭起免联网的离线知识库 WeKnora 本地部署指南1 台机器搭起免联网的离线知识库【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnoraWeKnora 是一个开源 LLM 知识平台把原始文档变成可检索的离线知识库支持 RAG 问答、自主推理 Agent 与自维护 Wiki。这篇指南带你在一台自己的机器上完成免联网部署并跑通文档问答——推理、向量检索、文件存储全部留在本机。 从一份不能出机房的文档说起假设你是团队的文档管理员制度手册、操作规范、合同模板散落在共享盘里新人提问靠人肉翻文件。把这些文档交给 WeKnora上传、解析、向量化、问答整条链路都可以跑在你自己的机器上模型可以选 Ollama在本机运行大模型的工具配合它请求与数据都不出机房。装好之后你可以做三件事对文档发起问答答案逐句引用原文段落可回溯到出处按文件夹树管理文档上传时的目录结构原样保留直接编辑检索分块版本历史支持 diff 与一键回滚改动后自动重建索引。 选哪种部署形态机器要多高配置WeKnora 提供两种部署形态先定形态再谈配置维度Lite 版标准版进程形态单个 Go 二进制 一个 SQLite 文件data/weknora.db零外部依赖Docker Compose 多容器app、docreader 解析服务、PostgreSQL、Redis 等账号模型单空间开箱即用无需注册多空间协作需注册登录带 RBAC 角色体系文档解析内置 Simple 解析引擎可配置多种解析引擎与完整处理链路网络暴露默认仅本机访问自行绑定地址与网关适用对象个人 / 小团队 / 快速试用多团队协作、完整企业能力本文以 Lite 为主线演示标准版差异在装机环节一并交代。硬件与软件门槛如下项目Lite最低档标准版推荐档CPU / 内存4 核 8GBCPU 可完成推理8 核 16GB可同时跑标准版栈与本地 8B 模型磁盘20GB 可用50GB 可用模型文件与解析出的图片增长较快GPU不需要8GB 以上显存可显著加快 Ollama 推理没有也能用软件Go 工具链自行构建 OllamaDocker 与 Docker Compose用本地模型再加装 Ollama网络全程无需公网组件全部在本机仅当使用云端模型 API 时需该地址可达一个量级参考已有 Go 工具链和 Ollama 的机器Lite 从克隆代码到 Web 页面可访问通常 15 分钟内标准版另加镜像拉取时间。若与 SaaS 知识库对比本地部署没有席位费但需要自己承担模型选型与调参。 把 Lite 装起来5 步完成单机实例以下命令都在仓库根目录执行。拉取代码。git clone https://gitcode.com/GitHub_Trending/we/WeKnora cd WeKnora生成配置文件。把模板复制为.env.lite随后只改三处OLLAMA_BASE_URL保持指向本机 Ollama默认http://127.0.0.1:11434TENANT_AES_KEY与JWT_SECRET换成自己的随机值。cp .env.lite.example .env.lite安装推理与向量模型。在 Ollama 中拉一个 7B 级模型CPU 推理即可对话模型与向量模型建议都从 Ollama 取链路才真正离线。ollama pull qwen2.5:7b ollama pull nomic-embed-text构建并启动。该命令先构建前端产物再编译 Go 二进制产物为weknora-lite完成后按终端输出的本机地址打开 Web 页面。make run-lite顺手验证 Ollama 已就绪能看到模型列表即通过。ollama list到这一步一个数据全在本地的 Lite 实例就跑起来了。默认配置面向单人使用需要限制注册入口时可在.env.lite里调整DISABLE_REGISTRATION。团队要多人用的话标准版流程是替换后三步cp .env.example .env编辑配置后执行docker compose pull docker compose up -d前端在http://localhost后端 API 在http://localhost:8080。注意标准版容器访问宿主机 Ollama 时.env中OLLAMA_BASE_URL要写成http://host.docker.internal:11434与 Lite 的127.0.0.1不同。更多 profileneo4j、minio、langfuse见 README_CN.md 的快速开始。✅ 装完立刻能试的 3 个操作场景一上传第一批文档。新建一个知识库拖入 PDF 或 Word文档会走 docreader 解析、语义分块、本地向量化三道工序列表里可看到每篇的处理状态目录结构保留为文件夹树。场景二提问并核对引用。把知识库切到问答模式输入一个只有内部文档才答得上来的问题。系统先做向量加关键词的混合检索再由模型组织回答答案逐句带引用点开可回到原文段落。场景三改一个分块并回滚。打开任意文档的检索分块直接编辑内容版本历史里能看 diff、一键回滚保存后索引自动重建下一次检索立刻按新内容生效。 装不上或跑不动先查这张表现象可能原因处理Web 页面打不开端口被占用或标准版容器未就绪检查.env中端口配置docker compose ps查看容器状态模型测试失败Ollama 未启动或地址不匹配先启动 Ollama 再试Lite 指向127.0.0.1:11434标准版容器内指向host.docker.internal:11434文档一直停在处理中解析任务超时或队列积压看日志定位卡住的阶段对照 docs/QA.md 第 14 条处理图片显示为无效链接存储后端对外不可达改用本地存储STORAGE_TYPElocal或为 MinIO 配置外部可达地址刚保存的配置几秒后消失登录账号与空间归属不一致确认在正确的空间下操作参考 docs/QA.md 第 7 条 让它跑得更快4 个环境变量调整项设置作用向量批量BATCH_EMBED_SIZE64批量入库时减少对 Ollama 的往返次数解析并发DOCREADER_GRPC_MAX_WORKERS设为 CPU 核数文档解析是 CPU 密集任务并行度直接缩短排队时间任务并发CONCURRENCY_POOL_SIZE取 3 到 8避免后台任务突进占满内存、拖慢在线问答模型上下文在模型参数里写入num_ctx长文档不被截断检索到的片段更完整调优前建议先用默认值跑完整批文档再针对最慢的环节逐项加。 装完之后接下来做什么一个权衡先说清楚8B 级本地模型上加大num_ctx能提升单条回答质量提高并发则会牺牲单次质量——想答得好就加上下文想答得快就降并发、分批入库两者不可兼得。给首周的操作节奏一个具体建议第 12 天导入 1020 份高频文档建一个问答模式的知识库高频固定问题可单独建 FAQ 类知识库把口径固定下来第 34 天用真实业务问题逐条提问记下答错与漏召回的问题回到分块层面检查切分与标签第 5 天以后按上表调整批量与并发参数跑一轮全量重解析对比效果确认质量稳定后再决定是否升级到标准版多容器部署。模型与向量库的更多配置可继续参考 docs/BUILTIN_MODELS.md。一台机器的 WeKnora 就能撑起日常内部资料问答数据全程留在你自己的磁盘上。【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考