Khoj 使用指南:3 步自建 AI 搜索助手,让本地文档秒变可问答知识库

发布时间:2026/9/1 11:24:03
Khoj 使用指南:3 步自建 AI 搜索助手,让本地文档秒变可问答知识库 Khoj 使用指南3 步自建 AI 搜索助手让本地文档秒变可问答知识库【免费下载链接】khojYour AI second brain. Self-hostable. Get answers from the web or your docs. Build custom agents, schedule automations, do deep research. Turn any online or local LLM into your personal, autonomous AI (gpt, claude, gemini, llama, qwen, mistral). Get started - free.项目地址: https://gitcode.com/GitHub_Trending/kh/khoj手头有一份 40 页的 PDF、一个塞满笔记的 Obsidian 文件夹还有一堆散落的 Markdown——想找其中一条结论翻文件往往比重新上网搜还慢。Khoj 是开源且可自托管的 AI 搜索与问答助手它先把你的文档做语义索引之后你用自然语言提问几秒钟内返回带出处的答案还能接本地或在线大模型。本文按装起来 → 用起来 → 玩深一点的顺序讲不绕弯子。项目速览Khoj 能帮你做什么一句话定位Khoj 是一个跑在自己机器上的个人 AI 检索层——文档同步进去之后搜索、问答、自动化都基于这些内容发生而不是每次现翻文件。它解决的核心问题有三个跨格式的语义搜索、基于 RAG 的带引用问答、以及可扩展的 Agent 与自动化。适合两类人一是想把私有资料论文、手册、项目文档变成可查询资产的普通用户二是希望数据留在自己服务器上、同时又能接任意大模型的开发者。多格式索引PDF、Markdown、DOCX、纯文本、org-mode、Notion 导出图片里的文字也支持 OCRRAG 对话多轮聊天回答末尾列出参考的原始文档片段Agent 与自动化自定义人设 Agent、定时任务、邮件推送️多端访问Web、Obsidian 插件、Emacs、桌面端、手机 PWA模型自由OpenAI / Claude / Gemini或 Ollama 等本地模型整体数据流见架构图左侧各数据源同步进来中间是索引与检索右侧由聊天模型组织回答最快安装方法两种路径 5 分钟跑起来路径一Pip 本机部署适合个人python -m pip install khoj[local] USE_EMBEDDED_DBtrue khoj --anonymous-mode首次启动会引导你建管理员账号并选择聊天模型终端出现 Khoj is ready to engage即代表部署完成浏览器打开http://localhost:42110进入 Web 应用。--anonymous-mode表示免登录仅限本机单用户使用要多人访问可看 本地部署指南 里的认证配置。路径二Docker Compose适合团队/长期运行mkdir ~/.khoj cd ~/.khoj # 放入仓库根目录的 docker-compose.yml # 设置 KHOJ_ADMIN_PASSWORD、OPENAI_API_KEY 等环境变量 docker-compose up仓库根目录自带 docker-compose.yml改好环境变量后一条命令拉起。官方提醒首次运行后建议重启一次服务确保所有配置生效。实际用起来三个高频场景以下都是同步文档后最常用的用法按你输入什么 → 它给你什么说明。Web 版入口是站内搜索页与聊天页Obsidian 里通过命令面板的Khoj: Search/Khoj: Chat调用Emacs 用户执行M-x khoj 查询词即可。场景一自然语言语义搜索你输入我们的部署流程里数据库迁移是怎么做的不必猜关键词它给你从已索引文档里召回的若干片段按相关度排序每条都标明来自哪个文件哪一段。搜索走双塔召回 交叉编码器重排两级流程实现细节在 text_search.py。还支持日期、文件类型等查询过滤器缩小范围。场景二带出处的 RAG 问答你输入总结这份故障复盘里最关键的三个原因它给你一段归纳后的回答末尾列出被引用的原始文档片段点进去可直接核对——答案是否可靠一眼可验证。聊天时可用斜杠命令控制上下文/notes只基于你的文档回答/general只用模型通用知识/online则允许联网检索最新信息。场景三多轮研究与跟进你输入先问这份 API 文档里超时参数有哪些再追问超时重试和幂等性怎么配合它给你基于前几轮上下文继续深入的回答不会每轮都从头检索。配合自动化的定时任务还可以把每天汇总某类新文档这类重复研究交给 Khoj 自己跑结果发到邮箱。进阶玩法本地模型与自定义 Agent接入离线大模型Ollama 路线先在本机跑一个 OpenAI 兼容的本地模型服务Ollama、llama.cpp server 均可再在管理后台server/admin的AI Model API里把地址指向http://localhost:11434/v1/重启 Khoj 后模型自动出现在选项里。此后搜索、问答全程不出局域网断网也能用。搜索模型同理在SearchModelConfig中更换双塔/交叉编码器模型名重启即生效适合多语言检索场景。创建自定义 Agent在管理后台的 Agent 页点Add Agent在personality字段写入 system prompt比如你是财务助手只依据报销制度文档回答不确定就明说可再挂载联网搜索、代码执行等工具。设为public后全团队可用——相当于给知识库配一个带固定人设和专业范式的角色。常见疑问Q自托管后我的数据会出内网吗自托管时文档只存在你自己的数据库里走本地模型则全程无外部请求。接入云端模型时发出的只有查询和命中的相关片段原始文档仍在本地。这是自托管相对云端 SaaS 的核心差异。Q支持哪些文件格式PDF、Markdown、DOCX、纯文本、org-mode、Notion 导入、GitHub 仓库以及图片 OCR。完整格式说明见数据源文档。Q同步后新增的文件怎么办文档同步会重建/追加索引新增文件在下次同步后自动纳入也可用查询过滤器按来源临时限定搜索范围避免无关内容干扰结果。把文档喂给 Khoj之后找答案的方式就从翻文件变成问一句而且每个回答都能追到出处。三步本地部署完成后你可以接着读 setup 文档 配置聊天模型参考 功能清单 解锁 Agent 与自动化代码层面路由层入口在 src/khoj/routers/有兴趣动手改改欢迎从社区的 good first issues 开始贡献。【免费下载链接】khojYour AI second brain. Self-hostable. Get answers from the web or your docs. Build custom agents, schedule automations, do deep research. Turn any online or local LLM into your personal, autonomous AI (gpt, claude, gemini, llama, qwen, mistral). Get started - free.项目地址: https://gitcode.com/GitHub_Trending/kh/khoj创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考