为什么 QMedia 的多模态 RAG 问答更聪明?图文短视频内容检索与智能问答使用详解

发布时间:2026/8/22 14:29:22
为什么 QMedia 的多模态 RAG 问答更聪明?图文短视频内容检索与智能问答使用详解 为什么 QMedia 的多模态 RAG 问答更聪明图文短视频内容检索与智能问答使用详解【免费下载链接】QmediaAn open-source AI content search engine designed specifically for content creators. Supports extraction of text, images, and short videos. Allows full local deployment (web app, RAG server, LLM server). Supports multi-modal RAG content QA.项目地址: https://gitcode.com/gh_mirrors/qm/QmediaQMedia是一个专为内容创作者打造的开源 AI 内容搜索引擎支持图文、短视频内容的信息提取与多模态 RAG 问答。它通过 OCR 识别图片文字、Whisper 转写视频语音、大模型生成视频摘要把散落在图片与短视频里的信息变成可检索、可问答的向量知识库还能全本地部署让私有内容问答更智能、更安全。为什么 QMedia 的多模态 RAG 问答更聪明传统 RAG 问答只能检索纯文本而内容创作者的素材大多是图片、图文笔记和短视频——信息藏在图片文字里、藏在视频口播中普通搜索引擎根本看不见。QMedia 的做法是先把多模态内容翻译成结构化文本再建立向量索引让大模型基于这些上下文作答。它更聪明的三个关键点聪明点说明️ 图文双通道检索文本向量BGE 图像向量CLIP并行召回搜内容也能搜画面 视频内容深度解析Faster Whisper 转写口播文案再用 LLM 生成视频摘要 答案可溯源问答结果以内容卡片展示来源拆解每条图文/短视频的信息下面按内容解析 → 向量检索 → 本地上手的顺序拆解它的实现逻辑。内容理解先行图文短视频的 4 条解析通道QMedia 的核心思路是问答质量取决于内容解析质量。启动服务时mmrag_server会读取assets/medias中的图片/视频调用mm_server的模型服务逐条解析核心代码见 nodes.py。它内置了 4 条 Reader 解析管道图片基础信息ImageReader读取图片元数据图片 OCR 文字识别ImageOcrReader调用本地 OCR 模型把图片里的文字全部读出来见 image_ocr.py短视频转写与摘要AudioTranscriptionReader先用 moviepy 从视频中提取音频调mm_server的/api/audio_transcription接口转写文案再让 LLM 生成视频摘要见 video.py笔记文本信息NoteInfoReader提取图文笔记的标题、正文等文本。解析完成后文档按句子切分SentenceSplitter构建为多模态向量索引MultiModalVectorStoreIndex并持久化到本地db下次启动无需重复解析。 这套解析管道全部走本地模型 API视频转写、OCR、编码互不干扰模型服务单独部署在 mm_server/api/ 下方便按需替换。双通道向量检索文本和图片一起找检索环节是聪明的另一半。mm_retriver.py 中的 RAG 管道同时配置了两个召回参数similarity_top_k文本向量召回条数BGE 文本编码image_similarity_top_k图像向量召回条数CLIP 图像编码将图片编码到与文本同空间。也就是说你用美食教程这样的文字提问系统既会匹配文本语义也会通过 CLIP 匹配看起来像美食的图片内容双路召回后按笔记 ID 去重最终交给 LLM如 llava-llama3 视觉模型综合作答。相关的模型能力都以 REST API 形式暴露在mm_server的 API 文档页可以看到快速上手3 步本地启动多模态 RAG 问答QMedia 由三个独立服务组成可按需组合部署服务职责端口mm_server多模态模型服务OCR、CLIP 编码、Whisper 转写、LLM50110mmrag_server内容卡片展示 RAG 检索问答8001qmedia_web网页前端Next.js TailwindCSS—第一步启动模型服务cd mm_server source activate qllm python main.py第二步启动 RAG 问答服务cd mmrag_server source activate qmedia python main.py第三步启动网页cd qmedia_web pnpm dev启动后mmrag_server会自动读取assets/medias与assets/mm_pseudo_data.json的示例数据调用mm_server提取信息并写入db。打开网页输入问题如 How to Vlog即可获得答案和对应的内容卡片来源。多模态问答相关的三个核心接口/embedding-mm构建检索管道、/mm-rag-search双通道召回内容卡片、/mm-rag-queryLLM 合成答案实现见 mm_rag_search.py换成自己的内容3 步搭建私有内容搜索引擎把示例数据换成你自己的图文/短视频就能得到一个私有化多模态 RAG 问答库把自有图片/视频放入assets/medias/把对应的内容卡片数据写入assets/mm_pseudo_data.json字段参考 json_data.py删除历史db文件后重启服务模型会自动重新提取信息并入库。配置项都在 mmrag_server/config.py.local 中重点几个use_video_service是否启用视频转写默认关闭开启后短视频也能被问答model_name/mm_model_nameLLM 与视觉模型名称clip_model_name/embedding_model_name图像、文本编码模型。常见问题速答问不想要网页只想用 API 做问答可以只部署mm_servermmrag_server直接调用/mm-rag-search和/mm-rag-query接口实现纯 Python 环境的多模态 RAG 检索问答。问视频解析为什么默认关闭视频转写需要 Whisper 模型CPU 上也能跑但耗时较长。配置use_video_serviceTrue并确认mm_server已部署后即可开启。问模型资源不够怎么办mm_server支持模型生命周期管理keep_alive配置空闲自动释放显存8B 本地小模型即可体验完整流程服务器充足时可换 70B 提升回答质量详见 mm_server/README.zh-CN.md。小结QMedia 的聪明来自三层设计——多通道内容解析让图片文字和视频口播全部变成可检索文本图文双向量召回让检索既懂语义又懂画面内容卡片溯源让每个答案都有据可查。全链路可本地部署是内容创作者搭建私有 AI 内容搜索引擎的完整方案。【免费下载链接】QmediaAn open-source AI content search engine designed specifically for content creators. Supports extraction of text, images, and short videos. Allows full local deployment (web app, RAG server, LLM server). Supports multi-modal RAG content QA.项目地址: https://gitcode.com/gh_mirrors/qm/Qmedia创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考