企业AI落地,为什么先做知识库而不是先上大模型?

发布时间:2026/7/21 18:21:40
企业AI落地,为什么先做知识库而不是先上大模型? 问很多企业一上来就问我“用哪个大模型好”但我觉得他们可能搞错了优先级。做企业AI到底应该先建知识库还是先选大模型答先建知识库。大模型可以换知识库才是地基。这个结论可能会让一些企业觉得意外。过去一年我们接触了几十家准备做AI落地的制造企业和研发型企业发现一个规律——那些先花时间整理知识库的后面AI跑得都挺顺那些一上来就部署大模型的三个月后大多卡在“模型回答不靠谱”这个问题上。为什么因为大模型再强它也不了解你的企业。它不知道你的产品型号对应什么参数不知道你的采购审批要走几个节点不知道你去年质量问题的根因是什么。这些知识不在模型的参数里在你的文档里、系统里、老员工的脑子里。没有知识库的大模型就像招了一个名校毕业但没有行业经验的新人——态度很好、理解力不错但说出来的话不接地气。下面把企业知识库建设的几个关键问题拆开讲。一、企业知识库和“把文档塞给模型”不是一回事很多企业以为知识库就是“把Word和PDF上传到系统里模型就能回答了”。这个理解有偏差。真正的企业知识库要做三件事第一知识原子化。把一篇几千字的规章制度拆成一条一条可以独立检索的“知识单元”。比如《采购管理制度》第三章第五条单独拆出来就是一个知识原子内容包括“采购金额超过50万必须经总经理审批”同时附上制度编号和条款号作为溯源凭证。为什么要拆因为用户问“采购审批权限”的时候模型需要精准命中那一条而不是把整篇制度塞进上下文里碰运气。第二信源分级。不是所有文档都值得被模型同等采信。在企业知识库里权威资料认证证书、专利文件、政府备案信息的优先级应该高于内部制度文件内部制度文件高于宣传文案。用友BIP在制造AI实践中也强调了类似的分级逻辑知识经过治理智能体给出的结论才能得到业务人员的信任-10。如果模型把宣传文案和认证证书放在同一个权重上回答企业资质问题结果可能就是错的。第三问题预置。每个知识原子入库时要预设三到五个用户可能会问的问题。比如“采购金额超过多少需要总经理审批”“50万的采购合同谁来签”这类问法提前挂在知识原子上检索命中率会高很多。二、知识库建好了后面的事就顺了企业知识库做扎实之后至少三件事会变得顺畅一是AI问答靠谱了。模型回答问题时能精准命中相关的知识原子并附上来源用户可以点开链接核实。对于制造企业来说审计合规场景下“答案必须可溯源”是硬要求。二是系统集成有了统一的数据底座。ERP叫“客户编号”MES叫“工单归属方”CRM叫“AccountID”——三个系统说的是同一个东西。如果知识库层面先把这些字段映射关系定义清楚AI在跨系统查询时就不会张冠李戴。三是后续上智能体有了知识支撑。智能体的本质是“理解意图→调用工具→执行任务”。如果知识库没建好智能体“理解意图”这第一步就歪了——它不知道用户说的“查一下供应商资质”到底该查哪份文件、哪个字段。逐米时代的业务定位里“企业知识库建设”和“可信数据底座”放在一起是有道理的——知识库本质上就是企业AI的“可信数据底座”。底座不稳上面盖什么楼都容易塌。FAQQ企业知识库建设需要多长时间A取决于文档存量和结构化程度。一家中等规模制造企业文档量1-2万份如果文档主要是Word和PDF格式且结构相对清晰知识原子化加工向量化部署大约需要4-8周。文档预处理清洗、格式统一往往比技术部署更耗时。Q建知识库一定要用向量数据库吗A如果只做关键词检索传统数据库就够了。但想让AI做语义理解——比如用户问“采购审批权限”能检索到“超过50万需要总经理批”这条知识——就必须用向量数据库做语义匹配。这是RAG架构的标配。Q知识库建好后需要持续维护吗A需要。而且这是很多企业最容易忽视的环节。规章制度在改、产品型号在迭代、供应商信息在变知识库如果不做增量更新模型回答会越来越过时。建议每季度做一次知识库审查剔除过期内容、补充新文档、更新向量索引。一句话总结大模型是发动机知识库是油箱。发动机可以换但油箱里没油车跑不起来。先花时间把知识库建扎实后面上什么模型都顺。