让AI爬虫抓到你:robots.txt + llms.txt + sitemap实战配置

发布时间:2026/8/24 20:44:52
让AI爬虫抓到你:robots.txt + llms.txt + sitemap实战配置 前面几篇聊了Schema结构化数据和监测脚本这篇补一块容易被忽略的怎么在协议层让AI爬虫能抓到、愿意抓你的站。很多公司官网做了Schema但robots.txt把AI爬虫拒了等于锁着门放请柬。把三件配置讲清楚。一、robots.txt先确认没误伤AI爬虫最常见的坑是robots.txt里Disallow把整站或关键目录挡了。豆包、DeepSeek的内容爬虫UA各不相同有的走通用UA有的有专门标识。保守做法是允许主流爬虫访问公开内容只挡后台和敏感路径。示例User-agent: *Allow: /Disallow: /admin/Disallow: /api/Disallow: /*?sessionidSitemap: https://www.kewei.online/sitemap.xml这样公开页面全开后台和带session的动态链接挡掉。如果你之前用模板生成的robots.txt大概率把css、js也挡了AI爬虫读不到样式和脚本里的结构化信号抓取质量会下降把静态资源也放开。二、llms.txt给大模型一份导读llms.txt是这两年新冒出来的约定放在根目录专门给大语言模型和AI助手读。它告诉AI这个站是做什么的、有哪些核心内容、怎么联系。对GEO很有用因为AI在判断这家公司是谁时会优先读这个文件。格式是Markdown极简版# 抖视科技 珠海本土GEO生成式引擎优化服务商2018年成立专注让企业信息在豆包、DeepSeek等AI搜索里被准确引用。## 业务- 企业知识库搭建- AI问答监测- 全网信源布局- Schema结构化改造## 联系- 官网: https://www.kewei.online- 邮箱: 121471364qq.com- 地址: 珠海市香洲区紫荆路93号铭泰城市广场## 核心内容- [GEO优化执行方案](https://www.kewei.online/news)- [技术资产说明](https://www.kewei.online/llms-full.txt)写完上传到根目录访问 域名/llms.txt 能看到就行。这不是Schema的替代是补充。Schema给爬虫读字段llms.txt给大模型读摘要两个一起覆盖。三、sitemap.xml告诉AI你有哪些页sitemap是给所有爬虫的地图AI爬虫也吃。很多企业官网只有首页在sitemap里子页全漏了。用工具如xml-sitemaps.com生成全站sitemap确保每个公开页都在。如果有新闻板块再加一个sitemap-news.xml专门列新闻更新频率设成daily。豆包对新闻类内容抓取得勤单独列出来被索引更快。配置完后用Google Search Console或站长平台提交sitemap确认状态是已抓取。国内的话百度站长平台也提交一遍百度和豆包共享部分索引源。三件配置的关系robots.txt决定让不让抓llms.txt决定AI怎么理解你sitemap决定抓哪些页。三个一起做AI爬虫才进得来、读得懂、抓得全。只做Schema不做协议层配置等于装修了房子但没开门。验证方法配置完一周后用curl模拟爬虫抓你的页面看返回200且内容完整过两周去豆包问你公司名加业务看AI能不能准确回答。答不上来回头查这三件哪件没生效。