Search Console 里 sitemap 显示「无法获取」(Couldn't fetch),是外贸站长常遇到的一类提示。它看起来像技术故障,但这个提示不一定意味着 sitemap 文件本身有问题。Google 的 John Mueller 在 10 月 1 日那期 Search Off the Record 播客里,和 Martin Splitt 聊到了两件相关的事:AI 训练爬虫怎么找 sitemap,以及「无法获取」到底该往哪儿查。据 Search Engine Journal 报道,这期内容后来被整理进了 SEO(搜索引擎优化) Pulse 合集。
这两件事其实指向同一个问题:sitemap 的可见性,不只取决于你有没有提交给 Google。下面按排查顺序展开。
Mueller 在播客里说了什么:两段话,两个问题
据 Search Engine Journal 的报道,Mueller 在播客里讲了两层意思。
第一层,AI 训练爬虫通常没有给网站提供提交 sitemap 的入口。想让它们找到你的内容,得靠默认文件名,比如 sitemap.xml,或者一个 RSS feed。他还提到,在自己的服务器日志里,确实看到过 AI 爬虫来访问 sitemap 和 RSS 文件。
第二层,对于格式合法、但 Search Console 显示「无法获取」的 sitemap,他给了两个原因:主机负载,以及抓取需求不足。他说抓取需求不足这件事,常常和网站被感知的质量有关——这是他本人的说法,不是 Google 的官方定论。
AI 训练爬虫没有「提交入口」,sitemap 只能靠被发现
Google 这边有 Search Console,你可以主动把 sitemap 提交上去。但 AI 训练爬虫通常没有类似的控制台。没有提交入口,就意味着它们只能靠「发现」——顺着 robots.txt、顺着默认路径、顺着 feed 去找。
Mueller 描述的那种情况,三种条件叠在一起时最麻烦:文件名不常见、robots.txt 里没写、而且你只向 Google 提交过。直接提交能为 Google 提供发现入口;但文件名不常见、robots.txt 未声明时,其他系统会更难发现这个 sitemap。
这里可以借一个判断框架来理解:AI 获取信息大致分几条路径——训练数据、实时检索、工具或 API 调用。训练爬虫抓取的内容可能被用于模型训练;被抓取并不代表一定进入训练数据或被模型记住。而搜索类爬虫服务的是实时检索,它需要能随时找到最新的页面。这两条路径对 sitemap 的依赖方式不一样,放行策略也应该分开考虑。如果你在做面向 AI 搜索的可见性优化,这一步属于最基础的前提。
怎么做:三步让 sitemap 和 RSS 能被找到
结合 Mueller 的建议和 Google 官方文档,可以先做三项检查。
- 用默认文件名。Mueller 建议使用 sitemap.xml 这样的常见默认文件名。如果你的 CMS 已经生成了这个文件,先确认它能正常打开,再考虑改名字的事。
- 在 robots.txt 里声明。加一行 Sitemap: 指向你的 sitemap 完整地址,这是标准的发现方式。注意这行只是告诉爬虫「文件在这里」,不等于请求它来抓。
- 配一个 RSS 或 Atom feed。Google 官方文档里提到,CMS 生成的 RSS/Atom feed 可以作为 sitemap 提交。Mueller 在播客里也建议了 RSS 这条路,两个来源互相印证。
需要说清楚的是:让 AI 系统能顺利找到并读取页面,是被提取、被引用之前的前置条件。它是必要条件,不是充分条件——找到了不等于会被用。顺带一提,XML sitemap 给爬虫看,给用户看的 HTML 网站地图是另一件事,别把两者混在一个文件里。
在服务器日志里看 AI 爬虫:怎么看,以及能证明什么、不能证明什么
Mueller 说他是在自己的日志里看到 AI 爬虫访问 sitemap 和 RSS 的。你想做同样的观察,可以这样筛:
- 在日志里搜 sitemap.xml、sitemap_index.xml、feed、rss 这类路径关键词;
- 看请求的 User-Agent 字段,把疑似 AI 爬虫的行单独拉出来;
- 记录请求时间、频率、返回状态码,判断是偶发访问还是持续抓取。
下面是一行日志格式示意(仅用于说明字段结构,不是任何真实记录):
2026-10-01 08:12:33 GET /sitemap.xml 200 "Mozilla/5.0 (compatible; SomeBot/1.0)"
这里有个必须提醒的点:User-Agent 是可以被冒用的,光看名字不能确定身份。要核验,得对照官方公布的 IP 范围,比如 OpenAI 公布的 gptbot.json 和 searchbot.json。据 OpenAI 官方文档,他们公布了这些 IP 段供网站核验。这套做法目前只代表 OpenAI 一家,不能推广到所有 AI 爬虫。
还有个更重要的边界:看到请求,只能证明文件被请求过,不足以判断抓取用途、页面收录或引用结果。Mueller 也没有说那些爬虫是哪些、拿文件做了什么。所以别从日志里推出「ChatGPT 会读你的 sitemap」这种结论——被抓取和被 AI 引用之间还隔着好几步。
GPTBot 和 OAI-SearchBot 是两回事:放行前先想清楚用途
据 OpenAI 官方文档,这两个爬虫的用途是分开的:OAI-SearchBot 用于搜索结果展示,GPTBot 用于训练。它们可以在 robots.txt 里分别放行或屏蔽。
回到前面那个框架:训练爬虫抓取的内容可能被用于模型训练;被抓取并不代表一定进入训练数据或被模型记住。搜索爬虫服务的是实时检索。用途不同,取舍就不同。外贸站可以先问自己:我希望自己的产品页出现在 AI 搜索的实时结果里吗?如果希望,OAI-SearchBot 这条线值得放行。至于训练数据这条线,取决于你对内容被用于模型训练的接受程度。
文档里还有一句值得注意:两个爬虫都放行时,一次抓取可能同时服务两个用途。是「可能」,不是一定。所以如果你只想放行其中一个,就在 robots.txt 里明确写清楚。
怎么做:Search Console 显示「无法获取」时的排查顺序
先说文件侧。先查看 sitemap 详情中的具体错误:「无法获取」先检查地址是否正确、robots.txt 是否阻止抓取,以及是否存在未解决的手动操作;文件已成功获取但报告解析错误时,再检查 XML、路径范围和超限问题。Search Console 的 Sitemaps report 帮助页对这两类错误有明确区分。
文件确认没问题、状态还是「无法获取」,再看 Mueller 给的两个原因:
- 主机负载。Mueller 将它列为合法 sitemap 仍显示「无法获取」的原因之一;不能仅凭这个提示确定具体故障。
- 抓取需求不足。据 SEJ 报道,Search Console 帮助页也列出了抓取需求低这一项。Mueller 说这常与网站被感知的质量有关——这是他的说法,不是官方结论。
如果是文件侧的问题,修完之后重新抓取和收录也需要时间,这部分可以看修完问题后 Google 重新抓取和收录要多久。
外贸站的 sitemap 维护清单
最后是几条日常维护的规则。前四条来自 Google 官方文档;llms.txt 的建议来自 Mueller 在播客里的表态。
- 拆分。超过 50,000 条 URL,或未压缩体积超过 50MB,就必须拆分。sitemap index 是可选的,不是必须——别被「一定要用 index 汇总」这种说法带偏。
- 不要写 priority 和 changefreq。Google 会忽略这两个字段,写了也不起作用。
- lastmod 应持续准确且可验证。它要反映页面最后一次重大更新;满足这些条件时,Google 才会使用该值。如果你的更新时间戳经常乱填,它就不会被采信。
- 提交只是提示。Google 不保证会下载你的 sitemap,也不保证会用于抓取。提交是提高发现概率,不是保证收录。
- llms.txt 可以试,别依赖。Mueller 表示,Google 目前不能将它作为 sitemap 使用;他不反对尝试,但建议不要依赖它。目前只有一些llms.txt 的实测情况可供参考。
还有一句要说在前面:sitemap 只解决「被找到」这一步。维护 sitemap 之外,也应检查页面是否清楚说明产品、用途和关键事实;内容清晰不保证被引用。这些规则看起来琐碎,但真出问题时,往往就是卡在其中一条上。如果你需要有人帮忙过一遍,sitemap 拆分、抓取诊断这类技术 SEO 排查是可以外包的活。
Search Console 里的 sitemap 一直显示「无法获取」,或者拿不准 AI 爬虫该放行哪些?把网址和截图发到 联系我们,我们帮你先排一遍文件侧的问题。
参考资料
- Search Engine Journal, Google Ends Spam Update, Shares Crawl Timing Ranges – SEO Pulse: https://www.searchenginejournal.com/seo-pulse-google-spam-update-crawl-timing-ranges/592469/
- Search Engine Journal, Google's Mueller Says AI Crawlers Access Sitemaps & RSS In His Logs: https://www.searchenginejournal.com/googles-mueller-says-ai-crawlers-access-sitemaps-rss-in-his-logs/592012/
- Google Search Central, Build and Submit a Sitemap: https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap
- OpenAI, Overview of OpenAI Crawlers: https://developers.openai.com/api/docs/bots
- Search Console Help, Sitemaps report: https://support.google.com/webmasters/answer/7451001