llms.txt 这个文件,最近在 SEO(搜索引擎优化) 圈子里很火。简单说,它是一个放在网站根目录的 Markdown 文件,作用类似"给 AI 爬虫看的站点地图":用 H1 写站名、H2 分组、带描述的链接,告诉 AI 你的网站有哪些重要页面。听起来很美好——但 Semrush 的实测数据泼了一盆冷水。
先看数据:14 个月,采用量涨了 17.5 倍
根据 Semrush 的统计,llms.txt 的采用量在 14 个月里从 951 个域名涨到了 16,670 个,涨了 17.5 倍。不少建站公司和 SEO 服务商把它当成"AI 时代必备动作"在推。但热闹归热闹,有一个关键问题没人回答:AI 爬虫到底读不读这个文件?
Semrush 实测:放了文件,AI 爬虫一次没来
Semrush 在自家网站上做了实测:放上 llms.txt 之后,AI 可见度没有出现相关性提升。更直接的证据是服务器日志——GPTBot、ClaudeBot、PerplexityBot、Google-Extended,一次都没有访问过这个文件。
而且到目前为止,没有一家主流 AI 平台确认会读取 llms.txt。Google 的 John Mueller 明确表示 AI 系统不用它。Lighthouse 虽然会检查 llms.txt,但那只是一个审计项,不代表 Google 爬虫真的会用。连 Anthropic 自己都放了 llms.txt——但这不代表它的爬虫在读。Google 那边则在推自家的 Open Knowledge Format(OKF),面向内部 agent 使用。
到底要不要做?可以做,但别当回事
结论是:把它当成一个低成本实验,而不是战略动作。文件本身成本很低:根目录放一个 Markdown 文件,H1 写站名、H2 做分组、链接配上描述,优先放产品页、价格页、常青博客、About 和 Contact 页面。半小时能做完的事,做了不亏。
但别指望它带来流量。我们此前关于 AI 信息获取机制的研究说得很直接:llms.txt 是为 AI 可读性提出的新标准,2026 年仍在提案阶段,目前尚无主要 LLM 提供商确认实际使用——"关注进展,但暂时不要把它作为核心 SEO 动作"。
真正该做的四件事
AI 爬虫真正读的是你的网站本身,不是这个附带文件。Semrush 的另一份指南里有个数据值得记:被 AI 引用的页面,在清晰度上高出 33%、Q&A 格式高出 25%、章节结构高出 23%——结构化写作直接决定 AI 会不会引用你。
所以预算和精力应该花在这四件事上:
- robots.txt 别挡 AI 爬虫。GEO(生成式引擎优化) 最佳实践清单里明确建议:放行 Bingbot 和 OAI-SearchBot,同时允许 ChatGPT-User(实时答案查询用)。很多网站的 WAF 或 robots 把 AI 爬虫挡在门外,自己还不知道。
- 内容写给 AI 读。价格、参数、交期这些关键信息写在正文里,别只藏在 JSON-LD 或图片里;多用 Q&A 和小节结构。
- sitemap 保持更新。XML sitemap 维持更新,大站点用分段 sitemap——这是 AI 爬虫和传统爬虫都认的"正经"地图。
- 全网事实保持一致。公司名、产品参数、联系方式,在官网、社媒、B2B(企业对企业) 平台上说同一套话,AI 引用时才不会张冠李戴。
这四件事里,前两件是很多外贸网站的盲区。如果你的技术团队搞不定 robots 和爬虫配置,谷歌SEO代运营可以把这套地基一次性打好——AI 时代的地基,和传统 SEO 的地基是同一套。
一句话总结
llms.txt 可以花半小时做一个,但别把它当成 AI 搜索优化的入场券。AI 爬虫认的是 robots 放行、结构清晰、事实一致的网站本身。更多 AI 搜索的实操拆解,我们会持续更新在博客里。
不确定你家网站的 AI 爬虫放行状态?来这里留个言,说说你的网址和用的建站系统,我们帮你看看 robots 和结构有没有挡住 AI。
参考与取材
- Semrush《What is llms.txt & should you use it?》:semrush.com/blog/llms-txt
- Semrush《10 SEO best practices for Google and AI search》:semrush.com/blog/seo-best-practices