先说背景:我今天刚给这个博客加了 llms.txt。
加的时候我写的理由是「给 LLM 的站点导览」。现在我把公开数据翻了一遍 —— 那个理由,站不住。
这篇文章是给自己做的一次纠偏。
先看数据
llms.txt 是 2024 年 9 月由 Jeremy Howard 提出的一个提议:在站点根目录放一个 Markdown 文件,列出你认为最重要的页面,供 AI 系统优先读取。
采纳率确实在涨。但消费端的数据很难看:
| 研究 | 结论 |
|---|---|
| Ahrefs,13.7 万域名(2026 年 5 月) | 约 3.8 万个拥有有效 llms.txt 的站点里,97% 完全没有收到过对它的请求 |
| 同上 | AI 检索类爬虫(真正服务用户查询的那些)只占请求量的 1.1% |
| SE Ranking,30 万域名 | 拥有该文件与是否被 AI 引用,无相关性 —— 以至于从模型里去掉这个变量,模型表现反而更好 |
| 同上 | 最常被 AI 引用的 50 个域名里,只有 1 个有 llms.txt |
| HTTP Archive,2025 Web Almanac | 已发布的文件里约 40% 是插件生成的默认内容,不是认真写的 |
还有两件事更值得注意:
Google 已经明确说不支持。 Gary Illyes 在 2025 年 7 月表态 Google 不打算支持、也不会为排名抓取它;John Mueller 把它类比成那个早已被废弃的 keywords meta 标签。Google 2026 年的生成式 AI 文档把它列在”不必要的做法”里。
没有任何主流 AI 厂商公开承诺会读它。 OpenAI、Anthropic、Perplexity、Google —— 截至 2026 年 9 月,没有一家在文档里写明自己的答案引擎会消费这个文件。
所以如果加 llms.txt 的目的是”提升在 ChatGPT / AI Overviews 里的露出”,那么依据是:没有依据。
但有个例外,而且它不是 SEO
搜索侧说”不”,但代理(agent)侧是另一回事。
Chrome 2026 年 5 月的 Lighthouse 文档里这样描述它:
「一种新兴约定,用于提供网站的机器可读摘要」; 没有它,「agents may spend more time crawling the site to understand its high-level structure」。
注意措辞:这里说的是实时浏览网站的 AI agent —— 那种为了完成某个任务、当场去抓你的文档的自动化助手,不是搜索排名。Chrome 也很克制地称它”目前是可选的”,Lighthouse 审计只在服务器实际报错时才报警,文件缺失视为 “Not Applicable”。
这个区别很关键,因为它决定了什么站值得加:
| 站点类型 | 值得加吗 |
|---|---|
| 开发工具 / API / 文档密集型产品 | 值得 —— IDE agent(Cursor、Claude Code、Copilot、Windsurf)确实会抓它取干净文档 |
| 有技术文档的 SaaS | 可能值得 —— 成本低,代理化浏览在增长 |
| 追 AI Overviews 的营销站 | 没有可测量的收益,不如把时间花在内容上 |
| 博客 / 内容站 | 可选 —— 无害,但别指望引用提升 |
那么我为什么还是留着
三条理由,没有一条是”它会让我被引用”:
1. 成本近乎为零,而它是个便宜的期权。 二十分钟的事,下行风险是零。如果代理化路由真的标准化了,你已经在场。这是笔不对称的赌注 —— 但是期权,不是策略。
2. 写它是个有用的强制动作。 为了给四十几篇内容各写一句摘要,我被迫把整个站点过了一遍。这个过程暴露的是重复内容、孤立页面、以及那些其实什么也没说的页面。这次审计的价值比文件本身大。
3. 它是”对代理的界面”,不是 SEO 产物。 真正有意思的用例不是搜索引用,而是一个 agent 在试图搞清楚”这个站点提供什么、每一类的权威页面在哪”。
如果要写,怎么写才不算浪费
按提议的规范,Markdown 格式:
# 站点名
> 一段话说明这个组织做什么、服务谁、内容的权威性从哪来。
可选正文:站点范围、覆盖什么不覆盖什么、许可与引用偏好。
## 核心内容
- [页面标题](绝对URL): 一句话说明这页回答什么。
## 参考
- [术语表](URL): 一句话说明。
几条经验:
- 放在
/llms.txt,用text/plain提供。 用绝对 URL。 - 狠心筛选。 十到四十个真正重要的页面,不要直接把 sitemap 倒进去。这个文件相对 sitemap 的唯一优势就是编辑判断。
- 标注最后更新日期,并且真的去更新它。 过期的文件比没有更糟 —— 那是给代理的错误信号。
- 不要做全站 Markdown 镜像(
llms-full.txt),除非你处理得好索引问题。一个 200KB、与线上页面逐渐脱节的副本,是个比没有更差的信号。
一条更根本的排序
这轮数据给我最大的提醒不是关于 llms.txt 的,而是关于优先级:
花在打磨
llms.txt上的时间,是从别处挪来的 —— 而robots.txt决定 AI 爬虫能不能碰到你的内容,sitemap仍然驱动发现。
如果你的爬虫在 robots.txt 里被挡了,再完美的 llms.txt 也救不了你。
先把那两个有强制力、被正式支持的信号做对,再把 llms.txt 当成可选的整理工作。
说回我自己
我今天加这个文件时,写的是「给 LLM 的站点导览」—— 这个说法暗示了它有用,而数据并不支持。
校准后的版本应该是:
它是一个成本极低、当前收益接近零、但在代理化浏览这条路上可能升值的文件。加它不亏,但别为它写文章吹牛 —— 包括现在这篇。
我留着它。理由从”它能提升 AI 可见性”改成了”它是笔便宜的期权,而且写它的过程帮我做了一次内容审计”。
这两个理由的差别,大概就是「SEO 话术」和「实话」的差别。