llms.txt 到底有没有用?我们自己也放了一个,但证据说它基本不动引用
llms.txt 到底有没有用?
三份互不相干的测量——SE Ranking 约 30 万域名、Ahrefs 13.7 万站点的服务器日志、Otterly 90 天的 AI 爬虫日志——指向同一个结论:llms.txt 不影响 AI 引用。这篇讲清楚这个文件真正能干什么、唯一有真实流量的场景是哪个,以及我们为什么还是放了一个。
结论先行
大概率没用——至少对多数人放它的那个目的没用。llms.txt 被包装成一个 AI 可见度的杠杆:加上这个文件,就能被 ChatGPT、Perplexity、Google 的 AI 回答引用。三份互不相干、方法各异的测量,都测不出这个效果。SE Ranking 在约 30 万个域名上把这个文件和被引用频率做了对照,什么相关都没有。Ahrefs 读了 13.7 万个站点的服务器日志,发现已发布的 llms.txt 文件里 97% 从来没被任何东西抓取过。Otterly 在一个正确部署了该文件的域名上记录了 90 天的 AI 爬虫流量,碰到这个文件的只有 0.1%。
按理说,最不该讲这话的就是我们。我们卖白帽 GEO,specmora.com 上现在就挂着一份 llms.txt。但对证据的诚实解读是:这个文件只有一个真实、可测量的受众——读开发者文档的 coding agent——对 AI 回答会不会引用你,没有可检测的影响。我们留着自己那份,是因为它成本为零、而那个受众是真的。我们不会把它当增长杠杆来卖;谁这么卖,你都该多留个心眼。
llms.txt 本来是设计来干什么的
提案来自 Jeremy Howard,2024 年 9 月。按 llmstxt.org 上的规范,它是放在 /llms.txt 的一个 markdown 文件:一个写着站点名的 H1、一段简短概述、然后是几组精选的重要页面链接——让一个在推理时要用你网站的语言模型,不必把上下文窗口浪费在导航、广告和标记上,就能找到该看的内容。
从这个设计能推出两件事,而围绕这个文件的营销恰恰爱把它们搅浑。第一,llms.txt 不是「AI 版 robots.txt」。它管不了爬虫能抓什么;它是一份菜单,不是一道门。第二,它从来没被提议为排名或引用信号。它帮的是一个已经决定要用你网站的模型,让它用得更省力。至于到底有没有东西来读这份菜单——这是个实证问题,后来的测量回答的正是它。
没有一家引擎说过自己在用它
在日志数据出现之前,就已经有一个很说明问题的沉默:没有任何一家主流答案引擎——Google 没有、OpenAI 没有、Anthropic 没有、Perplexity 也没有——声明过自己在搜索或答案里使用 llms.txt。Google 的 John Mueller 在 2025 年 4 月说得很直白:「据我所知,没有任何 AI 服务说过它们在用 LLMs.TXT(而且你看看自己的服务器日志就知道,它们连查都不来查)。」他把它比作 keywords meta 标签——一份站长自己声称「我的站是讲什么的」的自述,搜索引擎早就学会无视它了,因为造假毫无成本,而引擎完全可以直接去读你的站。
这还只是一个人对「缺席」的观察。后来的几份研究在规模上验证了真实行为,结果站在他这边。
三份测量,一个结果
SE Ranking:约 30 万域名,零相关。 SE Ranking 分析了近 30 万个域名——其中约 10% 有这个文件——用 Spearman 相关、XGBoost 模型和 SHAP 因子分析,检验有没有 llms.txt 与域名在 LLM 回答里被引用的频率之间的关系。没有关系。最扎心的细节是:把 llms.txt 这个变量从模型里拿掉之后,预测反而变准了。这个文件连弱信号都算不上,它是噪声。
Ahrefs:97% 的文件从来没人读。 2026 年 6 月,Ahrefs 分析了 137,210 个域名的服务器日志和爬虫数据。约 28% 发布了 llms.txt——这个比例偏高,因为 Ahrefs 的客户群偏技术,当上限看就好。核心结论:这些文件里 97% 在统计当月收到的请求是零。不是很少——是零,任何东西都没来过,AI 也好别的也罢。而在剩下 3% 的文件真正收到的请求里,96% 来自机器人,其中最大的单一类别是 SEO 审计工具,占 21.7%——这个行业在检查自己造出来的东西。真正为用户生成答案而抓页面的 AI 检索爬虫,只占 1.1%。
Otterly:AI 爬虫流量的 0.1%。 OtterlyAI 在一个正确部署了 llms.txt 的域名上记录了 90 天的 AI 爬虫流量:62,100 多次 AI 爬虫访问里,请求这个文件的是 84 次——约 0.1%,大概只有同站一个普通内容页的三分之一。他们的结论直接到把 llms.txt 检查项从自家 GEO 审计产品里删掉了,理由是它在分散注意力,挤占了真正影响引用的因素。
三种互不相干的方法——引用层面的相关分析、大规模日志分析、单站深度日志——落在同一个地方,在这个领域里已经是能拿到的最硬的证据了。人们为之发布这个文件的那些系统,并不来读它;有没有它,和被不被引用无关。
那它为什么还传开了
值得诚实说一句:一个没有证据支撑的文件,为什么会出现在这么多审计清单上——有一阵子连本该更懂行的人的清单里都有。因为这个类比太好卖了:robots.txt 和 sitemap 都是放在站点根目录的文件,它们都管用,那么为新一类爬虫在根目录再放一个文件,感觉就是同一类工作。它便宜、好推荐、完成与否一眼可查,还能让服务商在第一周就交出一个「交付物」。但这些都不能让它产生任何作用。这个模式在 SEO 二十年的民间偏方史里太眼熟了——传播最快的招数,永远是最容易执行的,而不是被测出有效的。
它唯一真正有读者的场景
Ahrefs 的爬虫构成分析里有一个真正的意外,而它恰好指向这个文件的真实受众。在确实来抓 llms.txt 的 AI 工具里,coding agent 和 agent 基础设施以 10.5% 的请求占比领先。整体上抓这个文件最多的是 GPTBot(约占抓取量的 4.51%);但把它和一个研究型爬虫排除在外,Claude Code(Anthropic 的编码 agent)一家的抓取量,就超过了数据集里其余所有的 AI 检索爬虫、AI 助手和训练爬虫。
这和当初的设计意图严丝合缝。开发者向一个 coding agent 问你家 API 的问题时,agent 得在有限的上下文窗口里翻你的文档,一份精选的 markdown 文档地图对它是真有用的。这也是为什么 llms.txt 真正落地、真正起作用的地方是开发者文档平台:Mintlify 给它托管的每个文档站自动生成 llms.txt(外加一份全文版 llms-full.txt),Anthropic 自己的 API 文档也挂着一份。
所以诚实的分法是:你发布的是开发者文档,那就放——今天它有真实的读者。你发布的是营销站,证据说没有东西会来读它。
那我们为什么还放一个
因为它的成本低到在这个行业里找不出更低的了。生成这个文件是几分钟的事,而且平台越来越多会替你生成——Ahrefs 自己给出的建议,在发表了迄今最不留情面的数据之后,是让 CMS 或框架自动生成、别手工雕。它的存在不会招来任何惩罚。而 coding agent 的流量虽小却是真的:随着更多调研和采购被交给 agent 去做,给它们留一份干净的地图,零成本,偶尔还真能帮上一次。
照搬这个逻辑之前,有两句提醒。llms.txt 真正的风险从来不是「有害」,而是机会成本。如果在你的 GEO 清单上,这个文件排在服务端渲染、爬虫可达性、有出处的内容前面,那这份清单是倒着的——那几样才是有测量证据支撑的杠杆,AI 答案引擎是怎么决定引用谁的一文把这些证据过了一遍。第二,让文件和你的真实页面保持一致。一份说的和站上内容对不上的精选文件,形状上就是 cloaking——正是 Mueller 点名的那种操纵风险,也是搜索引擎花了二十年学会识别的那类不一致。如果是 CMS 自动生成的,至少把产出读一遍——agent 对这个文件的内容是照单全信的,Ahrefs 甚至发现有爬虫在专门研究 llms.txt 的提示注入(prompt injection)风险。
落到你身上怎么办
2026 年的 llms.txt,是一个便宜、无害、只有一类真实读者、且测不出引用效果的产物。不花钱就放,要花钱就心安理得地跳过,然后把真正的力气花在测量结果指向的地方:进底层索引、不靠 JavaScript 也读得到、写出模型能整段拎走并标注出处的答案前置内容。活儿在那里——白帽 GEO 到底是什么一文写清楚了它长什么样——根目录下的任何一个文本文件都替代不了它。
参考资料
- The /llms.txt file — Jeremy Howard 的原始提案(2024 年 9 月):用一个 markdown 文件帮 LLM 在推理时使用网站(llmstxt.org)。
- LLMs.txt: Why Brands Rely On It and Why It Doesn’t Work — 约 30 万域名的分析;约 10% 采用率;Spearman、XGBoost、SHAP 均测不出与 AI 引用的关系,拿掉该变量后模型反而更准(SE Ranking)。
- We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read — 对 137,210 个域名的服务器日志分析:28% 采用率、97% 的文件零请求;SEO 审计工具占抓取量 21.7%、AI 检索爬虫占 1.1%;GPTBot 是抓取 llms.txt 最多的 AI 爬虫(约 4.51%),Claude Code 是抓取量最大的编码 agent(Ahrefs,2026 年 6 月)。
- llms.txt and AI Visibility: Results from OtterlyAI’s GEO Study — 90 天日志研究:62,100 多次 AI 爬虫访问里只有 84 次(约 0.1%)请求了该文件;Otterly 已把 llms.txt 从自家 GEO 审计里移除(OtterlyAI,2026 年 2 月)。
- Google Says LLMs.Txt Comparable To Keywords Meta Tag — John Mueller:没有 AI 服务说过在用这个文件,服务器日志显示它们根本不来查(Search Engine Journal,2025 年 4 月)。
- llms.txt — Mintlify 文档 — 为每个托管文档站自动生成 llms.txt 与 llms-full.txt 的文档平台(Mintlify)。
- Anthropic API 文档的 llms.txt — 该文件真实用途的活例子:一份供 agent 使用的开发者文档精选索引(Anthropic)。
FAQ
常见问题
我的网站该不该放一个 llms.txt?
如果成本接近零——平台自动生成,或者十分钟就能搞定——那就放。它的存在不会带来任何惩罚,而且在开发者文档上,coding agent 是真的会来抓。但别把它排在服务端渲染、爬虫可达性、有出处的内容前面:几十万域名的测量都显示它对 AI 引用没有影响。
llms.txt 影响 Google 排名或 AI 概览吗?
不影响。Google 的 John Mueller 明确说过,没有任何 AI 服务宣布在用这个文件,而且看服务器日志就知道它们根本不来查。Google 从未把 llms.txt 列为搜索、AI 概览或 AI Mode 的信号,SE Ranking 对约 30 万域名的分析也测不出它与引用频率之间的任何相关。
那 llms.txt 真正的用途是什么?
给 agent 提供推理时上下文——一份精选的 markdown 站点地图,让上下文窗口有限的工具不用解析导航和标记就能找到正确的页面。今天可测量的读者是抓取开发者文档的 coding agent(比如 Claude Code),这也是 Mintlify 之类文档平台默认自动生成这个文件的原因。