AI 答案引擎是怎么决定引用谁的
ChatGPT、Perplexity 这些 AI 答案引擎是怎么挑引用来源的?
ChatGPT、Perplexity、Google AI 概览、Gemini、Claude 各有各的检索与引用方式——但它们挑中的页面有一组共同点。这篇讲清楚到底什么能让一个页面被引用,以及为什么能长久立住的只有白帽。
要点速览
没有单一算法。ChatGPT、Perplexity、Google 的 AI 概览、Gemini、Claude 各有各的检索和引用方式。但底下它们共用一套套路:从一个搜索索引里取回候选页,再由模型写出答案、引用它真正依据的那几个。被引用的页面,惊人地一致——都是已经能排上、爬虫容易读、有真实权威、并且用平实可抽取的文字回答了问题的那些。这就是目标,而不是针对某一个引擎的小聪明。
多数引擎没有自己的索引
第一件要搞清楚的事:AI 答案引擎大多骑在一个传统搜索索引上,而不是自己爬整个网。ChatGPT Search 主要从 Bing 取数,并越来越多地叠上自有搜索爬虫和授权数据源。Microsoft Copilot 用 Bing。Google 的 AI 概览、AI Mode,以及 Gemini 的 grounding,用 Google 搜索。Claude 的联网检索看起来后端是 Brave——Anthropic 把 Brave Search 加进了它的子处理方清单,独立测试也发现 Claude 与 Brave 返回一模一样的引用、且 Claude 的搜索工具里有个 BraveSearchParams 字段。
由此推出的结论很直接:被底层引擎索引、并排得上,是入场券。Bing 或 Google 找不到你,骑在它上面的 AI 就引用不到你。这也是为什么”AI 搜索让 SEO 过时了”恰好说反了——传统索引是整套东西立足的地基。
引用是在写正文之前就选定的
Perplexity 是这个形态最清楚的例子。它先取回候选文档、重排,然后才让模型合成答案、把行内引用约束在它取回的范围里。在 Pro 答案后面换个模型,改变的是答案怎么写,而不是取回了哪些文档。
Google 的 AI Mode 做一件它叫 query fan-out 的事:把你的问题拆成子主题、同时并发很多次搜索,再跨结果合成。Gemini 会自己决定要不要搜,搜的话grounding 的返回里会带一个 groundingMetadata 对象,列出它跑了哪些查询(webSearchQueries)、用了哪些来源(groundingChunks)。Claude 把联网当成一个它自己决定要不要调的工具,然后行内引用。
它们底下的道理是同一个:来源是在检索那一刻、从索引里、在任何句子生成之前就选定的。你不是事后在优化一段话,你是在争取进入那个候选集。
到底什么能让一个页面被取回、被引用
跨引擎看,杠杆收敛成一个短清单。
- 进索引、并就该查询排得上。 检索从你一直想排的那个搜索索引开始。排不上,就没有候选资格。
- 爬虫读得懂。 AI 检索爬虫大多不执行 JavaScript——Vercel 与 MERJ 跨网络分析了 5.69 亿次 GPTBot 请求,发现主流 AI 爬虫没有一个会渲染 JavaScript,它们抓的是原始 HTML、跳过客户端渲染。一个 hydration 之后才把内容画出来的单页应用,在它们眼里就是空白页。做服务端渲染,让内容在第一个响应里。
- 可抽取、答案前置。 开头就给答案、把论断说平实。GEO 的原始研究(KDD ‘24)发现,加上引用来源、统计数据和引述,能把页面在生成式答案里的可见度提升最高约 40%,而且这种提升对不在第一名的页面帮助最大。这一行为在真实数据里也看得到:Ahrefs 对 140 万条 ChatGPT 提示词的研究发现,一个页面能不能被引用,取决于它的标题和 URL 与 ChatGPT 拆出的子问题对得有多齐——描述清楚、答案成形的页面更常拿到引用。
- 作为实体有权威。 全网一致的名称与描述、加上第三方提及,让一个来源更容易被模型信任。
- 有结构。 按 Google 结构化数据文档写 JSON-LD,让你的事实是机器可读的,而不是靠从排版里猜。
- 新鲜。 时效性话题上,最近更新过的内容更受青睐——但前提是正文真的变了,不是只改了日期戳。
一个值得知道的机理偏差
神经检索器给相关性打分时,有一个机械偏差:它们倾向于过度偏爱低困惑度(low-perplexity)的文本——流畅、可预测、编辑良好的写作。一份发表于 ICLR 2025 的因果研究证明,检索器会学着把低困惑度当成相关性的代理,从而偏向平滑、对机器友好的文字。
诚实的结论不是去钻这个空子,而是:清晰、流畅、结构良好的写作会被奖励两次——一次是读它的人,一次是给它打分的检索器。让一个页面对人好的那些东西,恰好也让它容易被取回。
它不奖励什么
那些取巧的路子撑不过这些系统。关键词堆砌在 GEO 研究里测出来比基线还差。SE Ranking 分析了约 30 万个域名,发现有没有 llms.txt 文件和域名被引用的频率之间毫无相关——Google 的 John Mueller 也直说,目前没有任何 AI 服务会去抓这个文件。而 Google 已经把操纵生成式 AI 回答写进了垃圾内容政策,政策里现在把垃圾内容的定义扩展到了「试图操纵 Google 搜索里的生成式 AI 回答」。
引用追的是内容实质,不是操纵。这正是为什么能长久立住的,是那张不光鲜的白帽清单:可被抓取、有权威、可抽取、够新鲜、值得被引用。
为什么现在值得做
这一切面向的受众正在快速变大。Gartner 预测,到 2028 年,90% 的 B2B 采购将由 AI agent 居间完成,超过 15 万亿美元的 B2B 支出将流经 agent 交易。当越来越多买家是从一条 AI 答案、而不是一条排名链接进来的,成为这些答案所依据的来源之一就不再是可选项。机制因引擎而异;为赢得一次引用要做的功夫,并不会变。
参考资料
- Vercel & MERJ — AI 爬虫的崛起。对 5.69 亿次 GPTBot 请求的分析,发现主流 AI 爬虫没有一个渲染 JavaScript(Vercel,2024)。
- Yoast — 什么是 ChatGPT Search(它怎么用 Bing 数据)。讲 ChatGPT Search 从 Bing 索引取数的科普(Yoast)。
- TechCrunch — Anthropic 看起来在用 Brave 给 Claude 的联网搜索供能。子处理方清单、一模一样的引用、
BraveSearchParams字段都指向 Brave(Whittaker,2025)。 - Google — AI Mode 搜索:来自 Google I/O 2025 的更新。对 query fan-out 技术的官方说明(Google,2025)。
- Google — 用 Google 搜索做 grounding。Gemini API 文档,讲 grounding 返回里的
groundingMetadata、webSearchQueries、groundingChunks(Google)。 - Aggarwal 等 — GEO:生成式引擎优化(KDD ‘24)。GEO 的原始研究;加上引用来源、统计数据和引述可把生成式答案里的可见度提升最高约 40%。
- Ahrefs — ChatGPT 为什么引用这一页而不是那一页(140 万条提示词研究)。被引与否取决于页面标题、URL 与 ChatGPT 拆出的子问题对得有多齐(Linehan,Ahrefs)。
- Cheng 等 — 困惑度陷阱:基于 PLM 的检索器高估低困惑度文档(ICLR 2025)。因果研究,显示神经检索器把低困惑度当成相关性的代理。
- SE Ranking — llms.txt 会影响 AI 可见度吗。对约 30 万个域名的分析,未发现
llms.txt与 AI 引用之间的相关性(SE Ranking)。 - Search Engine Roundtable — Google:目前没有 AI 系统使用 llms.txt。John Mueller 在 Reddit / Bluesky 的表态,称 AI 服务并不抓取该文件(Schwartz,2025)。
- Google — Google 网页搜索垃圾内容政策。垃圾内容现已包含「试图操纵 Google 搜索里的生成式 AI 回答」(Google)。
- Gartner — Gartner Unveils Top Predictions for IT Organizations and Users in 2026 and Beyond。预测到 2028 年,90% 的 B2B 采购将由 AI agent 居间、超过 15 万亿美元的 B2B 支出流经 agent 交易(Gartner,2025)。
- Google — 结构化数据标记(JSON-LD)入门。官方文档,讲如何让事实机器可读(Google)。
FAQ
常见问题
AI 答案引擎有自己的搜索索引吗?
大多没有。ChatGPT Search 主要从 Bing 取数,Microsoft Copilot 用 Bing,Google 的 AI 概览和 Gemini 的 grounding 用 Google 搜索,Claude 的联网检索看起来后端是 Brave。被底层引擎索引、并排得上,是入场券。
到底什么能让一个页面被 AI 引用?
被引用的页面通常已经能就该查询排上、不靠 JavaScript 也能在原始 HTML 里读到内容、开头就给答案、作为实体有可验证的权威、带结构化数据、并且确实新鲜。GEO 的原始研究发现,加上引用来源、统计数据和引述,页面在生成式答案里的可见度最高能提升约 40%。
llms.txt 能提高被 AI 引用的概率吗?
没有证据支持。SE Ranking 分析了约 30 万个域名,没发现 llms.txt 和被引用频率之间有任何相关;Google 的 John Mueller 也直说,目前没有任何 AI 服务会去抓这个文件。
AI 搜索让 SEO 过时了吗?
恰恰相反。AI 答案引擎大多从传统搜索索引取数——Bing、Google、Brave——底层引擎找不到你,骑在它上面的 AI 就引用不到你。传统的索引和排名,是整套东西立足的地基。