AI 是怎么决定引用哪个网站的内容的?有没有官方标准?
上一篇我们聊了 AI 搜索有没有取代传统搜索,结论是"掉的是点击,不是搜索"。这篇往里钻一层,问一个更实操的问题:同样是被 AI 抓到的网站,凭什么被它选中写进答案里?
下面把这三句话拆开讲,每一条都附官方文档出处,你可以自己回去核。
一、官方标准:不用找传闻,去读站长文档
2026 年之前,"AI 引用标准"基本是自媒体的活儿,各家引擎从不正面回应。但从 2026 年 5 月开始,情况变了——引擎厂商开始主动写官方文档,而且口径相当统一。我把四家的核心表述列出来:
| 引擎 | 官方文档 | 关于"引用谁"的核心口径 |
|---|---|---|
| 《Optimizing your website for generative AI features in Google Search》 2026-05-15 发布,2026-06-15 更新 |
"出现在 AI Overviews 或 AI Mode 里没有额外要求,也没有专门的特殊优化。"传统 SEO 最佳实践继续有效。要成为 AI 答案里的支撑链接,页面必须已被索引、且有资格显示摘要(snippet)。明确点名不需要新建机器可读文件、AI 文本文件或额外标记,也没有专属 schema。 | |
| Bing | 《Bing Webmaster Guidelines》重写版 2026 年新增 grounding 与 AI 引用章节 |
首次在官方文档中用"GEO(Generative Engine Optimization)"这个词并给出定义——聚焦内容在 AI 回答中被 grounding 与引用的适配性。同时写明:GEO 不保证引用,就像 SEO 不保证排名。这是全网第一次有引擎厂商把 GEO 写进正式规则。 |
| OpenAI | 《Overview of OpenAI Crawlers》与《Publishers and Developers FAQ》 | 把爬虫按用途拆开:OAI-SearchBot 决定能否出现在 ChatGPT 搜索答案中,GPTBot 管基础模型训练,ChatGPT-User 是用户主动触发访问。原话:屏蔽 OAI-SearchBot 的站点"不会出现在 ChatGPT 搜索答案中,但仍可能作为导航链接出现"。robots.txt 改动约 24 小时生效。 |
| Perplexity | 官方文档 Perplexity Crawlers | PerplexityBot 用于在搜索结果中展示和链接网站,不用于抓取内容训练基础模型。Perplexity-User 是用户请求触发的抓取,因属用户请求,通常忽略 robots.txt 规则。被 robots.txt 屏蔽的页面,域名、标题和简短事实摘要仍可能被索引。 |
四家文档摆在桌上,会发现一个有意思的事:没有一个字承诺让你被引用,但每一个字都把"引用"定义成有门槛的资格问题,而不是玄学。Google 那句"没有额外要求"也不等于"随便做都行"——它前面半句是"传统 SEO 最佳实践继续适用",整句连起来读才是完整意思。
二、引用是怎么发生的:六步链路
把四家文档拼起来,链路大致长这样。真正决定成败的是前两步,后面四步很多站长控制不了。
| 步骤 | 发生什么 | 你能控制什么 |
|---|---|---|
| ① 准入 | AI 搜索爬虫读你的 robots.txt,决定这个 URL 允许不允许被抓 | 完全可控。四个开关,下面第五节给对照表 |
| ② 索引 | 页面被抓、解析、去重、进入索引,并有资格显示摘要。Google 把这条写成 AI 功能的硬门槛 | 完全可控。这也是老本行,sitemap、内链、HTTP 200、别把关键内容锁在 JS 里 |
| ③ 改写与扇出 | 用户那句大白话被模型拆成多个子查询,各自独立发一次搜索。Google 称为 query fan-out(查询扇出) | 间接可控。你无法配置它,但你可以决定自己覆盖了哪几类子问题 |
| ④ 召回与重排 | 从索引里捞出候选页面,按相关性、权威性、时效等信号排序 | 部分可控。这就是传统 SEO 的主战场,权重依然是权重 |
| ⑤ 抽取 | 模型阅读候选页面并抽取能回答子查询的文本片段,不是读整篇文章 | 可控。这是素材层功夫,详见内容结构化 |
| ⑥ 合成与标注 | 生成答案,把片段拼进去,标上引用来源 | 不可控。没人能保证一定被引,官方文档也从不承诺 |
三、query fan-out:最反直觉、也最值钱的一个机制
query fan-out 这个词是 Google 官方文档里给的,值得单独拎出来讲,因为它直接改变你写内容的思路。
传统搜索里,你优化一个词,排到第一位就赢了。AI 搜索里,用户问"游乐设备厂家怎么选",模型可能自己拆成"游乐设备厂家资质怎么判断""小型游乐设备厂家有哪些""游乐设备厂家报价怎么看"等好几个子问题,每个子问题都单独跑一次检索和排序,最后把结果合起来合成答案。
这带来两个后果:
- 你不需要在原问题上位居第一。你排名第 12,但如果某个子查询恰好是你的强项,你可能被单独抽中并挂上引用;
- 你覆盖了多少个子问题,决定了你有多少次机会。一篇只死磕"厂家"这个词的页面,在扇出后大概率整个落空——因为子问题问的是资质、报价、售后,你的页面没有一句在回答这些。
Google 官方还写了一句更实在的:AI Overviews 和 AI Mode 可能使用不同的模型和技术,所以它们给出的链接集合是不一样的。这意味着不存在"一套内容通吃两个功能"的打法,只能靠覆盖面和事实密度去扛。
顺便说个我们实测时的观察,方向和官方文档一致:模型的检索行为比人长得多。Moz 团队分析 5,333 条 Gemini grounding queries 后发现,模型检索平均 6.56 个词,约三分之一会带年份。你如果只盯着 3 到 4 个字的核心词写标题和描述,跟模型的路子对不上。
四、四家引擎的四个 robots.txt 开关对照表
这是本文最实用的一段。前面六步链路里,第①步是最容易踩雷的一步——很多站长在服务器上装安全插件时,把 AI 爬虫顺手一起挡了,几个月后才发现"我内容明明很好,为什么 AI 从来不引用我"。
| 爬虫 User-Agent | 属谁 / 干什么 | robots.txt 里屏蔽的后果 | 你该怎么做 |
|---|---|---|---|
| OAI-SearchBot | OpenAI / ChatGPT 搜索 | 不会出现在 ChatGPT 搜索答案中(可能仍作为导航链接出现) | 放行。这是唯一决定引用资格的开关 |
| GPTBot | OpenAI / 基础模型训练 | 退出训练数据,不影响搜索可见性 | 按商业策略决定,与引用无关 |
| PerplexityBot | Perplexity / 搜索索引与引用 | 全文不进索引引用(域名、标题、简短摘要仍可能被索引) | 放行。 |
| Googlebot | Google / 搜索与 AI Overviews、AI Mode | 不进搜索索引,AI 功能随之失效(官方明确 AI 功能与搜索共用同一套基础系统) | 放行。 |
还有一个容易忽略的坑:OpenAI 明确提醒,如果你从第三方搜索源拿到了某个被 robots.txt 屏蔽页面的 URL,并且有信号显示它与用户查询相关,仍可能在界面上只展示链接和标题。想彻底避免这一点,得用 noindex meta 标签——前提是得先允许爬虫读到那个标签。这块逻辑有点绕,但结论很简单:别屏蔽,要屏蔽就屏蔽干净。
顺带说一句,本站的 robots.txt 就是按这张表配的:四个引用型爬虫全部显式放行,训练型爬虫按策略处理。改服务器安全策略前,先看一眼这个文件。
五、llms.txt:一个被误读了两年的文件
既然说到了官方标准,就绕不开 llms.txt。站内问它的人不少,我直接把结论摆出来:Google 官方说不必要也不有害,其他引擎没有明确表态,实际使用率极低。
Google 那份 AI 优化指南里,原文说的是:不需要创建新的机器可读文件、AI 文本文件或标记才能出现在 AI 功能里,也没有需要额外添加的专属 schema.org 结构化数据。此后业界仍有误解,Google 在 2026-06-15 的文档更新里专门补了一段,把话说透:即使你保留 llms.txt 这个文件,那也完全没问题,但它不会给搜索或 AI 功能的可见性带来正面或负面任何效果。
更早的口径来自 Google 的 John Mueller——他 2025 年就公开说过"目前没有任何 AI 系统在使用 llms.txt",并把它类比成废弃的 meta keywords 标签。Gary Illyes 在 2025-07-23 的 Search Central Live 亚太场上也确认,Google 不支持 llms.txt,而且也不打算支持。
再看实际使用率。Ahrefs 在 2026-06-15 发布的 llms.txt 专项研究里分析了 137,210 个域名:约 28%(约 3.8 万个)发布了有效的 llms.txt 文件,但其中 97% 在整个月内收到的抓取请求为零;剩下那 3% 里,真正来自具名 AI 工具的请求也只占约 19.5%。Search Engine Land 跟踪 10 个站点的 180 天结果,8 个没有可测量的 AI 流量变化,剩下 2 个的增长来自公关曝光和内容重构,不是这个文件。
六、官方文档没说,但实测有规律的四个点
官方文档到"资格"这一层就停了,再往后是各家不公开的部分。不过有些规律在我们的实测里相当稳定,可以作为工作假设:
- 引用来源以第三方为主,自家官网不一定赢。第 3 篇引用的实测区间显示,AI 引用中有 53% 到 95% 来自第三方权威源。所以被行业媒体、对比文章、社区讨论提及,比自己在官网喊话有效得多;
- 能被独立验证的事实更容易被采信。Bing 新版指南里专门加了一条 grounding 优化建议:事实要直接陈述而不是暗示,因为 AI 系统需要能被独立验证的内容。"我们品质优秀"没法验证,"出厂前每台做 48 小时连续运转测试"可以;
- 一个 URL 只讲一个主题更容易被选中。Bing 官方明确建议每个 URL 聚焦单一主题、关键信息放在页面靠前位置,并称单主题页面更可能被选为 grounding 结果;
- 实体要清晰一致。人名、机构名、产品名不要有歧义指代。Bing 指南把"清晰的实体定义"直接列为有助于 grounding 可见性和引用准确性的做法。
七、一份可以直接照做的清单
按优先级排,前四条本周就能做完,后四条需要排期:
- 查 robots.txt。打开
你的域名/robots.txt,确认 OAI-SearchBot、PerplexityBot、Googlebot、Bingbot 都是 Allow。有安全插件的,连 WAF 白名单一起查——Perplexity 官方专门给了 Cloudflare 和 AWS WAF 的放行配置示例,说明很多站点是被防火墙误伤的; - 用无痕窗口实测。在无痕模式下用 AI 搜索问三个你关心的行业问题,记下引擎引了谁、引用的是哪一句。无痕是为了避开登录态带来的个性化干扰。方法本站第 1 期公开过,任何人可复现;
- 翻自己的索引状态。Search Console 看核心页面是否已索引、是否有摘要资格。Google 明确说了这一条是 AI 功能的准入前提;
- 抽查段落自含性。挑三个 H2 小节,把内容单独丢给 AI,问"只用这段话能回答 XX 吗"。答不完整就回炉改写;
- 改标题和问句口径。检查你的标题是不是人话问法。模型检索平均 6.56 个词、三分之一带年份,把问句写长、写具体;
- 把模糊说法换成"数字 + 来源 + 时间窗"。"效率大幅提升"改成"平均提升 34%,基于 500 家企业、12 个月追踪(数据来源 X)";
- 给关键结论配署名引语。KDD 2024 论文实测这是提升最大的单一动作(+41%);
- 盯第三方提及,而不是只盯自站。每月固定搜一次品牌名 + 行业词,看看行业媒体、对比站、社区里有没有你的内容被引用。
参考与来源
- Google Search Central(2026-05-15 发布,2026-06-15 更新)。Optimizing your website for generative AI features in Google Search——"没有额外要求""不需要机器可读文件/AI 文本文件/专属 schema""llms.txt 无正面也无负面影响"的官方出处。developers.google.com/search/docs
- Google Search Central。AI features and your website——query fan-out、已索引且有摘要资格是硬门槛、nosnippet 系列控制项的出处。developers.google.com/search/docs
- Microsoft Bing。Bing Webmaster Guidelines(重写版)——首次在官方文档中定义 GEO、"GEO 不保证引用"、"事实直接陈述""单主题 URL 更可能被选中"、Prompt Injection 独立章节的出处。bing.com/webmasters
- Search Engine Journal(2026)。Bing Adds GEO To Official Guidelines, Expands AI Abuse Definitions——Bing 改版的具体改动清单与发布时间。searchenginejournal.com
- OpenAI(官方开发者文档)。Overview of OpenAI Crawlers——OAI-SearchBot 与 GPTBot 用途分离、"屏蔽即不会出现在搜索答案中但可作导航链接"、robots.txt 约 24 小时生效。platform.openai.com/docs/bots
- OpenAI 官方帮助中心。Publishers and Developers FAQ——被屏蔽页面仍可能展示链接与标题、utm_source=chatgpt.com 引流追踪。help.openai.com
- Perplexity 官方文档。Perplexity Crawlers——PerplexityBot 与 Perplexity-User 的区别、WAF 放行配置示例。docs.perplexity.ai/guides/bots
- Ahrefs(2026-06-15)。llms.txt Study——137,210 个域名分析,28% 发布率、97% 零抓取、具名 AI 工具请求占 19.5%。ahrefs.com/blog
- Gary Illyes(Google)。Search Central Live 亚太站(2025-07-23)——公开表态 Google 不支持 llms.txt 且不打算支持。转述见 Search Engine Land 2025-07 报道。
- Aggarwal, P. et al. (2024). GEO: Generative Engine Optimization. KDD 2024.——九种策略实测数据(署名引语 +41%、带来源统计 +31%、行内标注 +28%、关键词堆砌 −8%)出处。arxiv.org/abs/2311.09735
- Moz(Dr. Peter J. Meyers)。5,333 条 Gemini grounding queries 数据集分析——模型检索平均 6.56 词、约 1/3 带年份。moz.com/blog
- 中国商务广告协会 GEO 团体标准(T/CAACCHINA 001~005—2026,2026-09-10 实施)——国内"关键词堆砌列入禁止条款"的权威口径,全国团体标准信息平台可在线阅览:www.ttbz.org.cn