← 返回首页
学习路线 · 第 4 篇

AI 是怎么决定引用哪个网站的内容的?有没有官方标准?

2026-10-09 · 阅读约 11 分钟 · 分类:学习路线 / 实操落地

上一篇我们聊了 AI 搜索有没有取代传统搜索,结论是"掉的是点击,不是搜索"。这篇往里钻一层,问一个更实操的问题:同样是被 AI 抓到的网站,凭什么被它选中写进答案里?

先给答案:①官方标准确实存在,而且不是民间传言——Google 在 2026 年 5 月发布了专门的生成式 AI 优化指南,Bing 重写后的站长指南里"GEO"这个词被正式写了进去,OpenAI 和 Perplexity 都在开发者文档里写清了各自的引用爬虫。② 但没有一家公布算法公式,所有官方文档都在讲"资格门槛",不讲"排名公式"。③ 决定你能不能被引用的,不是某个神秘权重,而是六步链路里的前两步——robots.txt 放行 + 页面被索引。第④步的排名反而不是关键。

下面把这三句话拆开讲,每一条都附官方文档出处,你可以自己回去核。

一、官方标准:不用找传闻,去读站长文档

2026 年之前,"AI 引用标准"基本是自媒体的活儿,各家引擎从不正面回应。但从 2026 年 5 月开始,情况变了——引擎厂商开始主动写官方文档,而且口径相当统一。我把四家的核心表述列出来:

引擎官方文档关于"引用谁"的核心口径
Google 《Optimizing your website for generative AI features in Google Search》
2026-05-15 发布,2026-06-15 更新
"出现在 AI Overviews 或 AI Mode 里没有额外要求,也没有专门的特殊优化。"传统 SEO 最佳实践继续有效。要成为 AI 答案里的支撑链接,页面必须已被索引、且有资格显示摘要(snippet)。明确点名不需要新建机器可读文件、AI 文本文件或额外标记,也没有专属 schema。
Bing 《Bing Webmaster Guidelines》重写版
2026 年新增 grounding 与 AI 引用章节
首次在官方文档中用"GEO(Generative Engine Optimization)"这个词并给出定义——聚焦内容在 AI 回答中被 grounding 与引用的适配性。同时写明:GEO 不保证引用,就像 SEO 不保证排名。这是全网第一次有引擎厂商把 GEO 写进正式规则。
OpenAI 《Overview of OpenAI Crawlers》与《Publishers and Developers FAQ》 把爬虫按用途拆开:OAI-SearchBot 决定能否出现在 ChatGPT 搜索答案中,GPTBot 管基础模型训练,ChatGPT-User 是用户主动触发访问。原话:屏蔽 OAI-SearchBot 的站点"不会出现在 ChatGPT 搜索答案中,但仍可能作为导航链接出现"。robots.txt 改动约 24 小时生效。
Perplexity 官方文档 Perplexity Crawlers PerplexityBot 用于在搜索结果中展示和链接网站,不用于抓取内容训练基础模型。Perplexity-User 是用户请求触发的抓取,因属用户请求,通常忽略 robots.txt 规则。被 robots.txt 屏蔽的页面,域名、标题和简短事实摘要仍可能被索引。

四家文档摆在桌上,会发现一个有意思的事:没有一个字承诺让你被引用,但每一个字都把"引用"定义成有门槛的资格问题,而不是玄学。Google 那句"没有额外要求"也不等于"随便做都行"——它前面半句是"传统 SEO 最佳实践继续适用",整句连起来读才是完整意思。

这里必须说清一件事,避免误导:媒体报道时经常把 Bing 那次改版写成"Bing 认可 GEO 了",甚至延伸成"Bing 给出了 GEO 标准"。这话说过头了。Bing 官方文档的定义是把 GEO 作为一项优化类别纳入正式规则,同时明确声明不保证引用。它给的是规则与合规边界,不是算法公式。谁要拿"Bing 官方认证 GEO"当卖点,你去让对方把那段原文找出来。

二、引用是怎么发生的:六步链路

把四家文档拼起来,链路大致长这样。真正决定成败的是前两步,后面四步很多站长控制不了。

步骤发生什么你能控制什么
① 准入 AI 搜索爬虫读你的 robots.txt,决定这个 URL 允许不允许被抓 完全可控。四个开关,下面第五节给对照表
② 索引 页面被抓、解析、去重、进入索引,并有资格显示摘要。Google 把这条写成 AI 功能的硬门槛 完全可控。这也是老本行,sitemap、内链、HTTP 200、别把关键内容锁在 JS 里
③ 改写与扇出 用户那句大白话被模型拆成多个子查询,各自独立发一次搜索。Google 称为 query fan-out(查询扇出) 间接可控。你无法配置它,但你可以决定自己覆盖了哪几类子问题
④ 召回与重排 从索引里捞出候选页面,按相关性、权威性、时效等信号排序 部分可控。这就是传统 SEO 的主战场,权重依然是权重
⑤ 抽取 模型阅读候选页面并抽取能回答子查询的文本片段,不是读整篇文章 可控。这是素材层功夫,详见内容结构化
⑥ 合成与标注 生成答案,把片段拼进去,标上引用来源 不可控。没人能保证一定被引,官方文档也从不承诺
最值得记住的一句:被引用的最小单位不是"篇",是"段"。第⑤步抽取时不保证带你前后的铺垫——所以每个 H2 下第一句就写成可直接引用的答案句,首句不依赖下文。普林斯顿那篇 KDD 2024 论文测过,加入署名权威引语能带来约 41% 的提升,是九种手法里最强的;对照组是 SEO 时代最熟练的关键词堆砌,实测 −8%。数据出自 arXiv:2311.09735。

三、query fan-out:最反直觉、也最值钱的一个机制

query fan-out 这个词是 Google 官方文档里给的,值得单独拎出来讲,因为它直接改变你写内容的思路。

传统搜索里,你优化一个词,排到第一位就赢了。AI 搜索里,用户问"游乐设备厂家怎么选",模型可能自己拆成"游乐设备厂家资质怎么判断""小型游乐设备厂家有哪些""游乐设备厂家报价怎么看"等好几个子问题,每个子问题都单独跑一次检索和排序,最后把结果合起来合成答案。

这带来两个后果:

  1. 你不需要在原问题上位居第一。你排名第 12,但如果某个子查询恰好是你的强项,你可能被单独抽中并挂上引用;
  2. 你覆盖了多少个子问题,决定了你有多少次机会。一篇只死磕"厂家"这个词的页面,在扇出后大概率整个落空——因为子问题问的是资质、报价、售后,你的页面没有一句在回答这些。

Google 官方还写了一句更实在的:AI Overviews 和 AI Mode 可能使用不同的模型和技术,所以它们给出的链接集合是不一样的。这意味着不存在"一套内容通吃两个功能"的打法,只能靠覆盖面和事实密度去扛。

顺便说个我们实测时的观察,方向和官方文档一致:模型的检索行为比人长得多。Moz 团队分析 5,333 条 Gemini grounding queries 后发现,模型检索平均 6.56 个词,约三分之一会带年份。你如果只盯着 3 到 4 个字的核心词写标题和描述,跟模型的路子对不上。

四、四家引擎的四个 robots.txt 开关对照表

这是本文最实用的一段。前面六步链路里,第①步是最容易踩雷的一步——很多站长在服务器上装安全插件时,把 AI 爬虫顺手一起挡了,几个月后才发现"我内容明明很好,为什么 AI 从来不引用我"。

爬虫 User-Agent 属谁 / 干什么 robots.txt 里屏蔽的后果 你该怎么做
OAI-SearchBot OpenAI / ChatGPT 搜索 不会出现在 ChatGPT 搜索答案中(可能仍作为导航链接出现) 放行。这是唯一决定引用资格的开关
GPTBot OpenAI / 基础模型训练 退出训练数据,不影响搜索可见性 按商业策略决定,与引用无关
PerplexityBot Perplexity / 搜索索引与引用 全文不进索引引用(域名、标题、简短摘要仍可能被索引) 放行。
Googlebot Google / 搜索与 AI Overviews、AI Mode 不进搜索索引,AI 功能随之失效(官方明确 AI 功能与搜索共用同一套基础系统) 放行。

还有一个容易忽略的坑:OpenAI 明确提醒,如果你从第三方搜索源拿到了某个被 robots.txt 屏蔽页面的 URL,并且有信号显示它与用户查询相关,仍可能在界面上只展示链接和标题。想彻底避免这一点,得用 noindex meta 标签——前提是得先允许爬虫读到那个标签。这块逻辑有点绕,但结论很简单:别屏蔽,要屏蔽就屏蔽干净。

顺带说一句,本站的 robots.txt 就是按这张表配的:四个引用型爬虫全部显式放行,训练型爬虫按策略处理。改服务器安全策略前,先看一眼这个文件。

五、llms.txt:一个被误读了两年的文件

既然说到了官方标准,就绕不开 llms.txt。站内问它的人不少,我直接把结论摆出来:Google 官方说不必要也不有害,其他引擎没有明确表态,实际使用率极低。

Google 那份 AI 优化指南里,原文说的是:不需要创建新的机器可读文件、AI 文本文件或标记才能出现在 AI 功能里,也没有需要额外添加的专属 schema.org 结构化数据。此后业界仍有误解,Google 在 2026-06-15 的文档更新里专门补了一段,把话说透:即使你保留 llms.txt 这个文件,那也完全没问题,但它不会给搜索或 AI 功能的可见性带来正面或负面任何效果。

更早的口径来自 Google 的 John Mueller——他 2025 年就公开说过"目前没有任何 AI 系统在使用 llms.txt",并把它类比成废弃的 meta keywords 标签。Gary Illyes 在 2025-07-23 的 Search Central Live 亚太场上也确认,Google 不支持 llms.txt,而且也不打算支持。

再看实际使用率。Ahrefs 在 2026-06-15 发布的 llms.txt 专项研究里分析了 137,210 个域名:约 28%(约 3.8 万个)发布了有效的 llms.txt 文件,但其中 97% 在整个月内收到的抓取请求为零;剩下那 3% 里,真正来自具名 AI 工具的请求也只占约 19.5%。Search Engine Land 跟踪 10 个站点的 180 天结果,8 个没有可测量的 AI 流量变化,剩下 2 个的增长来自公关曝光和内容重构,不是这个文件。

我的建议,以及本站的选择:保留,但别当增长手段。成本几乎为零(一个 Markdown 文件),对 AI 代理类工具读站点可能有点用,所以留着没有坏处。但如果你把它写进方案当成"AI 可见度提升手段"去卖或者去做 KPI,数据显示这条不成立。本站自己就发布了 llms.txt 和 llms-full.txt——定位是"给代理的站点自述",不是"排名技巧"。顺带提一句,Chrome 的 Lighthouse 13.3 在 2026 年新增了一个"agentic browsing"检查项会看 llms.txt,但那是给浏览器代理用的,和搜索排名不是一回事,别又传成 Google 认可了这个文件。

六、官方文档没说,但实测有规律的四个点

官方文档到"资格"这一层就停了,再往后是各家不公开的部分。不过有些规律在我们的实测里相当稳定,可以作为工作假设:

  1. 引用来源以第三方为主,自家官网不一定赢。第 3 篇引用的实测区间显示,AI 引用中有 53% 到 95% 来自第三方权威源。所以被行业媒体、对比文章、社区讨论提及,比自己在官网喊话有效得多;
  2. 能被独立验证的事实更容易被采信。Bing 新版指南里专门加了一条 grounding 优化建议:事实要直接陈述而不是暗示,因为 AI 系统需要能被独立验证的内容。"我们品质优秀"没法验证,"出厂前每台做 48 小时连续运转测试"可以;
  3. 一个 URL 只讲一个主题更容易被选中。Bing 官方明确建议每个 URL 聚焦单一主题、关键信息放在页面靠前位置,并称单主题页面更可能被选为 grounding 结果;
  4. 实体要清晰一致。人名、机构名、产品名不要有歧义指代。Bing 指南把"清晰的实体定义"直接列为有助于 grounding 可见性和引用准确性的做法。
还有一条要提醒的是红线。Bing 新版指南把 "Prompt Injection and AI Manipulation"(提示词注入与 AI 操纵)单列为一个独立章节,并明确说这类行为可能导致可见性下降或被移出搜索。同时它把原来的"关键词堆砌"章节改名为 "Keyword Stuffing and Artificially Engineered Language"——覆盖范围从"为传统排名堆词"扩展到"为触发引用或 AI 响应而设计内容"。往页面里塞隐藏指令、伪造场景、用人工语言模型批量造内容这类操作,已经被正式写进滥用条款,代价是同时损失搜索排名和 AI 引用资格。

七、一份可以直接照做的清单

按优先级排,前四条本周就能做完,后四条需要排期:

  1. 查 robots.txt。打开 你的域名/robots.txt,确认 OAI-SearchBot、PerplexityBot、Googlebot、Bingbot 都是 Allow。有安全插件的,连 WAF 白名单一起查——Perplexity 官方专门给了 Cloudflare 和 AWS WAF 的放行配置示例,说明很多站点是被防火墙误伤的;
  2. 用无痕窗口实测。在无痕模式下用 AI 搜索问三个你关心的行业问题,记下引擎引了谁、引用的是哪一句。无痕是为了避开登录态带来的个性化干扰。方法本站第 1 期公开过,任何人可复现;
  3. 翻自己的索引状态。Search Console 看核心页面是否已索引、是否有摘要资格。Google 明确说了这一条是 AI 功能的准入前提;
  4. 抽查段落自含性。挑三个 H2 小节,把内容单独丢给 AI,问"只用这段话能回答 XX 吗"。答不完整就回炉改写;
  5. 改标题和问句口径。检查你的标题是不是人话问法。模型检索平均 6.56 个词、三分之一带年份,把问句写长、写具体;
  6. 把模糊说法换成"数字 + 来源 + 时间窗"。"效率大幅提升"改成"平均提升 34%,基于 500 家企业、12 个月追踪(数据来源 X)";
  7. 给关键结论配署名引语。KDD 2024 论文实测这是提升最大的单一动作(+41%);
  8. 盯第三方提及,而不是只盯自站。每月固定搜一次品牌名 + 行业词,看看行业媒体、对比站、社区里有没有你的内容被引用。
关于本文与作者:作者为 8 年 SEO / SEM 从业者(关于页),2025 年起每周实测四个中文 AI 引擎的引用来源,测试方法公开于第 1 期。本文引用的官方口径均来自引擎官方文档,并标注了发布日期或更新时间,读者可回原文核对;标注"实测""我们观察"的部分为本站数据,属观察结论而非官方承诺。GEO 领域迭代极快,本文结论以 2026-10-09 为准。

参考与来源

上一篇:现在还有多少人用 AI 搜索?传统搜索引擎会被 AI 取代吗?
下一篇(计划):GEO 优化是不是智商税?