AI 可见度诊断:企业自查的完整流程
我先说清楚这篇文章的来路。这些年做 SEO 体检,客户最常说的一句话是「给我一份报告」——SEO 体检已经很成熟了,工具扫一遍网站,出一堆红黄绿。2024 年之后我开始接 GEO 的活,才发现企业真正的困难不是「没有工具」,而是没人告诉他们到底该量什么。于是把这两年给 B2B 企业做诊断的做法,摊开写成了这套流程。
先交代两个背景数据,因为它们决定了这篇文章的分量。
第一个是我国生成式 AI 的普及程度。中国互联网络信息中心(CNNIC)政策与国际合作所于 2026 年 9 月 29 日在「2026(第七届)中国互联网基础资源大会」上发布《生成式人工智能应用发展报告(2026)》:截至 2026 年上半年,我国生成式人工智能用户规模突破 7 亿人,普及率超 50.0%;其中 76.0% 的用户表示自己会让生成式人工智能回答问题(来源:新华社 2026-09-29 报道,记者王思北)。也就是说,你的潜在客户里已经有超过四分之三在用 AI 找答案了。
第二个是这件事已经不只是「有方法论」,而是有官方定义了。微软在 2026 年 2 月重写了 Bing Webmaster Guidelines,首次在搜索引擎官方政策里正式使用并定义了 GEO——把它定义为「聚焦于内容获得 grounding 资格并被 AI 回答引用的优化」,同时明确写了「GEO 不保证引用,就像 SEO 不保证排名」。这是搜索引擎第一次把这个词写进正式规则,不是营销机构自造的词。相关的细节我在学习路线第 4 篇里拆过一遍,本文不重复,只用它的结论。
一、诊断到底诊断什么:先立三层框架
很多企业的诊断一开始就做错了——直接从「我被 AI 提到了几次」开始数。这个数字有用,但它只是结果,不是原因。真正能指导动作的框架,是 2026 年 5 月 20 日在都柏林 AMEC 全球峰会上发布的《AMEC GEO Principles》。AMEC 是 1996 年成立、覆盖 80 多个国家的传播测量与评估国际组织,这个原则由 PR Agency One 的 James Crawford、Ketchum 的 Mary Elizabeth Germaine、FleishmanHillard 的 Ben Levine、Hotwire Global 的 Matt Oakley、Big Valley Marketing 的 Amber Daugherty、Converseon 的 Rob Key 等人牵头,历时六个多月、多轮学术评审后发布。
它把 GEO 测量拆成三个相连的区域:
| 层级 | AMEC 的表述 | 通俗讲 |
|---|---|---|
| 上游声誉信号 | Earned coverage、第三方评论、用户评价、专家内容、自有资产 | 外面的人怎么说你。有没有行业媒体报道、百科、垂类评测、协会背书、客户真实评价。 |
| 搜索与内容就绪度 | 数字资产是否可信、可访问、且结构化到能被搜索引擎和 AI 系统理解 | 你的网站本身能不能被抓到、读懂、拆开。这是纯技术层,也是最可控的一层。 |
| 下游 AI 输出 | 在 AI 回答、引用、叙述框架、遗漏和潜在声誉风险中的呈现方式 | 最终用户实际看到的那段文字。对不对?有没有你?别人有没有? |
把三层翻译成企业能执行的诊断动作,就是本文的 5 个步骤。下面一步步来。
二、第 1 步:建提问词库(3 天)
这一步是整套流程的地基,也是最容易被跳过的一步。跳过它的结果是:你跑了一圈数据,得到的结论是「AI 对我们行业不太熟」——这句话没法转化成任何动作。
提问词库的核心原则只有一条:必须包含无品牌词(unbranded queries)。带品牌名的提问测的是「AI 认不认识你」,无品牌词测的才是「AI 会不会推荐你」。前者你多半已经及格,后者才是真正的增长空间。如果只测品牌词,诊断报告会好看得毫无意义。
我一般按四层来铺,一个词库 30-50 条:
| 层级 | 提问形态 | 以游乐设备行业为例 |
|---|---|---|
| 品类认知层 | 定义、原理、选型标准类 | 「什么是无动力游乐设备」「幼儿园大型游乐设备有哪些类型」 |
| 场景需求层 | 具体场景怎么解决 | 「300 人规模幼儿园户外活动区怎么规划」「景区室内游乐空间湿度大怎么办」 |
| 对比决策层 | 方案 A vs 方案 B、哪家好 | 「游乐设备厂家怎么选」「无动力和有动力游乐设备哪个更适合幼儿园」 |
| 信任验证层 | 资质、案例、售后、风险 | 「游乐设备厂家需要哪些资质」「游乐设备验收标准有哪些」 |
另外三条实操细节,都踩过坑:
- 长短都要有,并且要分开记。这不是我的经验,是数据结论:Semrush 2026 年 6 月发布的研究里,短的口语化提问品牌提及率接近 100%,而长、结构化的提问只有 2%-3%——同一主题,差三五十倍。原因是长提问会触发更技术化的引用行为,几乎不产生品牌提名。所以词库里必须同时有「XX 是哪家好」和「请对比 A 方案与 B 方案在承重、防锈和售后周期上的差异,并说明各自适用场景」这两种形态。
- 地域词单独一组。本地业务被 AI 推荐时高度依赖地域上下文,这一组的命中率和其他组经常差出很远,混在一起看会掩盖真实问题。
- 词库一旦定下就冻结。换词就等于换基准,前后数据不可比。AMEC 把「可重复的提问词」列为基线证据要求的第一条,就是这个道理。
懒得手工造词,可以用本站的 GEO 品牌问题生成器(输入品牌和行业,输出带 P0/P1/P2 优先级的问题清单)和 AI 提示词模拟工具(按认知/对比/决策/使用四阶段铺开)。但一定要人工过一遍再定稿——机器造出来的词是「像问题」,客户嘴里说出来的问题比它更具体、更口语。
三、第 2 步:跑四引擎基线(3 天)
词库定好,就去问。每条词在每个引擎上都问一遍,把结果记下来。这是整个诊断里唯一的原始数据,后面所有结论都从它来。
3.1 引擎怎么选
国内业务优先:豆包、通义千问、DeepSeek、腾讯元宝、文心。面向海外:ChatGPT、Gemini、Perplexity、Google AI Overviews。
必须分开监测,不能合并成一个「AI 可见度」。这是本文最重要的一条实操结论,原因看下一节的数据就知道了。
3.2 记录表要记哪些字段
这是最容易被简化的地方。行业里常见的记录法只记「有没有提到我」,这一列信息量极低。我的表是这些字段:
| 字段 | 取值 | 为什么必须记 |
|---|---|---|
| 提问词 / 优先级 | 文本 / P0-P2 | 基准,保证可重复 |
| 引擎 / 日期 / 模式 | 文本 | AI 输出会因模型、提问、地区、语言、时间、用户上下文变化,必须记录是哪一次 |
| 是否被提及 | 是 / 否 | 答案正文里有没有出现你的品牌名 |
| 是否被引用 | 是 / 否 + URL | 有没有给出你域名的来源链接 |
| 提及位置 | 首位 / 列表项 / 顺带 / 末尾补充 | 「被列为首选推荐」和「被列为一个次要替代」是完全不同的商业结果 |
| 周边描述(原文摘录) | 文本 | 这是唯一能判断 AI 把你说对了没有的依据,务必原文抄下来 |
| 事实错误 | 有 / 无 + 具体错在哪 | 错误信息单独成列,因为它的处理方式和可见度问题完全不同 |
| 同时出现的竞品 | 文本 | 定位「差距区」用,见第 5 步 |
| 引用来源域名 | 文本 | 看清 AI 到底在读谁,尤其是那些你控制不了的第三方源 |
「提及」和「引用」必须分成两列,这是我从 Semrush 那份研究里学到的最重要的一课,下面单独说。
3.3 一个必须知道的数据:61.7% 的引用是「幽灵引用」
· 61.7% 是「幽灵引用」(ghost citation)——给了来源链接,但答案正文里完全没提你的品牌名;
· 25.1% 是只提名字、不给链接;
· 只有 13.2% 是既有链接又有品牌名。
也就是说,「被 AI 当成信源引用」和「被 AI 当成推荐对象」是两件完全不同的事。企业花钱做的权威内容,很大一部分只拿到了前者。
更要命的是各引擎在这件事上完全相反:
| 引擎 | 引用率(给了链接) | 提及率(写了品牌名) | 直观理解 |
|---|---|---|---|
| ChatGPT | 87% | 20.7% | 像写论文,脚注给得很足,句子里经常不写你是谁 |
| Gemini | 21.4% | 83.7% | 像人聊天,会说你名字,但懒得给链接 |
直接后果:只盯着「在 ChatGPT 里被引用」的企业,在 Gemini 上基本是隐形的;反过来也一样。一套诊断只跑一个引擎,等于只看了半张地图。这也是为什么我坚持四个引擎分开记录、分开算分,最后再汇总——不是数据量大,是它们根本不可通约。
四、第 3 步:技术层与内容层自查(4 天)
跑完基线,你手里会有一张表。表里通常会暴露出一个规律:某个引擎上几乎全军覆没,某个引擎上基本正常。这种平台间的巨大落差,八成不是内容质量差距,而是技术通道问题——这是诊断里最值得优先修的部分,因为它是确定性的。
4.1 技术层:四件事,按这个顺序查
顺序不能换,因为前面是后面的前提。
① 抓取通道是否打通。看服务器日志里有没有 AI 爬虫的访问记录,以及你的 robots.txt、WAF、CDN 有没有把它们挡在门外。国内主要是字节、阿里、腾讯、百度系的各种爬虫 UA;海外是 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等。这一步最容易被忽略,因为「网站能打开」和「爬虫能进来」是两件事,而后者没有任何一个前端工具能告诉你。有预算的话逐个 UA 实测访问最实在,本站 AI 爬虫抓取验证工具可以先做一遍初筛。
② robots meta 指令有没有误伤。这是 2026 年最实用的新知识,Bing 官方文档里已经写明各指令对 AI 的具体影响:
| 指令 | 对 AI 引用的影响 |
|---|---|
NOARCHIVE | 直接禁止内容用于 Copilot 回答和 grounding 结果 |
NOCACHE | 限制 Copilot 只能使用 URL、标题和摘要,引用深度大幅下降 |
DATA-NOSNIPPET / NOSNIPPET | 可能限制被展示和引用的文本内容 |
data-snippet | 指定 Bing 允许展示和引用的具体文本段 |
如果你的团队里有人图「版权保护」加了 NOARCHIVE,那不是保护,是自断引用。这条查起来只要两分钟,但很多企业真的没查过。
③ 内容是否已被索引、有没有摘要资格。没被索引的内容不存在被引用的可能。这一层沿用传统 SEO 的全部基本功——这也是为什么微软官方那句话成立:Bing Search 和 Copilot 依赖同一套抓取、索引、排序的基础设施,SEO 基础实践同时也在支撑 grounding 资格。你 8 年 SEO 的基本功在这里不作废,它从「目的」降格成了「地基」。
④ 实体命名是否一致。Bing 新版指南把这条写成了明文建议:人员、组织、产品、地点要清晰且前后一致地定义,避免歧义引用,并指出清晰的实体定义能提升 grounding 可见性与引用准确性。实践中的具体检查点是——同一个公司在官网上叫「XX游乐设备有限公司」,在行业媒体上叫「XX游乐」,在 1688 上叫「XX设备厂」,有没有在任何一处统一到同一个标准全称 + 一个常用简称。这属于 AI 实体消歧的范畴,也正是 Google 那份指南里 query fan-out 机制之外,模型判断「你是谁」的主要依据。
4.2 内容与信源层:三件事
技术上没问题的前提下,内容层决定模型愿不愿意用你。这里有四条来自官方文档的明确规则,不是我拍脑袋:
- 一个 URL 一个主题。Bing 指南明确写「专注于单一主题的 URL 更容易被选为 grounding 结果」,这跟很多 SEO 从业者「写一篇覆盖全面的长文」的习惯正好相反。深度在一个主题上,广度用多个 URL 承载。
- 重要信息放前面,直接陈述事实。指南的原话是「事实应被陈述而非暗示」,因为 AI 需要能独立验证的信息。翻译成写法就是:不要写「我们的方案能显著提升客户效果」,要写「2025 年 Q4 我们服务的 147 家幼儿园客户中,该方案使场地巡检工单平均下降 23%」。
- 提供可独立验证的事实。这一条在官方文档里被反复强调(Google 强调 helpful、reliable、people-first 的非同质化内容;Bing 强调 independently verifiable facts)。所谓「非同质化内容」,Google 举的例子很直白:把别人说过的、或者 AI 自己就能生成的通用知识再写一遍是没有价值的,得是别人拿不到的那部分。
- 警惕提示词注入。Bing 新版指南把「Prompt Injection and AI Manipulation」列为明确的滥用类别,与 cloaking、链接方案、关键词堆砌并列。也就是说,藏在页面里试图指挥模型怎么回答的文字,不仅无效,还可能同时损失传统排名和 grounding 资格。这一条专门提醒一下做外贸站的朋友——某些「AI 优化」服务在推销这类玩法。
4.3 信源层:为什么官网发一百篇不如被五个来源说一次
这一层是上游声誉信号,也是企业最常被忽视的一环。核心机制很简单:模型在做多源交叉验证,只有你自己说过的话,权重是最低的。
有一组数据能量化这件事。Stacker 与 Scrunch 在 2026 年 3 月发布的研究分析了 30 个客户的 87 篇内容、跨 8 个 AI 平台的 2,600 余个提问,结论是:内容通过赢得媒体(earned media)渠道分发,产生的中位 AI 搜索可见度提升是 239%。他们 2025 年 12 月的先期测试隔离出了分发这一个变量:同一篇内容只挂在自家博客上时被引用率为 8%;同样的内容发到第三方新闻渠道后,被引用率升到 34%,提升 325%。同样的内容,只换载体,差了四倍。
Semrush 2026 年对 23 万个提问、1 亿条引用的分析还给出了哪些域名最常被 AI 读取:Reddit、LinkedIn、Wikipedia、Medium、YouTube 五位。注意这个名单里没有一个是企业官网。对做 B2B 的企业来说,这是个很清晰的行动指引——预算应该往「被第三方平台收录和讨论」的方向投,而不是只往「官网再发一篇」的方向投。
五、第 4 步:算分与定优先级(第 1 周末)
到这一步你已经有了原始数据。这一步是把数据变成一张能排队的清单。
5.1 三个核心指标,分开算
我只看三个数。别的都可以后加。
| 指标 | 算法 | 怎么解读 |
|---|---|---|
| 提及率 Mention Rate | 被提及的提问数 ÷ 提问总数 | 商业价值最高的数字。它代表 AI 愿不愿意把你放进推荐位。分母按 P0/P1/P2 分层看,别混。 |
| 引用率 Citation Rate | 被引用的提问数 ÷ 提问总数 | 权威度指标。引用高但提及低,说明你是好的素材库、不是好的被推荐对象(典型的 61.7% 幽灵引用状态)。 |
| 准确率 Accuracy Rate | 提及中描述无误的条数 ÷ 提及总数 | 声誉安全线。这一项低于 80% 我会当成高优先级问题处理,优先级高于提升提及率。 |
5.2 综合分:一个加权公式,以及它的免责声明
要横向对比、向上汇报,就需要一个总分。我用的是这个:
AI 可见度指数 = 提及率 × 40% + 准确率 × 35% + 引用率 × 15% + 技术就绪度 × 10%
权重不是普适真理,是我按「能改的概率 × 商业影响」定的:技术就绪度权重最低但不可省,因为它是所有项的前提;提及率最高,因为它最接近钱。
但这个分数有三个必须写进报告免责里的限制,不然它就是下一个被滥用的 vanity metric:
- 只能跟自己的历史比,跟竞品比要看同一天同一词库。不同日期的绝对分不可比——模型在更新,答案在漂移。
- 分数只诊断层级,不诊断原因。分数低说明有问题,但不知道是哪一层坏了。所以报告必须给出「哪一层」的判断,不然客户拿着一个 42 分还是不知道该干什么。
- 不承诺任何行业基准值。AMEC 已经明确说了不要依赖单一分数,而公开市场上根本不存在可信的「行业合格线」。谁给你一个「行业平均分 65 分」,基本可以直接判定为营销内容。
5.3 差距区分析:找那个「差一步就能赢」的词
这是我看重它超过总分的原因。对比竞品时,别只看谁分高,找这一类:同一个提问词,竞品被提及了、你也接近被提及,但你排在它后面,而且它的内容来源你看得见。这类词是最高性价比的突破口——因为模型已经认可了这个话题需要回答,你只是还没进候选池。
判断方法:打开记录表里「同时出现的竞品」和「引用来源域名」两列,找那些竞品出现频次高、而你的域名一次都没出现的提问词,然后逐个点开竞品被引用的那个页面,问自己「我们为什么没有这样一个页面」。
六、第 5 步:输出报告与 90 天行动表(第 2 周)
诊断的交付物不是分数,是一张能直接排期干活的表。我的报告结构固定是四段:
- 基线数据页:完整记录表 + 三个指标 + 各引擎横向对比。原始数据必须给,不能只给结论。
- 问题清单:按「准确率问题 / 技术问题 / 内容缺口 / 信源缺口」四类归,每条标注影响面(影响多少个提问词)。
- 差距区清单:第 5.3 节找出的「差一步」的那些词,附竞品引用源。
- 90 天行动表:见下。
| 优先级 | 动作 | 周期 | 说明 |
|---|---|---|---|
| P0 | 修正事实错误信源 | 2 周内 | 找到 AI 读错信息的地方,去那个源头修。别在自己官网声明。 |
| P0 | 打通抓取通道、清除误伤指令 | 2 周内 | 查日志、清 NOARCHIVE/NOCACHE。成本最低、确定性最高。 |
| P1 | 补齐差距区内容 | 1-2 个月 | 按差距区清单,一词一页,单主题,答案前置,事实带数字和时间。 |
| P1 | 做第三方信源 | 2-3 个月 | 行业媒体、垂类评测、百科、协会名录。按前面 8% → 34% 那个逻辑,投分发而不是投生产。 |
| P2 | 结构化数据与实体一致性 | 持续 | schema.org 标记 + 全网统一实体命名。 |
| P2 | 建立月度复测机制 | 每月 | 同一词库、同一引擎、同样的记录方式。这是唯一能看出趋势的方式。 |
七、六个最容易踩的坑
这部分我按踩坑顺序写,不按重要性。
- 只测品牌词。最常见,也最 wasted。品牌词测的是 AI 认不认识你,无品牌词测的是 AI 会不会推荐你。只测前者,你会得到一份好看但没用的报告。
- 把引用率当可见度。61.7% 的引用里没有你的品牌名。只统计引用次数的企业,会以为自己做得很好。
- 只测一个引擎。ChatGPT 和 Gemini 的引用率与提及率正好相反。一个引擎的健康度代表不了另一个。
- 信媒体转述的数字。这一点我必须专门写,因为我自己也被坑过。举个真实的例子:关于国内 AI 应用的月活,网上同时流传着豆包 3.45 亿、3.82 亿、5.29 亿三个版本。核对来源会发现,这些数字分别对应 QuestMobile 的不同季度口径(Q1、6 月、7 月),但很多文章在转述时并不标注统计时点,也没有一个是错的——它们只是被混着用。做诊断报告引用数据时,必须写清楚「谁在什么时候统计的哪个口径」。这是 E-E-A-T 里 Trust 那一项最具体的落地方式。同样的道理也适用于本站引用 CNNIC 的报告——我在文章开头就注明了发布机构、报告名、发布时间和数据截止时点。
- 买工具代替做诊断。工具适合做持续监测,不适合做第一次诊断。第一次诊断的价值在于你自己理解了模型是怎么挑内容的,这个理解没法外包。
- 诊断完就停。AMEC 特别强调了 AI 输出会因模型、提问、地区、语言、时间和用户上下文而变化。行业里那些做完一次 GEO 审计就宣称「已完成 AI 优化」的报告,漏掉的正是持续性这一半。
八、写在最后
把这套流程压缩成一句话:诊断的本质是让「你的品牌实际怎么样」和「AI 眼里你的品牌怎么样」这两件事对齐。而这个差距通常不是内容写得好不好的差距,是「有没有第三方来源在说你的事实」的差距,以及「技术上有没有把你的页面关在门外」的差距。
另外一个容易被忽略的判断:Google 在 2026 年 5 月发布、6 月更新的生成式 AI 优化指南里,对「AEO」「GEO」这两个词的回应是——从 Google 搜索的角度看,为生成式 AI 搜索做优化就是在为搜索体验做优化,因此它仍然是 SEO。如果你在考虑第三方「AEO/GEO」建议或服务,先去看他们能不能讲清楚自己对应到哪条官方文档。这一条能筛掉大部分噪音。
工具可以帮你跑数据,但替代不了你对业务的判断——AI 到底有没有说对,只有你自己知道。这部分谁也替你不了。
九、参考来源
以下为本文明细引用的资料,核对日期均为 2026-10-11。按「官方一手 / 权威机构 / 行业研究」分层。
官方一手(搜索引擎与标准组织)
- Bing Webmaster Guidelines(微软官方重写版,2026 年 2 月)——首次在搜索引擎官方政策中定义 GEO(聚焦内容获得 grounding 与引用资格)、各 robots meta 指令对 AI 的影响、单主题 URL 建议、「Prompt Injection and AI Manipulation」滥用分类。https://www.bing.com/webmasters/help/webmaster-guidelines-30fba23a
- Optimizing your website for generative AI features in Google Search(Google Search Central,2026-05-15 发布,2026-06-15 更新)——RAG/grounding 与 query fan-out 机制、非同质化内容要求、不需额外机器可读文件的立场、AEO/GEO 术语说明。https://developers.google.com/search/docs/fundamentals/ai-optimization-guide
- AMEC GEO Principles 与 A Practitioner's Guide to GEO Measurement(AMEC,2026-05-20 都柏林 AMEC Global Summit 发布;GlobeNewswire 发稿)——三层框架、基线证据要求、AI 输出作为方向性证据的立场。https://amecorg.com/2026/05/amec-launches-geo-principles-to-bring-rigour-to-ai-led-communications-measurement
权威机构数据
- 《生成式人工智能应用发展报告(2026)》,中国互联网络信息中心(CNNIC)政策与国际合作所,2026-09-29 发布。截至 2026 年上半年我国生成式 AI 用户规模突破 7 亿人、普及率超 50.0%;76.0% 的用户会让生成式 AI 回答问题。核对来源:新华社 2026-09-29(记者王思北)报道 https://www3.xinhuanet.com/20260929/40258c3794684c20ae7867909cdec2ce/c.html ;人民网、光明日报同日报道
- AEO 已被国内团体标准收录:T/CAACCHINA 001—2026(中国互联网协会团体标准),GEO/AEO 术语在国内首次有了标准文本层面的规范。
行业研究与实测
- Semrush × Kevin Indig AI 可见度研究(2026-06-09 发布)——115 个提问词、14 个国家、4 个引擎、3,981 次域名出现;幽灵引用 61.7% / 仅提及 25.1% / 两者兼有 13.2%;ChatGPT 引用率 87% 对提及率 20.7%,Gemini 引用率 21.4% 对提及率 83.7%;长结构化提问提及率仅 2%-3%。
- Semrush 2026 AI Visibility Index——ChatGPT 每次回答平均引用约 15 个来源,Gemini 约 3 个;被引用最多的域名为 Reddit、LinkedIn、Wikipedia、Medium、YouTube。
- Stacker / Scrunch 赢得媒体分发研究(2026 年 3 月,附 2025 年 12 月先期测试)——30 个客户 87 篇内容、8 个 AI 平台 2,600+ 提问,中位可见度提升 239%;同一内容自有博客引用率 8%、第三方新闻渠道 34%。
- Columbia Tow Center for Digital Journalism 引用准确性测试——8 个 AI 搜索引擎、1,600 个查询,整体错误率超 60%;Perplexity 37%、ChatGPT Search 134/200(67%)、Grok 3 94%。
- Similarweb(2026 年 7 月)——美国 ChatGPT 提问中出现引用的比例从 2025 年 6 月约 1.6% 升至 2026 年 5 月约 6.8%。
- QuestMobile《中国移动互联网 2026 年上半年大报告》(2026 年 8 月发布)——国内 AI 原生应用月活数据。注意:同一机构不同季度的口径差异较大(豆包月活公开流传有 3.45 亿、3.82 亿等对应不同统计时点的数值),引用时须标注统计时点与口径。
- 本站实测:SeoMOZ.Link 第 1 期引用观察(2026-09-19)测试方法与基线 https://seomoz.link/articles/yinyong-001.html