引用观察 · WEEKLY REPORT #001
测试方法与基线:我们怎么测 AI 的引用?
任何观察要成立,先把规矩立好。这一期不谈发现,只谈方法:本轮研究固定用同一套提问、同一台设备、同一套记录表,每周跑一轮,长期追踪四个中文 AI 引擎的引用来源变化。方法公开,任何人可以复现、可以挑错。
一、测试对象:四个中文 AI 引擎
- 豆包(字节)——移动端用户量最大的 AI 助手之一;
- 腾讯元宝——微信公众号生态的 AI 入口,微信内搜索场景;
- Kimi(月之暗面)——长文本与搜索问答的代表;
- 微信 AI 搜索——微信"搜一搜"内置的 AI 回答。
选择标准只有一个:普通用户真实会用的入口。企业关心的是"客户问 AI 时会不会提到我",而不是实验室里的模型评测。
二、提问词库:20 个固定问题
问题分三类,模拟真实用户的提问方式:
| 类型 | 数量 | 示例 |
|---|---|---|
| 行业推荐类 | 8 个 | "国内做游乐设备定制有哪些靠谱厂家?""儿童乐园设备采购选哪家比较好?" |
| how-to 类 | 6 个 | "游乐设备厂家怎么考察实力?""SEO 转 GEO 要学什么?" |
| 对比判断类 | 6 个 | "A 厂家和 B 厂家的游乐设备哪个好?""做企业 AI 知识库用什么方案?" |
词库每季度评审一次,不轻易更换——纵向可比性比覆盖面重要。
三、记录指标
- 引用了谁:每条回答里的来源站点/平台,逐条记录;
- 引用位置:来源出现在正文引用、脚注还是参考列表;
- 信息准确度:回答内容与企业真实情况是否一致(答错也要记);
- 稳定性:同一问题隔天再问,答案和引用是否变化。
关于数据:第 2 期起公布首轮 20 问 × 4 引擎的完整引用分布表。本文中的流程即为全部实测规范,欢迎按此方法自行跑一轮并对比结果。
四、为什么"每周"而不是"一次性"
AI 引擎的引用偏好不是静态的:模型会更新、索引会刷新、权重会调整。单次测试只能拍快照,每周同题重测才能看到趋势——谁在涨、谁在被抛弃、哪类内容突然开始被引用。这才是这个站存在的意义。
五、本轮基线
第 1 期为方法基线期:seomoz.link 新站刚改版上线,当前在四个引擎的 GEO 相关提问中零引用。这个零就是起点——本站自己就是第一个被观察对象,之后每期周报会同步记录本站引用数的变化。