先说结论:GEO 没有一个总分
把四件不同的事压成一个“GEO 分数”,度量就开始撒谎:答案可能提到你却没有链接,可能给了链接却不足以支撑旁边的论断;读者也可能从 AI 产品来到网站,却因为 referrer 丢失而被记为 Direct。
所以我把 GEO 拆成四层。每一层只回答它有证据回答的问题:
| 层级 | 要回答的问题 | 证据 | 不能证明什么 |
|---|---|---|---|
| 1. 平台曝光 | 平台是否在生成式搜索体验中展示了我的页面? | 平台自有报告 | 已被提及、正确引用、访问或转化 |
| 2. 可验证观测 | 一次受控答案是否提到我、链接我,并正确使用了来源? | 保存证据的重复提示词审计 | 整个用户总体中的真实可见度 |
| 3. 转介访问 | 是否有人从 AI 产品点击来到网站? | 分析工具与服务器日志 | 点击前发生过的全部提及和曝光 |
| 4. 最终结果 | 这次访问是否创造了读者或业务价值? | 订阅、有效阅读、线索、下载或收入 | 缺少额外归因证据时,哪次曝光导致了结果 |
这四层前后相连,却不能互相替代。整篇文章最重要的原则也只有一句:不要用低一层的代理指标,冒充高一层的结果。
这是「GEO 生成式引擎优化」系列的第 6 篇(度量与工具·终章)。前五篇讨论内容怎样被检索、引用与信任;这一篇定义我们怎样知道改变是否真的发生。
第一层:使用平台自有曝光数据,也保留它的边界
Google 在 2026 年 6 月发布了 Search Console 的生成式 AI 效果报告 。它正在向部分站点所有者逐步开放:当网站链接出现在 AI Overviews 或 AI Mode 时,报告会记录曝光,并可按页面、国家/地区、设备和日期拆分;Search Labs 实验不计入其中。
如果你的资源已经获得该报告,可以记录:
- 符合条件的生成式 AI 总曝光;
- 获得曝光的页面;
- 国家/地区与设备分布;
- 可比时间窗口内的变化。
这比从普通 Search Performance 曲线猜测“是不是被 AI 摘走答案”可靠得多。但 Google 当前提供的是曝光报告,不是完整的引用报告。它不展示用户提示词、生成答案原文,也不区分普通链接与真正支撑论断的引用,更不覆盖其他 AI 产品。
还要注意:这些数据已经计入 Search Console 的 Web 搜索总数据,不能把两份曝光相加,否则会重复计算。产品仍在变化,应以 Google 的报告文档 为准。
普通 GSC 依然适合分析需求、查询、页面、设备与地区。一个“高曝光、低点击”的页面,可能意味着标题不匹配意图、富媒体结果吸收了点击,或者零点击搜索增加;它不能证明 AI 使用或引用了该页。要证明这一点,需要平台直接数据或保存下来的答案观测。
证据纪律从命名开始:曝光就是曝光,不要因为一个推断听起来顺畅,就把它升级成引用。
第二层:做一次可以复现的提及与引用审计
手工问一次很容易,做出可复现的审计却需要克制。AI 答案会随产品入口、地区、账户、对话历史、模型路由和时间变化。一张走运的截图只是轶事;有意义的样本必须同时记录它在什么条件下产生。
先定义观测,再收集数据
把一个有效的 提示词 × 引擎 × locale × 运行轮次 定义为一条观测。运行前冻结提示词清单并分配稳定 ID,不要因为结果不好,就悄悄替换难题。
每一批研究都遵循同一套规则:
- 使用新对话,避免上一条答案影响下一条;
- 固定 locale、国家/地区、账户状态与产品入口;
- 重复运行同一提示词,不把一次随机输出当结论;
- 对目标与预先确定的竞争对象使用相同提示词集;
- 在产品规则允许时,保存答案、引用 URL 与时间戳;
- 比较不同批次前,记录协议与产品条件的所有变化。
如果平台提供并允许使用官方 API,优先使用 API;否则就人工审计。度量方案不是绕过消费者产品服务条款的自动化许可证。
保存一行审计数据,而不只是一个截图目录
下面这组 CSV 字段可以作为最低可用结构:
study_version,prompt_id,prompt_text,intent,engine,surface,model_label,locale,country,account_state,thread_state,timestamp_utc,run_id,mentioned,linked_citation,supporting_citation,cited_urls,support_grade,competitors
其中几个概念必须分开:
- 提及(mention):答案点名了目标实体或网站,不要求有链接。
- 可点击引用(linked citation):答案中包含指向目标域名的可点击 URL。
- 有效支撑引用(supporting citation):被链接页面在上下文中确实支持相邻的事实论断。
- 支撑等级(support grade):可使用
full、partial、unrelated、unverifiable等小型复核量表。 - 竞争对象(competitors):在同一答案中观察到的、事先定义好的比较集合。
一个链接只出现在通用“来源列表”里,可以记为有链接,却不能自动判为有效支撑。答案提到 cubxxw 但链接到别处,只算提及,不算目标域名引用。分类的价值,恰恰在于它能抵抗我们对好结果的期待。
让每个百分比都露出分母
对一批有效观测,可以计算:
提及率 = 提到目标的观测数 / 有效观测总数
可点击引用率 = 含目标可点击 URL 的观测数 / 有效观测总数
有效支撑引用率 = 含目标有效支撑链接的观测数 / 有效观测总数
引用准确率 = 有效支撑链接数 / 已复核链接数
始终同时展示分子与分母。3/30(10%) 比一个孤零零的 10% 更诚实,因为后者藏起了“趋势”可能只由一条答案推动。
声量份额也要先写清计数规则:预先定义竞争对象,选择计算提及还是可点击引用,并在每条观测内对每个品牌去重一次。例如:
可点击引用声量份额 = 含目标链接的观测数 /
含目标或竞争对象链接的观测数总和
不能拿自己的提及数与竞争对手的引用数相比;除非研究明确测量链接频次,也不要把同一答案中的重复链接全部累加。稳定的定义,比复杂的图表更重要。
把“出现”与“正确”分开
可见度上升时,质量也可能下降。至少抽样检查:
- 来源是否真的支撑论断;
- 答案是否保留了重要限定条件;
- 实体是否被正确识别;
- 有时效性的陈述是否仍然有效;
- 原创工作是否归给了正确作者。
这不是装饰性的质检。虚构或误导性引用,即使让可见度曲线上升,也仍然是负面曝光。
第三层:把 GA4 中的 AI 转介看作下界
GA4 可以告诉你一次访问的来源、媒介、落地页、互动和后续转化。这是有用的点击证据,却不能告诉你此前有多少答案提过网站,也不能还原产生点击的具体答案。
可以围绕 session source/medium 与 landing page 建立探索报告,关注 chatgpt.com、perplexity.ai、gemini.google.com、copilot.microsoft.com 等已知来源,同时把未知 referrer 留待复核,而不是把一份域名列表永久写死。
然后保守地解释数据。Google 对流量来源维度 、Direct 流量 与引荐流量 的说明,都指向同一个边界:分析系统只能使用访问实际携带的信息。
AI 来源信息可能在这些环节丢失:
- referrer 抑制或隐私控制;
- 应用内浏览器转到另一个浏览器;
- 复制粘贴 URL;
- 重定向;
- 同意设置、拦截器或缺失的统计标签。
这些访问中的一部分会落入 Direct 或 Unassigned。所以更准确的说法是 GA4 可归因的 AI 转介访问;它通常是下界,而不是完整总量。
若要增强第三层证据,可以组合:
- GA4 的来源/媒介与落地页报告;
- 服务器或 CDN 日志中的 referrer 与请求模式;
- 你能控制的链接上的 campaign 参数;
- 与落地会话关联的转化事件;
- 对高价值结果设置简短的“从哪里知道我们”自报问题。
这些方法能改善点击归因,却不能补回缺失的曝光与引用数据。
第四层:测量与网站相称的结果
流量不是价值的最终单位。对这个博客,我更关心读者是否继续访问相关项目、是否真正用完教程、是否订阅或再次回来。文档业务可以看激活用户,咨询网站可以看合格询盘,开源项目可以看有效安装或有意义的仓库参与。
先定义一个主要结果和少量诊断指标,再看数据:
| 网站目标 | 主要结果 | 辅助诊断 |
|---|---|---|
| 技术博客 | 有效订阅或项目访问 | 阅读深度、站内续读、回访 |
| 开源项目 | 合格安装或采用事件 | 文档深度、版本页访问、Issue 质量 |
| 产品 | 激活用户或合格线索 | 试用开始、Demo 申请、辅助转化 |
比较 AI 归因访问与其他来源时,必须使用相同定义和观察窗口。不能拿 3 次访问与 1 次注册,就声称“AI 流量转化更好”;应展示原始计数、不确定性和覆盖周期。
结果层还能防止一种隐蔽失败:为了提示词可见度不断优化,却吸引了错误的人。目标不是成为答案里频繁出现的装饰性引用,而是有用到让合适的读者愿意继续前行。
2026 年的工具:仪器,不是神谕
工具覆盖与价格变化很快。下表的信息核对于 2026-07-31;购买或围绕某项功能开发前,请重新查看官方文档。
| 工具 | 最适合做什么 | 重要边界 |
|---|---|---|
| Search Console 生成式 AI 报告 | Google 自有生成式场景的曝光趋势 | 分批开放;不是提示词、引用、点击或跨引擎报告 |
| 人工审计或获准使用的 API | 可复现地观察答案级提及、链接与支撑质量 | 是受控样本,不是全部用户会话的普查 |
| Profound | 组织规模的可见度与答案观测工作流 | 需评估引擎覆盖与方法;供应商分数仍来自样本 |
| Peec AI | 提示词、竞品、近期对话与筛选分析 | 结果取决于所跟踪提示词、市场和产品条件 |
| Frase AI Visibility Checker | 轻量可见度检查与探索 | 一次抽查不能替代版本化的重复研究 |
| GA4 与服务器日志 | 可归因转介、落地行为与结果 | referrer 丢失和身份缺口使完整归因不可得 |
供应商仪表盘能节省采集与报告时间,却不会消灭抽样误差,也不会把私有覆盖变成总体真相。采用前,应追问观测单位、提示词选择、运行频率、locale 与账户控制、随机答案的处理方式,以及引擎变化时历史数据如何解释。
本仓库脚本究竟测量什么
cubxxw 博客仓库有几条有用的命令,但它们不是 AI 引用监测器:
npm run geo:audit
npm run seo:gsc
npm run seo:psi
npm run indexnow:push
npm run baidu:push
它们的真实能力是:
| 命令 | 实际作用 | 在四层框架中的位置 |
|---|---|---|
geo:audit | 检查 TLDR、description、导语和正文长度等编辑信号 | 发布准备;不直接观测 GEO |
seo:gsc | 拉取日期、查询、页面、设备和国家等普通 Search Analytics 维度 | 搜索需求背景;不读取新的生成式 AI 报告 |
seo:psi | 获取 Lighthouse 与 CrUX 相关技术性能数据 | 技术健康;没有提及或引用数据 |
indexnow:push | 通过 IndexNow 提交符合条件的 URL | 发布与发现,不是度量 |
baidu:push | 向百度提交 URL | 发布与发现,不是度量 |
它们仍然重要:页面要先能发布、能抓取、能使用、编辑结构清楚,引用度量才有意义。但把内容检查器称作“GEO 分数”,会混淆内容卫生与已经发生的可见度。
如果以后为仓库加入真正的监测器,它应该保存版本化的提示词结构与原始观测,从有效行计算比率,并让平台曝光、受控样本、转介和结果数据分表存储。
一份低成本的 GEO 度量工作簿
一张表格或一个小型数据库就足以起步。设置四个与框架一致的工作表:
- Exposure:Search Console 报告窗口、合格曝光、页面、国家/地区、设备与提取备注。
- Observations:按审计 schema,每个有效的提示词—引擎—locale—轮次一行。
- Referrals:可归因会话、落地页、互动、转化与已知归因限制。
- Outcomes:网站主要价值事件、分母、来源分组与合格规则。
再加一个 Protocol 表,记录研究版本、提示词增删、引擎或入口变化、登录状态、locale 变化、无效运行及排除原因。没有这份日志,模型更新和方法变化会在图上伪装成同一种趋势。
工作流不必复杂:
- 冻结研究版本与竞争对象;
- 跑完预定义批次,只按书面有效性规则排除数据;
- 复核链接论断的支撑质量;
- 导入可比窗口的曝光、转介与结果数据;
- 同时公布原始计数、比率、限制与协议变化;
- 根据证据定位的具体弱点改页面,再开始下一批可比观测。
尽量比较相同数量的有效观测。对平台报告和分析数据,则选择季节性相近的窗口,并记录产品覆盖变化。不要给一次改写或权威建设许诺固定见效日期;下一次检查应由“已经积累足够可比数据”触发,而不是由激励式日历触发。
怎样读仪表盘,才不被自己的故事骗过
四种组合尤其值得检查:
- 曝光上涨,引用没有上涨:Google 展示了页面,但受控答案样本没有链接它。先检查意图匹配、段落清晰度和样本边界,再决定是否全面重写。
- 引用上涨,转介没有上涨:答案可能已经解决问题、链接位置可能不显眼,或来源信息丢失。查看真实答案上下文与服务器日志。
- 转介上涨,结果没有上涨:落地页或受众匹配有问题。应改善后续路径,而不是只追引用率。
- 结果上涨,可归因转介持平:可能涉及 Direct/Unassigned 泄漏、辅助旅程或其他渠道。在更多证据出现前,因果关系仍未解决。
四层模型的价值就在这里:层与层之间的缺口,会告诉你下一步调查哪里;混合总分只会把这个线索抹掉。
系列回顾:从检索走到证据
「GEO 生成式引擎优化」系列围绕一件事展开:让真正有用的工作容易被检索,精确到足以引用,可信到值得背书。
| 篇 | 主题 | 核心问题 |
|---|---|---|
| 1 · 支柱篇 | 五层模型 | 当搜索变成答案,什么发生了变化? |
| 2 · 原理篇 | 检索与引用 | 系统怎样找到并组合段落? |
| 3 · 结构化实战 | Answer-First、Schema 与内链 | 页面怎样更容易被正确使用? |
| 4 · 信任与背书 | 证据与声誉 | 系统为什么应该优先相信这个来源? |
| 5 · 博客复盘 | 真实数据诊断 | 到底是哪一层失效? |
| 6 · 度量(本篇) | 曝光、引用、转介、结果 | 什么改变了,证据又能证明到哪里? |
五层内容模型仍然是 可抓取 → 可理解 → 可信任 → 可引用 → 可背书。本篇在它们下面补了一条证据规则:不要从低阶代理指标,直接推断高阶效果。
常见问题(FAQ)
没有付费工具,可以度量 GEO 吗?
可以。如果站点已经获得权限,就使用 Search Console 生成式 AI 报告;再配合一组小规模重复提示词审计、GA4、服务器日志和定义清楚的结果事件。只有当采集量、市场数量或报告要求超过人工可靠复核的范围时,付费工具才真正有价值。
被引率多少才算好?
没有通用基准。不同产品入口的引用行为不同,提示词与样本也不同。应比较同一个研究版本,展示分母,并把有效支撑引用的准确率与“有没有出现”放在同等位置。
多久运行一次审计?
当你能在可比条件下完成一批预定义观测时再运行。固定数量的有效观测,比一个每周执行却不断换提示词、跳过引擎、数据少到无法解释的仪式更可靠。
AI 错误引用了我,该怎么办?
保存答案与来源 URL,给支撑失败分级,并修正文源页面上的歧义或过期事实。如果产品提供反馈入口,就提交反馈。不要从研究里删除这条失败记录;它正是引用准确率的一部分。
普通 GSC 的高曝光能证明 AI 可见度吗?
不能。只有专门的生成式 AI 报告,才提供 Google 自有场景中符合条件的生成式曝光证据。普通 Web 曝光不能证明 AI 答案使用或引用了页面,而两类报告都不覆盖其他 AI 产品。
结语:度量,是拒绝方便的故事
一个新领域最诱人的事,是把附近每个数字都当作证明:曝光变成引用,Direct 变成隐藏的 AI 流量,一次答案变成市场份额。这样很容易得到自信的图表,也很容易做出脆弱的决定。
更好的系统让证据停在它该在的层里:把曝光记作曝光,亲自检查提及与链接,把可归因转介看作不完整的下界,再用真正对读者和网站有意义的结果判断工作。最后,把协议保留得足够清楚,让另一个人可以重复。
GEO 不会因为多了一个缩写就变得严谨。严谨来自三件小事:准确说出我们看见了什么、没有看见什么,以及现有证据允许我们走到哪一步。
一手资料:Google 的生成式 AI 效果报告公告 、Search Console 报告文档 、AI 功能与网站 ,以及 Google Analytics 关于流量来源维度 、Direct 流量 和引荐流量 的文档。工具表中的产品描述于 2026-07-31 按表内一手页面核对。

读者回响