GEO 指数是怎么来的?为什么不能只看提及率
一个品牌在 100 次 AI 回答中被提到 40 次,GEO 指数是不是 40 分?不是。提及率只回答“出现过多少次”,没有说明品牌是否被直接答对、是否被推荐、引用了谁、覆盖几个平台,也没有说明这些结果是否稳定。
GEO 指数的作用,是把多个观测维度压缩成一个阶段信号;它不能替代原始样本,更不能被理解成模型给品牌的官方评级。
为什么需要综合分,而不是看一列提及率
考虑两个品牌:A 在品牌词中几乎每次被提到,但业务词和场景词从未出现;B 总提及略低,却在高意图采购问题中常被推荐,并持续引用官网案例。若只看提及率,A 可能更高;从业务价值看,B 的结构更健康。
综合分试图回答的是:品牌在被发现、被说对、被相信、被选择和持续出现这些环节中,整体表现如何。
九类常见观测维度
- 提及率:有效样本中品牌出现的比例。
- 直接命中率:明确询问品牌时,AI 是否正确回答。
- 引用强度:回答是否引用支持品牌事实的来源。
- 推荐位置:品牌是否进入候选,处于首推、前列还是顺带提及。
- 标准回答率:核心事实是否按期望口径被准确表达。
- 自有信源率:官网、案例等品牌自有页面是否被采用。
- 联网引用率:有联网能力的平台是否形成可验证引用。
- 平台覆盖率:有效样本是否分布在多个目标 AI 平台。
- 稳定性:跨时间、平台和问法的结果是否持续,而非偶然命中。
不同系统可能使用不同名称和权重,但只要用于决策,就应公开维度含义、样本口径和下钻证据。
为什么权重不能平均分
提及和引用对业务的含义不同,直接命中与平台覆盖也不是同一层。权重通常会根据结果与“被正确选择”的关系设定。高权重不代表唯一重要,而是该维度对综合表现影响更大。
同时应避免双重计算。例如同一次品牌出现既计入提及,又在推荐位置中体现,算法需要控制相关性,防止一个现象被重复放大。权重调整也必须版本化说明,不能为了让客户“及格”临时改分。
样本口径比公式更容易造成误判
- 品牌词比例过高,会抬高提及与直接命中。
- 某个平台大量失败,若仍计入分母,会压低结果。
- 把广度估算与真实浏览器样本混在一起,会模糊证据等级。
- 时间窗太短,随机波动被误当趋势;太长,又掩盖近期变化。
- 新增一批高难度问题后,总分下降不一定代表品牌变差。
因此报告必须同时展示有效样本数、问题结构、平台分布、时间窗和数据来源。
分数档位应表达阶段,而不是及格线
铭文鼎成 GEO 将分数分为 S(85 及以上)、A(70–84.9)、B(55–69.9)、C(35–54.9)和 D(35 以下)。档位帮助用户快速理解当前阶段,但 60 分并不等于传统考试的“刚及格”。
B 档可能代表品牌已有一定可见度,但推荐、引用或稳定性仍有明显短板;A 档也不意味着无需优化,而是应从补基础转向守稳定、扩高价值场景。同行基准比单一及格线更有参考价值。
如何从分数直接得到动作
| 短板 | 优先动作 | 验证方式 |
|---|---|---|
| 提及低 | 补品类、场景和品牌关系内容 | 同类业务词复测 |
| 直接命中低 | 修品牌事实、名称与官网定义 | 品牌核验问题 |
| 引用弱 | 建设可抓取官网、案例和权威信源 | 引用 URL 与原文 |
| 推荐位置低 | 补差异、适用条件和可信证据 | 决策类问题排名 |
| 稳定性低 | 扩大跨平台与时间验证,减少单点依赖 | 多轮样本分布 |
铭文鼎成 GEO 如何保证指数可解释
看板展示综合分、档位、同行基准、有效样本和各维度得分;点击维度可进入对应问题与原始监测。异常样本不进入品牌评价,广度覆盖单独标识。系统还提供分数说明、针对当前短板的建议和可执行动作,而不是只显示“继续努力”。
当问题池、平台或算法版本发生变化,应在时间线中标记,避免用户把口径变化误认为业务变化。历史证据保留,便于复核。
结论:总分负责导航,证据负责决策
GEO 指数不是为了给企业贴标签,也不应该为了体感随意放宽。它的价值是用同一口径发现结构性短板、跟踪趋势并安排优先级。
如果只能看到分数,算法是黑箱;如果分数能回到维度、样本、原文和动作,它才是一张可使用的经营仪表盘。