境迅

方法论

GEO 行业的普遍问题是交付不可验证:优化动作凭经验,效果呈现靠截图。这一页不讲我们的主张,讲我们的测量方法——方法本身站不站得住,是可以被你独立检查的。

为什么必须在真实用户环境里测

很多监测工具走平台的搜索 API 取数,因为便宜、稳定、好批量。我们做过一次同源验证:同一批问题,一边在豆包应用里以真实用户环境提问,一边走豆包的搜索 API。

1.3%

两侧引用 URL 池的重叠比例

口径:同题同问,分别在豆包应用端与豆包搜索 API 端取回引用 URL 集合,取交集占比。

出处:境迅内部同源验证实验,单次实验、单平台,不外推到全部平台。

结论只有一句:API 采样不能替代真实用户环境的实测。两侧看到的几乎是两个不同的世界——用 API 数据向管理层汇报「用户看到了什么」,汇报的不是同一件事。这也是境迅的监测系统坚持走真实用户环境、成本高出一个量级的原因。

监测系统的三条机制

可信度来自测量方法本身的严谨,而不是结果好看。

独立会话
每次采样独立发起会话并清除上下文污染,避免同一会话内的追问把结果带偏。
多次重采样
同一条意图多次采样取稳定结果。单次截图不构成数据——生成式模型的单次输出本身带随机性。
原始留证
记录原始回答、引用源、时间戳与模型版本。留证是可复核的前提:没有原始记录,任何结论都无从复算。

测什么:意图集怎么划

「企业在 AI 里表现如何」不是一个可测量的问题,得先把它拆成一组具体的提问。这组提问就是意图集,它一旦定下来,后续所有复测都必须原样使用——口径一变,前后就不可比。

  1. 20 条

    核心层

    构成品牌 AI 可见性的干线指标,复测频率最高。

  2. 200 条

    扩展层

    覆盖细分产品线与次级场景。

  3. 500–700 条

    完整层

    全场景长尾问法的完整覆盖面。

一条意图不是一句话

每条核心意图由 ≥5 个语义关联关键词 + ≥10 个代表性问题变体组成——20 条核心意图实际覆盖 100+ 关键词与 200+ 问法。真实用户不会用标准化问法提问,多问法轮换采样是为了消除单次采样的随机性,让基线稳定、全面、可复现。

上市公司的四类典型意图

企业认知
公司怎么样 / 主营业务 / 核心竞争力
行业格局
赛道主要玩家 / 行业排名 / 龙头对比
产品与服务
产品怎么选 / 与竞品对比 / 适用场景
信任与口碑
资质实力 / 技术能力 / 客户评价

怎么算:六个维度的口径定义

报表里的每个维度都先给定义再给数字。口径写不清楚的指标,数字再好看也没有意义——这是我们唯一要求你带着怀疑去读的部分。

  1. 01

    品牌提及率

    企业、核心产品或核心团队在 AI 回答中被提及的比例。

  2. 02

    Share of Voice

    相对主要竞品的提及频率占比。

  3. 03

    引用位置

    在 AI 答案中出现的位置:首位 / 主体 / 末位。

  4. 04

    事实准确率

    关键事实(资质、业务、数据)的正确率。

  5. 05

    合规表达率

    AI 回答中涉及企业的表达符合行业合规要求的比例。

  6. 06

    情感倾向

    正面 / 中立 / 负面提及的占比。

多久能测出变化:一个必须说清楚的事实

AI 平台重新抓取与索引的典型窗口是 7–21 天。这意味着任何内容侧的动作都不会当天反映在答案里,也意味着两次复测之间隔得太近,测到的多半是模型输出的随机波动而不是真实变化。我们把这个窗口写在这里,是因为它同时解释了两件事:为什么复测按周期而不是按次做,以及为什么没有人能承诺「多少天见效」。

测之前:事实支撑预检

每个内容方向在立项前先过一道预检:企业事实库撑不起的主张,不进入生产。缺失权威事实源时,AI 回答常出现过期数据、论坛错误信息与竞品描述误归因——事实库是纠偏的根基。这道闸门挡的不是文笔,是无中生有。

我们自己的事实清单在事实核验中心

想看这套方法在贵司行业怎么落地?

可用下面的电话与邮箱直接联系我们。