AI 可见度监测
你的品牌在 12 个大模型里,这一期和上一期比,变了没有
同一组问题,中文问一遍、英文问一遍,按固定周期重测。每个数字都带误差范围,变化只在超出误差时才报告。我们不提供优化服务。
三个指标,分开给
每个指标下面一行写明怎么算。三个数不合成一个综合分,每个数都能追到当期的原始回答。
提及率
在所有有效回答里,点名你的品牌的回答占多少。
被提及的回答数 ÷ 有效回答数,附 95% Wilson 区间
平均位置
被提及时,你排在模型列出的名单里第几位。
被提及时的位次之和 ÷ 被提及的回答数(第 1 位记 1);只在提到你的回答里算,少于 20 条不给
模型覆盖
12 个模型里,有几个在重复提问下都稳定提到你。
在自己的回答里提到你的比例 ≥ 50% 的模型数 ÷ 本期返回了有效回答的模型数
分母是全部有效回答,不剔除一个品牌都没提的回答。所以提及率回答的是「问一次,被点名的机会有多大」。
每期买到多少条回答
每期有效回答(上限)= 场景问题 5 × 问法 7 × 重复 5 × 模型 12 × 语言 2 = 4,200 条
单个场景、单种语言是 35 次提问 × 每个模型。按 12 个模型算是 420 条回答;提及率在 5% 附近时,95% 区间约 ±2.1 个百分点(Wilson 公式),越接近 50% 区间越宽。调用失败的回答如实记录、不计入分母,报告里写实际有效数。
两种模式,分开报
同一组问题可以用两种方式问。两种结果各测各的,报告里分成两张表,不相减,也不合成一个分。
纯模型面板
- 测什么
- 模型不联网、只凭训练语料时怎么回答——你的品牌在它「记忆」里的位置。
- 不测什么
- 此刻网上新发布的内容。它在两次模型换版之间基本不动,适合看长期沉淀,不适合看一次投放的短期效果。
- 用在哪里
- 公开榜单、证书、场景榜集,以及每个客户项目的基线。
联网面板
- 测什么
- 模型可以检索网页时怎么回答。它会被最近发布的内容影响,是你的 GEO 投放直接作用的那一层;每条回答引用的网址都存下来。
- 不测什么
- 你在某个 App 里看到的结果。App 还会叠加账号记忆和所在地区;联网面板的结果也不等于任何一个人在网页上看到的回答。
- 用在哪里
- 只用于客户项目:不进公开榜单,不发证书。
- 中立靠什么
- 测量参数在你开始投放前冻结,并把参数的哈希值写进报告;我们不从任何 GEO 服务商拿钱;每条回答引用的网址全量列在报告里。
联网面板一次性演示在 AI 眼镜的一次性小样本演示中,同一题联网与不联网,前十名单平均只有五六个相同;中文联网答案常近乎照搬检索到的某个榜单页。联网时模型先读几篇网页再作答,名单跟着网页走;不联网时反映训练语料的长期印象。两者测的不是一回事,所以公开榜单只用纯模型面板,联网面板只用于客户项目。
报告只并列两边的结论,例如「纯模型面板无显著变化;联网面板显著上升,其中 k 次回答引用了你提交的网址」。我们不说变化是由投放造成的——同一时期竞争对手也在发布内容,检索索引本身也在变。
每期交付什么
- 01
一份可核验存档
每个数字都能下钻到当期的模型原始回答;存档发出后不再改动。
- 02
三档判定
提及率的两期变化只写三种结论:显著上升、无显著变化、显著下降(两比例检验,95% 置信水平)。问法、面板结构或会影响这一格的方法论任一变了,就不做判定,只标注原因。
- 03
换代标注
趋势图上用竖线标出面板和方法论的每一次变更。竖线两侧的数字不直接比较。
- 04
「本期排除与已知偏差」框
哪天哪个模型调用失败、按什么规则处理、哪些写法被合并成一个品牌、问题集偏向哪一类问题,逐条写在报告末尾。
每张图下面都带方法段
图下面就写着方法,读者不用离开这张图去查;截图转发时,方法也跟着走。
本图基于 {模型数} 个模型对 {场景数} 道场景问题的回答,每题 {问法数} 种问法、各问 {重复次数} 次,中英文分别计算。采集时间 {起} 至 {止},面板快照 {版本}。每个品牌的有效回答 {N} 条,区间为 95% Wilson 区间。原始回答可在 {核验链接} 逐条查看。
在说哪些方面
模型提到你的时候,主要在说你的哪些方面,谈到时带不带缺点。这是监测的附加项,测法如下:
- 两种问法分开统计:一种只描述使用场景、不点名任何品牌,看模型在这个场景里想到谁、首推谁;一种直接点名问你的品牌,看它主动谈到你的哪些方面。两边的数字不相加,也不混在一张表里。
- 每条回答逐句归到一张方面分类表里。分类表在首期之前冻结并记下哈希值,之后每期用同一张表;要改表就升版本、重新取基线,不跨版本比较。
- 每个方面报提及比例(k/N)与 95% 区间,以及其中带缺点的占比;被提及不足 20 次的方面只报提及比例。不出情感总分。
- 随机抽约 20% 的回答由第二位编码员独立再编一遍,按方面报一致率与 Cohen's κ;κ 低于 0.7 的方面不出数字。
- 只报告模型说了什么;写什么内容,由你决定。
样例报告
两份完整样例,不用留邮箱。一份用我们已经公开的每周监测数据:每个品牌的名次走势、提到它的模型数、95% 区间、面板变更竖线、本期排除框;一份是 AI 眼镜的方面分析演示:场景里想到谁、点名时说什么。
常见问题
- 两期之间没有显著变化,正常吗?
- 这是最常见的结果。同一组问题在同样的模型上重复问,本来就有几个百分点的上下浮动;我们只在变化超出这个范围时才报告为变化。
- 为什么我在 App 里问,结果不一样?
- 我们通过各模型的开发者接口提问,不登录任何个人账号、不带聊天记忆、不带位置信息,测到的是模型本身的默认认知。App 会叠加联网搜索、账号记忆和所在地区。需要测联网回答时,我们单独开一组联网面板,分开列出。
- 你们会帮我提升吗?
- 不会。我们只测量。测量参数在你开始投放前冻结,投放后用同一把尺子复测。
独立性与联系
这项服务用的是跟公开榜单同一套方法与规则。四页可以串起来核对:
算法与面板配置公开在方法论页,欢迎按公开方法复现。
我们不提供优化服务,也不承诺提升推荐率。排名不可付费更改。