每条模型原始返回都可公开核验
下载图片(含二维码)分享到 X分享到 LinkedIn

微信:保存图片后在聊天里长按识别二维码。

AI 可见度监测

你的品牌在 12 个大模型里,这一期和上一期比,变了没有

同一组问题,中文问一遍、英文问一遍,按固定周期重测。每个数字都带误差范围,变化只在超出误差时才报告。我们不提供优化服务。

三个指标,分开给

每个指标下面一行写明怎么算。三个数不合成一个综合分,每个数都能追到当期的原始回答。

提及率

在所有有效回答里,点名你的品牌的回答占多少。

被提及的回答数 ÷ 有效回答数,附 95% Wilson 区间

平均位置

被提及时,你排在模型列出的名单里第几位。

被提及时的位次之和 ÷ 被提及的回答数(第 1 位记 1);只在提到你的回答里算,少于 20 条不给

模型覆盖

12 个模型里,有几个在重复提问下都稳定提到你。

在自己的回答里提到你的比例 ≥ 50% 的模型数 ÷ 本期返回了有效回答的模型数

分母是全部有效回答,不剔除一个品牌都没提的回答。所以提及率回答的是「问一次,被点名的机会有多大」。

每期买到多少条回答

样本公式

每期有效回答(上限)= 场景问题 5 × 问法 7 × 重复 5 × 模型 12 × 语言 2 = 4,200 条

单个场景、单种语言是 35 次提问 × 每个模型。按 12 个模型算是 420 条回答;提及率在 5% 附近时,95% 区间约 ±2.1 个百分点(Wilson 公式),越接近 50% 区间越宽。调用失败的回答如实记录、不计入分母,报告里写实际有效数。

两种模式,分开报

同一组问题可以用两种方式问。两种结果各测各的,报告里分成两张表,不相减,也不合成一个分。

纯模型面板

测什么
模型不联网、只凭训练语料时怎么回答——你的品牌在它「记忆」里的位置。
不测什么
此刻网上新发布的内容。它在两次模型换版之间基本不动,适合看长期沉淀,不适合看一次投放的短期效果。
用在哪里
公开榜单、证书、场景榜集,以及每个客户项目的基线。

联网面板

测什么
模型可以检索网页时怎么回答。它会被最近发布的内容影响,是你的 GEO 投放直接作用的那一层;每条回答引用的网址都存下来。
不测什么
你在某个 App 里看到的结果。App 还会叠加账号记忆和所在地区;联网面板的结果也不等于任何一个人在网页上看到的回答。
用在哪里
只用于客户项目:不进公开榜单,不发证书。
中立靠什么
测量参数在你开始投放前冻结,并把参数的哈希值写进报告;我们不从任何 GEO 服务商拿钱;每条回答引用的网址全量列在报告里。

联网面板一次性演示在 AI 眼镜的一次性小样本演示中,同一题联网与不联网,前十名单平均只有五六个相同;中文联网答案常近乎照搬检索到的某个榜单页。联网时模型先读几篇网页再作答,名单跟着网页走;不联网时反映训练语料的长期印象。两者测的不是一回事,所以公开榜单只用纯模型面板,联网面板只用于客户项目。

报告只并列两边的结论,例如「纯模型面板无显著变化;联网面板显著上升,其中 k 次回答引用了你提交的网址」。我们不说变化是由投放造成的——同一时期竞争对手也在发布内容,检索索引本身也在变。

每期交付什么

  1. 01

    一份可核验存档

    每个数字都能下钻到当期的模型原始回答;存档发出后不再改动。

  2. 02

    三档判定

    提及率的两期变化只写三种结论:显著上升、无显著变化、显著下降(两比例检验,95% 置信水平)。问法、面板结构或会影响这一格的方法论任一变了,就不做判定,只标注原因。

  3. 03

    换代标注

    趋势图上用竖线标出面板和方法论的每一次变更。竖线两侧的数字不直接比较。

  4. 04

    「本期排除与已知偏差」框

    哪天哪个模型调用失败、按什么规则处理、哪些写法被合并成一个品牌、问题集偏向哪一类问题,逐条写在报告末尾。

每张图下面都带方法段

图下面就写着方法,读者不用离开这张图去查;截图转发时,方法也跟着走。

方法段模板(每份报告按当期实际值填写)

本图基于 {模型数} 个模型对 {场景数} 道场景问题的回答,每题 {问法数} 种问法、各问 {重复次数} 次,中英文分别计算。采集时间 {起} 至 {止},面板快照 {版本}。每个品牌的有效回答 {N} 条,区间为 95% Wilson 区间。原始回答可在 {核验链接} 逐条查看。

在说哪些方面

模型提到你的时候,主要在说你的哪些方面,谈到时带不带缺点。这是监测的附加项,测法如下:

  • 两种问法分开统计:一种只描述使用场景、不点名任何品牌,看模型在这个场景里想到谁、首推谁;一种直接点名问你的品牌,看它主动谈到你的哪些方面。两边的数字不相加,也不混在一张表里。
  • 每条回答逐句归到一张方面分类表里。分类表在首期之前冻结并记下哈希值,之后每期用同一张表;要改表就升版本、重新取基线,不跨版本比较。
  • 每个方面报提及比例(k/N)与 95% 区间,以及其中带缺点的占比;被提及不足 20 次的方面只报提及比例。不出情感总分。
  • 随机抽约 20% 的回答由第二位编码员独立再编一遍,按方面报一致率与 Cohen's κ;κ 低于 0.7 的方面不出数字。
  • 只报告模型说了什么;写什么内容,由你决定。

看演示:AI 眼镜,12 个模型、1,656 条回答 →

样例报告

两份完整样例,不用留邮箱。一份用我们已经公开的每周监测数据:每个品牌的名次走势、提到它的模型数、95% 区间、面板变更竖线、本期排除框;一份是 AI 眼镜的方面分析演示:场景里想到谁、点名时说什么。

看样例报告 →

常见问题

两期之间没有显著变化,正常吗?
这是最常见的结果。同一组问题在同样的模型上重复问,本来就有几个百分点的上下浮动;我们只在变化超出这个范围时才报告为变化。
为什么我在 App 里问,结果不一样?
我们通过各模型的开发者接口提问,不登录任何个人账号、不带聊天记忆、不带位置信息,测到的是模型本身的默认认知。App 会叠加联网搜索、账号记忆和所在地区。需要测联网回答时,我们单独开一组联网面板,分开列出。
你们会帮我提升吗?
不会。我们只测量。测量参数在你开始投放前冻结,投放后用同一把尺子复测。

独立性与联系

这项服务用的是跟公开榜单同一套方法与规则。四页可以串起来核对:

算法与面板配置公开在方法论页,欢迎按公开方法复现。

来信咨询hello@ask10ais.com

档位与价格 → 定价

我们不提供优化服务,也不承诺提升推荐率。排名不可付费更改。