买方检查清单
选购 AI 可见度测量服务前,该问的 10 个问题
如果你在挑一家服务,测量你的品牌在大模型回答里出现得怎么样,下面十个问题可以把几家放在同一把尺子上比。每题写了为什么要问;最后一行是我们自己的做法,方便对照。这些问题拿去问任何一家都适用,也包括我们。
- 01
每个指标能不能拆开,看到分子和分母?
为什么要问
一个说不清怎么算的综合分,涨了跌了都没法解释。分子和分母写清楚,你才知道这个数回答的是什么问题,也才能自己验算。
- 02
数字有没有误差范围?样本有多大?
为什么要问
模型回答本身带随机性,同一个问题问两遍,名单就可能不同。没有样本量和区间,一个百分比看不出是稳定的结论,还是一次抽样的偶然。
ask10ais 的做法
监测项目单个场景、单种语言,每个模型问 35 次;提及率附 95% Wilson 区间,调用失败的回答不计入分母,报告写实际有效数。公开榜单的指数每题每个模型只问一次,不给区间,方法论页写明了这一点。
- 03
两期对比做没做显著性检验,还是只给涨跌箭头?
为什么要问
两期相差几个百分点,可能只是抽样波动。不做检验就画箭头,噪声会被读成变化,后面的预算和内容决策也跟着偏。
- 04
模型换版本时怎么处理?历史数字会不会被回头改写?
为什么要问
模型厂商会更新模型,测量方也会换模型、改公式。换了不标,前后两段数字连成一条线,看上去是品牌变了,其实是尺子变了;回头改写旧数字,过去的报告就没法再核对。
ask10ais 的做法
每次换模型、改公式、换归一化模型都记进方法论页的面板变更表,只追加。监测报告的趋势图在变更处画竖线,两侧不直接比较。已经发出的记录不再改动;发现错误,记进更正日志。
- 05
测的是模型的记忆,还是联网后的答案?两者分开报了吗?
为什么要问
不联网时,模型凭训练语料作答,两次换版之间基本不动;联网时,模型先读网页再答,会随新发布的内容变化。两者测的不是一回事,合在一个数里,就说不清变化从哪来。
- 06
能不能逐条看到原始回答?
为什么要问
汇总数字是对原始回答的归纳,归纳可能出错:品牌名合并错了、解析漏了、回答被截断了。能看到原文,才能自己判断这个数站不站得住。
- 07
问题集由谁定?跑之前冻结了吗?
为什么要问
问法稍微一改,名单就可能不同。如果看到结果之后还能调问题,就能挑出想要的数字;开跑前冻结并留下版本,前后两期才是同一把尺子。
- 08
用哪些模型?为什么是这些?品牌方能不能删改模型或权重?
为什么要问
选哪些模型、每个模型占多大权重,直接决定结果。如果付费方能去掉对自己不利的模型、调高对自己有利的权重,报告就只剩付费方想看的那部分。
ask10ais 的做法
面板固定为 7 个头部席位加 5 个长尾席位,入选规则和权重来源公开在方法论页,按实际在跑的配置现查。品牌方可以定问题和场景,不能删改模型或权重;这类请求记进拒绝记录。
- 09
测量方是否同时向你出售提升服务,或者从服务商那里拿钱?
为什么要问
负责把数字做上去的一方,同时负责报告数字是多少,利益就冲突了。按效果收费、收推荐费也是一样:测量结果直接影响测量方的收入。
- 10
要测多种语言时:每种语言的问题是独立撰写的,还是翻译的?
为什么要问
直译过来的问题,常常不是当地买家真会说的话,测到的是翻译腔下的回答。几种语言的结果合成一个数,其中一种语言里的变化就会被别的语言盖住。
答案不必和我们一样。要紧的是每一题都有明确、可以核对的回答。