每条模型原始返回都可公开核验
下载图片(含二维码)分享到 X分享到 LinkedIn

微信:保存图片后在聊天里长按识别二维码。

买方检查清单

选购 AI 可见度测量服务前,该问的 10 个问题

如果你在挑一家服务,测量你的品牌在大模型回答里出现得怎么样,下面十个问题可以把几家放在同一把尺子上比。每题写了为什么要问;最后一行是我们自己的做法,方便对照。这些问题拿去问任何一家都适用,也包括我们。

  1. 01

    每个指标能不能拆开,看到分子和分母?

    为什么要问

    一个说不清怎么算的综合分,涨了跌了都没法解释。分子和分母写清楚,你才知道这个数回答的是什么问题,也才能自己验算。

    ask10ais 的做法

    不出综合分。提及率、平均位置、模型覆盖分开报,每个指标的分子和分母写在方法论页;样例报告的表格视图给出每个比例的分子、分母和区间。

    监测指标定义 → 方法论

  2. 02

    数字有没有误差范围?样本有多大?

    为什么要问

    模型回答本身带随机性,同一个问题问两遍,名单就可能不同。没有样本量和区间,一个百分比看不出是稳定的结论,还是一次抽样的偶然。

    ask10ais 的做法

    监测项目单个场景、单种语言,每个模型问 35 次;提及率附 95% Wilson 区间,调用失败的回答不计入分母,报告写实际有效数。公开榜单的指数每题每个模型只问一次,不给区间,方法论页写明了这一点。

    每期样本公式 → AI 可见度监测

  3. 03

    两期对比做没做显著性检验,还是只给涨跌箭头?

    为什么要问

    两期相差几个百分点,可能只是抽样波动。不做检验就画箭头,噪声会被读成变化,后面的预算和内容决策也跟着偏。

    ask10ais 的做法

    提及率的两期变化用两比例检验(95% 置信水平),只写三种结论:显著上升、无显著变化、显著下降。问法、面板或方法论变了,就不做判定,只标注原因。

    判定规则 → 方法论

  4. 04

    模型换版本时怎么处理?历史数字会不会被回头改写?

    为什么要问

    模型厂商会更新模型,测量方也会换模型、改公式。换了不标,前后两段数字连成一条线,看上去是品牌变了,其实是尺子变了;回头改写旧数字,过去的报告就没法再核对。

    ask10ais 的做法

    每次换模型、改公式、换归一化模型都记进方法论页的面板变更表,只追加。监测报告的趋势图在变更处画竖线,两侧不直接比较。已经发出的记录不再改动;发现错误,记进更正日志。

    面板变更记录 → 方法论

  5. 05

    测的是模型的记忆,还是联网后的答案?两者分开报了吗?

    为什么要问

    不联网时,模型凭训练语料作答,两次换版之间基本不动;联网时,模型先读网页再答,会随新发布的内容变化。两者测的不是一回事,合在一个数里,就说不清变化从哪来。

    ask10ais 的做法

    公开榜单和证书只用纯模型面板。联网面板只用于客户项目,结果单独成表,不相减,也不合成一个分。

    两种模式 → 方法论

  6. 06

    能不能逐条看到原始回答?

    为什么要问

    汇总数字是对原始回答的归纳,归纳可能出错:品牌名合并错了、解析漏了、回答被截断了。能看到原文,才能自己判断这个数站不站得住。

    ask10ais 的做法

    公开榜单和证书的每一条原始返回都能在核验页查看,不用登录。监测报告里的每个数字都附当期的模型原始回答。

    核验一份记录 →

  7. 07

    问题集由谁定?跑之前冻结了吗?

    为什么要问

    问法稍微一改,名单就可能不同。如果看到结果之后还能调问题,就能挑出想要的数字;开跑前冻结并留下版本,前后两期才是同一把尺子。

    ask10ais 的做法

    客户项目的问题与场景由客户定,开跑前冻结,存档可核验。公开榜单的问题由我们撰写,原文公开在每个榜单页和核验页,不针对单个模型改措辞。

    题目从哪来 → 方法论

  8. 08

    用哪些模型?为什么是这些?品牌方能不能删改模型或权重?

    为什么要问

    选哪些模型、每个模型占多大权重,直接决定结果。如果付费方能去掉对自己不利的模型、调高对自己有利的权重,报告就只剩付费方想看的那部分。

    ask10ais 的做法

    面板固定为 7 个头部席位加 5 个长尾席位,入选规则和权重来源公开在方法论页,按实际在跑的配置现查。品牌方可以定问题和场景,不能删改模型或权重;这类请求记进拒绝记录。

    模型面板与权重 → 方法论

  9. 09

    测量方是否同时向你出售提升服务,或者从服务商那里拿钱?

    为什么要问

    负责把数字做上去的一方,同时负责报告数字是多少,利益就冲突了。按效果收费、收推荐费也是一样:测量结果直接影响测量方的收入。

    ask10ais 的做法

    只测量,不提供内容投放或任何以提升模型推荐为目的的服务。价格固定,不按效果收费;不向任何服务商支付或收取推荐费;报告不做白标。

    收入从哪来 → 独立性与复核

  10. 10

    要测多种语言时:每种语言的问题是独立撰写的,还是翻译的?

    为什么要问

    直译过来的问题,常常不是当地买家真会说的话,测到的是翻译腔下的回答。几种语言的结果合成一个数,其中一种语言里的变化就会被别的语言盖住。

    ask10ais 的做法

    监测项目每种语言的问法独立撰写,不做翻译;各语言分开计算,不合成一个数。样例报告里中英问法原文并列。

    中英问法原文 → 样例报告

答案不必和我们一样。要紧的是每一题都有明确、可以核对的回答。

我们把能查的地方串在一页 → 独立性与复核