我们怎么测,以及这个数字什么时候不该被相信

最后修订 2026-09-11 · 适用于 2026-08-22 起的全部榜单

这一页按 IAB《Measuring Visibility in the AI Era》(2026 年 8 月)对测量方的披露要求来写:模型面板与版本、题库怎么构建、采集架构,三项逐一交代。第一节先说这套测量最要紧的一条设定——同一道题用中文和英文各问一遍,发给同一批模型、同一天跑完,两份榜单并排。它不推销任何东西,只回答一个问题——你凭什么相信我们给出的分数。最后两节是我们自己列的局限和明确不做的事,请一并读完。

只问记忆:不挂搜索工具,测的是训练语料里的品牌心智

提问时不给模型挂任何搜索工具。模型只能凭训练时记住的东西回答,所以这两份名单量的都是「在这个模型被训练出来的那一刻,这个品牌在它脑子里占多大位置」,不是它现在能搜到什么。

这跟「AI 现在搜到了什么」是两个不同的指标。后者随网络内容天天变,也确实能靠投放和内容分发影响;前者在两次模型发版之间基本不动。

这条选择带来一个直接后果:我们的分数不会因为谁这周发了几篇稿子而改变——这正是我们不接受付费改分的技术前提,而不只是一句承诺。

反过来说,它也意味着我们的数据天然滞后于现实。一个上个月才成立的品牌,在任何模型的语料里都不会有位置,这不是它不行,是这个指标测不到它。

同一句问题,我们用中文发一次、用英文再发一次,收题的是同一批模型,两次跑在同一天。首页上每周重测的那六张卡,就是三道题的中英两份。

两份名单不一样,这是可以自己翻出来对的:2026-09-02 那次「最受欢迎的AI眼镜品牌」,中文那份把 XREAL 排在 Rokid 之前,同一天同一批模型、英文那份反了过来;Oakley、Amazon、Google 出现在英文那份的前十里,中文那份的前十里没有它们。

对做出海的团队,这两份并排就是「模型用你的母语记你,和用买家的语言记你,差在哪」;对英文读者,它是同一道题、两种语言、同一批模型、同一天。

模型面板与版本

下表是最近一次评估实际使用的面板,读自当次的面板快照。换模型不需要改这一页,这一页会自己跟着变。

本页的面板与统计数字现查自数据库,不是手写的名单。当前展示的是第 139 次评估(2026/09/13)的面板快照。

  • openai/gpt-5.6-luna17.15%
    头部 · quarterly_research:2026Q3
  • tencent/hy4-preview12.22%
    长尾 · openrouter_usage_share
  • xiaomi/mimo-v2.510.94%
    长尾 · openrouter_usage_share
  • z-ai/glm-5.3-flash10.69%
    长尾 · openrouter_usage_share
  • tencent/hy39.50%
    长尾 · openrouter_usage_share
  • qwen/qwen3.8-max8.61%
    头部 · quarterly_research:2026Q3
  • google/gemini-3.7-flash6.94%
    头部 · quarterly_research:2026Q3
  • nvidia/nemotron-3-ultra-550b-a55b:free6.65%
    长尾 · openrouter_usage_share
  • deepseek/deepseek-v4-flash6.41%
    头部 · quarterly_research:2026Q3
  • x-ai/grok-4.65.88%
    头部 · quarterly_research:2026Q3
  • anthropic/claude-sonnet-53.43%
    头部 · quarterly_research:2026Q3
  • moonshotai/kimi-k31.57%
    头部 · quarterly_research:2026Q3

面板固定为 7 个头部席位 + 5 个长尾席位。头部席位每季度人工复核一次,每家厂商各占一席,取当季正式发布的旗舰型号,不用 preview 或实验版本。

头部权重按各家公开月活估算,再做开方压缩。不做压缩的话,线性份额下最大的一家会吃掉约 58% 的头部权重、最大与最小相差约 119 倍,多模型聚合就名存实亡;开方之后差距压到约 11 倍,保留「用得多的权重大」这个次序,但不让任何一家单独决定结果。

长尾席位按 OpenRouter 公开用量榜当次选出,权重按用量份额分配——所以长尾成员会随时间变化。这意味着面板本身在漂移,跨期比较分数时必须把这一点算进去。

权重按季度刷新。跨过季度而当季研究还没做时,系统会退回等权重占位,这种情况下面表的「权重来源」一列会如实显示出来。

题目从哪来,原文在哪看

每个模型收到的固定后缀

请列出你认为最符合的前 10 个品牌,按受欢迎程度从高到低排序。只输出品牌名称本身,不要加编号或解释。

每个榜单对应一个问题,问题原文由我们撰写,不改写、不针对单个模型调整措辞——面板里每个模型收到的是完全相同的一句话。

问题原文公开:每个榜单页和每一张证书的核验页上都能看到当次评估问的原话,不需要登录。

题库有两个来源:平台自选的公开榜单题目,以及品牌方在诊断产品里自己提交的细分市场问题。后者会被标记来源、不进首页公开榜单,但同样永久留痕、同样可核验。

每个模型只被要求给出前 10 个品牌。这是个硬约束:第 11 名及以后的信息我们从一开始就没拿到,所以「差一点没进前十」和「完全没想到」在数据里长得一模一样。

采集架构

所有调用统一经 OpenRouter 发出,同一次评估里 12 个模型并发提问,互相看不到对方的答案。

支持结构化输出的模型走 JSON Schema 强约束;不支持的走文本返回再解析,两者在核验页上分别标注,你能看出这一条是哪种。

每个模型每次评估只被问一次。这是当前最重要的一条采集限制,后面「数据等级」一节会正面说明它的后果。

每次调用的原始返回全量入库,只追加、不改写。证书发出时另存一份评分快照并锁死,此后即使我们重算历史,已发出证书上的数字也不会变。

跨模型的品牌名归一化(把「特斯拉」「Tesla」「Tesla Inc.」合成一个)由一个模型统一完成,归一化失败时降级为不合并——这时同一品牌会被拆成多条、分数被稀释,是已知的降级行为。

分数怎么算出来的

每个模型给出的名次先换成位置分:第 1 名得 10 分,第 2 名得 9 分,以此类推,第 10 名得 1 分,没提到得 0 分。位置分乘以该模型的权重,得到这个模型对该品牌的贡献。

把所有提到过这个品牌的模型的贡献加总,再除以「全部模型都把它排第一」的理论最大值,乘 100,就是 0–100 的指数分。

所以指数分的字面含义是:这个品牌拿到了「全场一致公认第一」这个满分的百分之几。

同一个模型在自己的名单里重复提到同一个品牌只计一次,取最靠前那次——防止一次格式错乱的返回靠重复刷分。

位置分 = 10 − 名次 + 1
贡献 = 位置分 × 模型权重
指数分 = 100 × Σ贡献 ÷ (10 × Σ本次有返回的模型权重)

跨语言归一化:把「特斯拉」「Tesla」「Tesla Inc.」算成一个品牌

同一个品牌,模型 A 写「特斯拉」,模型 B 写「Tesla」,模型 C 写「Tesla Inc.」。不合并,它就会被当成三个品牌各拿一点分,谁都排不上去。

做法:把这一次评估里所有模型返回的品牌原始名去重后,按每批最多 30 个分批交给一个归一化模型(目前是 deepseek-v4-flash),要求归并成规范名。为了让同一个品牌在不同期之间连得成一条线,我们把历史评估里已经用过的全部规范名一并交给它,要求「如果这个新名字指的是词表里已有的品牌,必须复用那个名字」。

我们刻意不做「上次见过就直接抄上次答案」的捷径:曾经这么做过,结果一次漏判被永久固化。宁可每次都真的问一遍。

分批不是排版偏好:早先一次性提交时,名字最多的那几次评估整批归并失败过——25 次评估里有 4 次一对都没合,分数被摊薄,而且当时没有任何告警。现在每批独立失败,每次调用的原始返回和用量都存档,整次评估的归一化状态记成 ok / 降级 / 失败三档。

已知局限:某一批调用失败时,兜底仍然是「每个原始名映射到自己」,这一批里的名字这一期不会被合并,分数被稀释;这是有记录的降级行为,会在核验页标出。归一化模型换版会改变品牌分组,见「面板变更记录」一节。

同一家公司出现两行时,我们怎么合并

归一化失手的时候,同一家公司会在同一张榜上占两行甚至三行,分数被摊薄。2026-09 复盘 25 次评估,53 组名字属于这种情况,其中 7 次评估的公开榜单上真的同时印着两行。合并分三级,一级比一级慎重。

第一级,纯字面:两个写法在 Unicode 归一、去掉大小写和空格连字符之后完全相同,例如 Browser Use 和 Browser-use。这一级没有判断成分,规则是一个几十行的纯函数(src/ask10ais/brand_key.py),带用例,任何人都能自己重放,所以允许它自动生效。

第二级,只出候选:去掉公司后缀之后相同(Monex 与 Monex Securities),或者同一个原始名在不同期被归到过不同的规范名(マネックス証券 在一次评估里被归成 Monex,另一次自己成了一行)。这些线索来自我们自己的历史数据,可以顺着评估编号查证,但它们只进候选队列,不改分数。

第三级,人来定:候选逐条人工确认,写进一份 CSV 再入库,否决也留档。跨语言和子品牌的合并是业务判断不是数据判断——小米与米家、Binance 与 Binance Japan 算不算同一个品牌,脚本决定不了。判断可能是错的;错了会进更正日志。

合并只发生在展示这一层。被合并的那几行仍然原样躺在数据库里,它们当时的规范名一个字节都没改,所以证书编号、已经发出去的证书链接和徽章链接都不受影响。榜单行下面列出它的成员,就是为了让人看得到合并前是什么样。

面板完整度门槛:什么时候我们不发记录、不展示分数

面板完整度 = 本次真正返回了可用结果的模型权重和 ÷ 整个面板的权重和。两道门槛,按 25 次真实评估的分布定,不是拍脑袋:

  • 完整度 ≥ 80%:才会签发带编号的记录(证书)。
  • 完整度 ≥ 60%:才会在榜单页展示分数。
  • 低于 60%:照常入库、照常可核验,但只展示名次,不展示分数,并显著标注面板残缺。

透明度不随质量下降:低完整度的评估不是被藏起来,是被标出来。门槛会拦掉相当一部分评估——按上线前的历史数据,25 次里有 18 次够不到发证线。我们接受这个代价。

这份数据是什么等级

IAB 把 AI 可见度数据分成两档:方向级(directional,能看趋势、不足以定预算)和决策级(decision-grade,可以拿去分配预算)。IAB 不发认证,分级由买方自己对照标准判断——所以我们把自评摊开写在这里,而不是给自己盖章。按 IAB 的口径,我们目前在采样密度这一项上够不到决策级,请把这里的数字当方向级使用。

已经满足的
  • 平台覆盖与模型版本完整披露,且是现查的实际面板,不是宣传名单。
  • 题库构建方式公开,每道题的原文可查。
  • 采集架构公开:调用路径、是否挂搜索工具、结构化与否、留痕方式。
  • 可复现性:每一条汇总数字都能下钻到当次的模型原始返回全文。
还够不到的
  • 采样密度:每道题每个模型只问一次,拿不到置信区间。同一个问题连问两次,名次本来就可能不同——单次采样区分不了「真的变了」和「本来就有波动」。
  • 测试频次:目前不是固定周期自动重跑,而是按需触发。
  • 面板稳定性:长尾席位随第三方用量榜变动,跨期对比会受面板漂移影响。

已知局限

下面这些是我们自己查出来并主动写在这里的。任何一条都足以让某个具体场景下的数字变得不可信,请对号入座。

  1. 01

    指数分高低主要受候选品牌池大小影响,不能当作可信度

    我们用 27 次真实评估做过相关性分析:指数分与候选品牌池大小强负相关(约 −0.81),与模型答得连不连贯只是中等相关。也就是说,一个冷门细分市场因为总共没几个玩家,分数天然就高;而这跟模型有多确定完全是两回事。要横向比较,请比同一榜单里的名次,不要跨榜单比分数。

  2. 02

    有模型没答上来时,满分会变得更容易拿到

    面板不满编时,分母只算本次真正返回了可用结果的那些模型——没答上来的既不进分子也不进分母,所以一次故障不会拖累品牌的分数。代价在另一头:有效面板变小之后,「满分」的含义从「全部 12 个模型都把你排第一」变成「所有答了的模型都把你排第一」,证据基础更薄,数字却更好看。真实例子:有一次评估只有 6 个模型给出可用答案,它们一致把同一个品牌排第一,指数分就是 100.00。所以看分数时请连着看面板完整度。未计入有两类原因:接口层面根本没返回(账户余额、并发预算、模型已下线),或者模型其实答了、只是没按我们要求的格式返回被解析器丢掉——后者是我们自己的问题,不是模型的问题。两类都会在核验页上逐个标出来。

  3. 03

    只问前十,拿不到第十一名以后的信息

    「差一点没进前十」和「模型压根没想到」在我们的数据里都是 0 分,无法区分。要提高分辨率,得改问法并重新权衡成本,那会形成新的口径断点。

  4. 04

    位置衰减是线性的,没做过对照实验

    第 1 名到第 10 名按 10、9、8……线性递减,选它纯粹因为「占满分百分之几」这句话最好解释,没有跟倒数衰减或指数衰减做过效果对比。

  5. 05

    自反污染:我们的结论可能回流进模型语料

    如果一个品牌拿到证书后发稿宣传,这些稿件可能被后续模型的训练语料收录,从而抬高它下一次的分数——测量工具吃到了自己的输出。我们的应对是:徽章只做带日期的静态快照、文案写成观测记录而不是营销结论,并在趋势上标注发证时点,让这件事可被看见而不是被藏起来。

  6. 06

    模型换版会造成趋势断点

    厂商静默更新权重时,分数会跳变,而变的是模型不是品牌。跨期解读时请优先看同一次评估内部的相对名次。

按当前数据:49 次评估里出现过这种情况,被丢掉的面板权重中位数约 23.0%,最严重的一次约 60.5%。这两个数字现查自数据库,会随修复和重跑变化。

面板变更记录

换模型、改公式、换归一化器,都不算错,但都会在趋势上留下断点。每一条记在这里,标明影响哪些期的可比性。这张表读自数据库里的 panel_events,只追加。

日期变更原因影响的可比性
2026-09-02品牌归一化模型从 deepseek-v4-pro 换成 deepseek-v4-flash。归一化是把一批品牌别名整理成规范名的结构化任务,不是推理任务,flash 档够用;该调用每次评估花 $0.0085,比 anthropic+gemini+deepseek 三个席位加起来还贵,换完约省 20×。归一化器变化可能改变品牌分组:同一批原始返回可能被归成不同数量的品牌,进而影响名次与分数。此日期前后的品牌数与分数不保证可直接比较。
2026-09-02deepseek 席位从 deepseek-v4-pro 换成 deepseek-v4-flash。输出单价 $2.085/M → $0.1772/M(11.8×)。
2026-09-02anthropic 席位从 claude-opus-5 换成 claude-sonnet-5。与 openai 那次同向:免费/Pro 档 Claude 用户默认拿到的是 sonnet 档,opus 属付费高阶档。输出单价 $25/M → $10/M。
2026-09-02此日期起,榜单按品牌实体聚合:同一家公司的多种写法(跨语言、公司后缀、大小写)在页面上合并成一行、指数求和;此前按每次评估各自的规范名分行展示。两侧的品牌行数与名次不可直接比较。数据库里的原始行、以及已经发出的证书编号与快照,一行未改——合并只发生在展示这一层。
2026-09-01openai 席位从 gpt-5.5-pro 换成 gpt-5.6-luna。理由:pro 档一次问询实测约 $0.97,占单次评估成本 90%+;而 ChatGPT 免费/Go 档用户默认拿到的就是 gpt-5.6-luna,测它更贴合「普通用户不花钱能问到的答案」这个口径。补录:此事发生于 2026-09-01,当时漏记,2026-09-02 补上。
2026-09-01用新增的纯文本兜底解析器重新推导了 16 条历史返回的品牌列表(原始返回未改动),这些模型由「失败」变为「有效」,相关评估的面板完整度上升。
2026-09-01打分分母从「整个面板的权重和」改为「实际返回了可用结果的模型权重和」。同一次评估内所有品牌等比例缩放,名次不变;此日期前后的绝对分数不可直接比较。

下一次已知的断点:2026-10-01。头部席位的季度权重按季查表,若届时未录入 2026 Q4 权重,七个头部席位会退回等权重,权重来源一栏会如实标为「等权重回退」而不是当季研究值。

我们不做什么

这一节和上面的局限同等重要——差异化不在于我们能做什么,而在于我们放弃了什么。

  • 不提供优化服务,不承诺提升任何品牌被模型提到的概率。
  • 不接受付费改分、付费上榜、付费删榜。请求会脱敏后记进拒绝记录。
  • 不做实时监测。每一份记录都是一次带日期的测量,发布后不再变动。
  • 不给模型挂搜索工具,不做提示词工程去「引导」出更好看的答案。
  • 不发认证、不评奖、不排「最佳」。我们只记录模型说了什么。

怎么独立复核

每张证书都有编号,拿编号在核验页上可以看到:这次评估问的原话、面板里每个模型各自给了第几名、各自的权重和贡献分、以及每个模型返回的原文——不需要登录,不需要付费。

评分明细来自发证时锁死的快照;原始返回读自只追加、从不改写的问答留痕表。两者是同一次调用的两种记录,页面上分别标注。

如果你发现任何一条对不上,请直接来信告诉我们——把错误留在这里,比把它藏起来对我们更不利。

到今天为止的数

累计题目
58
已完成评估
64
模型调用
775
出现过的模型
19
未计入的调用
16.3%

「未计入的调用」这个口径同时包含两种情况:接口层面没返回,以及模型答了但没按 JSON 格式返回、被我们的解析器丢掉。两者在库里记成同一种状态,后果也一样,所以合并披露。

我们的补救

这是方法论上的断点,不是可以忽略的噪声,所以我们把它标出来而不是抹平:发现某次评估存在未计入的调用时,我们会重跑这道题,并为已经购买该次证书的客户重新生成证书。这是写在这一页上的政策承诺,每一次执行都会记进更正日志,可以核对。

本记录测量的是大语言模型在某一时刻对某一问题的输出,不是对产品质量、市场份额或企业资质的评价。模型输出可能包含错误或虚构信息;本记录如实保存模型的原始返回,不代表我们认可其内容。本记录不构成投资建议或采购建议。