为什么现在问这个
2026 年,大模型厂商密集推出面向开发者的订阅套餐:Coding Plan、Token Plan、按月预购调用额度,随后是价格战。我们把「最受欢迎的大模型 API 套餐服务商」同时用中文和英文问了 12 个大模型。这是一次热点观测,不发证书,也没有购买入口。
题目和以往有一点不同:主干后面加了一句范围说明,「套餐指面向开发者、按月订阅或预购模型调用额度的计划,如 Coding Plan、Token Plan」。原因是「token」在英文里会被理解成加密货币,「套餐」在中文里可能被理解成消费者订阅。范围说明只定义对象,不点名任何厂商,并且原样印在榜单页上。结果是 23 条有效返回里没有一条漂到加密货币或消费者订阅,这句说明起到了作用。
测量结果
在 2026-09-03 的这次测量中,中文提问下面板 12 个模型有 11 个返回了可用内容,面板完整度 93.6%,缺席的是 DeepSeek 的席位,原因是接口调用失败,不是拒答。前十位依次是 OpenAI、Anthropic、DeepSeek、Google、阿里、OpenRouter、智谱、Mistral AI、百度、Gemini。
英文提问下 12 个模型全部作答,完整度 100%。前十位是 OpenAI、Anthropic、Google、Mistral AI、Cohere、DeepSeek、Microsoft、Groq、Amazon、Together AI。
三个观察
一、前两名两种语言完全一致,第三名开始分道
七个头部模型,无论用中文问还是英文问,每一个都把 OpenAI 放在自己答案的最前面;Anthropic 在 14 份头部答案里有 12 份排第二。这是这个品类里少见的强共识。
从第三名开始,两份榜单各说各的。中文榜第三到第五是 DeepSeek、Google、阿里;英文榜是 Google、Mistral AI、Cohere。两份前十只有 5 个名字重合。只在中文榜出现的是阿里、百度、智谱、OpenRouter;只在英文榜出现的是 Cohere、Groq、Microsoft、Amazon、Together AI。
二、同一个模型,换语言就换候选池
Grok 在中文提问下答的前五是 OpenAI、阿里、DeepSeek、百度、智谱,除了 OpenAI 全是中国厂商;在英文提问下答的是 OpenAI、Anthropic、Google、Groq、Together AI,一个中国厂商都没有。Qwen 自己在中文提问下也没有把阿里放进前五,它答的是 OpenAI、Anthropic、Google、OpenRouter、Microsoft Azure。
这个现象在 AI 眼镜那次测量里也出现过。模型不是在回答「哪家最受欢迎」,而是在回答「在这种语言的语料里,哪家被写得最多」。
三、英文榜把云平台和推理服务商也算了进来
英文提问下,Microsoft、Amazon、Groq、Together AI 进了前十,Gemini 在自己的答案里直接写了 Microsoft Azure、Google Cloud、Amazon Web Services。中文提问下这些名字几乎不出现,取而代之的是 OpenRouter 和国内的模型厂商。
这说明「API 套餐」这个词在两种语言的语料里指向的东西不完全一样:英文语境里它更接近「云上的模型服务」,中文语境里更接近「厂商直营的订阅计划」。范围说明消除了加密货币的歧义,但没有、也不应该替模型决定云平台算不算。
局限
- 面板完整度:中文提问 93.6%(11/12,DeepSeek 席位接口调用失败),英文提问 100%。
- 归一化缺口:中文榜上 Google 与 Gemini 被分成两个实体(第 4 与第 10),Microsoft、Microsoft Azure、Azure OpenAI 在不同模型的答案里也是不同写法。我们不做事后手工合并,如实展示。
- 头部模型一致性:中文 0.347、英文 0.352,都在我们定的 0.30 门槛之上,但第五名以后的排序不稳定。
- 我们在发布前的质量预检里把这次测量标为「有保留」,唯一不达标的一项是中文提问下有一个头部席位没有返回可用内容。
- 指数分不是可信度:它反映模型提到一家厂商的频率和位置,不反映套餐本身的性价比。
- 自反污染:这张榜一旦被引用,就可能进入下一轮模型的语料。
- 模型未联网,测的是记忆不是检索。