为什么现在问这个
2026 年春天以来,几家头部模型厂商陆续推出了自家的编码代理,能同时跑多个会话、自动协调任务的编排工具也出现了,这个品类几乎每个月都在换代。我们把「最受欢迎的AI编程智能体」这个问题用中文和英文各问了一遍,面板是 12 个大模型(7 个头部席位加 5 个长尾席位),看它们的记忆里这个品类现在是谁的。
这是一次热点观测。它回答的是「模型现在怎么记这个品类」,不回答「哪个工具更好用」。
测量结果
在 2026-09-22 的这次测量中,中文提问下 12 个模型全部作答,面板完整度 100%,归一化健康度为 ok。前十位依次是 GitHub Copilot(指数 100)、Cursor(90.0)、Claude(71.4)、Windsurf(Devin Desktop)(63.1)、ChatGPT(42.92)、Replit(36.97)、Amazon Q Developer(33.96)、Tabnine(28.21)、Gemini(27.64)、Devin(25.94)。
同一天的英文提问完整度 92.7%(一个长尾席位没有返回可用内容),前十位是 GitHub Copilot(100)、Cursor(90.0)、Windsurf(Devin Desktop)(74.86)、Claude(49.29)、Replit(41.18)、Amazon Q Developer(37.98)、Devin(35.64)、Tabnine(34.39)、Cline(18.21)、Codex(15.54)。
三个观察
一、中英两问的前十名有八个重合,不重合的四个各有来历
两边前十名的重合度(Jaccard)是 0.667:GitHub Copilot、Cursor、Claude、Windsurf(Devin Desktop)、Replit、Amazon Q Developer、Tabnine、Devin 这八个名字两边都有。只在中文榜出现的是 ChatGPT 和 Gemini;只在英文榜出现的是 Cline 和 Codex。
这两组差异的性质不一样。ChatGPT 和 Gemini 是聊天产品和模型的名字,中文提问下模型更倾向把「我用它写代码」的通用助手也算进「编程智能体」。Cline 和 Codex 则是开发者工具的名字:英文提问下 7 个头部模型里只有 Claude Sonnet 与 GPT 两个把 Cline 放进前五;Codex 进了 Kimi 的英文前五和 Qwen 的中文前五,但两侧都没进 GPT 自己的前五。可以说,英文提问的候选池更偏「工具」,中文提问的候选池更偏「品牌」。
二、Claude 与 ChatGPT 排在第三、第五位,但它们是模型名,不是编程工具
Claude 在中文榜第三位(71.4),ChatGPT 第五位(42.92),Gemini 第九位(27.64)。这三个都是模型或聊天产品的名字,不是某个具体的编码代理产品。问题明明问的是「AI 编程智能体」,7 个头部模型却全部把 Claude 放进了自己的前五,Claude Sonnet、Gemini、Grok 三个模型还把 ChatGPT 放进了前五,GPT 与 Grok 把 Gemini 放进了前五。
我们把这读成「工具与模型的边界在模型自己的记忆里是模糊的」:厂商的编码代理往往和模型同名或共用前缀,模型回答时会直接用它最熟悉的那个名字。这次测量没有事后把「Claude」改写成某个具体产品,也没有把它从榜上删掉,榜单展示的是归一化流程的真实输出。读者引用第三、第五位时,请带上「这是模型名」这句说明。
三、一款产品的新旧两个名字在这张表上算一行,第二位之后各说各的
中文榜第四位显示为 Windsurf(Devin Desktop),指数 63.1;英文榜里同一个条目排在第三位,74.86。这一行来自品牌实体表:Windsurf 与它更早使用的名字 Codeium 在实体表里指向同一个实体,聚合时算同一行,显示名把两个名字都带上,读者一眼能看出自己在看什么。实体层看,英文提问下 7 个头部模型里有 6 个把这个条目放进前五(只有 Qwen 没有),中文提问下是 4 个。
落差方面:中文榜从第一位的 100 到第十位的 25.94,7 个头部模型两两之间前五名的平均重合度是 0.558,英文一侧是 0.480,都高于我们给热点观测设定的 0.30 门槛。但拆开看,7 个模型的前两位清一色是 GitHub Copilot 和 Cursor,从第三位开始就各说各的:Qwen 给了 Codex 和 Replit,Grok 给了 ChatGPT 和 Gemini,Claude Sonnet 给了 ChatGPT 和 Tabnine,DeepSeek 与 Kimi 给了 Windsurf(Devin Desktop) 和 Devin。分歧不在语言,在前两位之后。
局限
本次测量的面板完整度为 100%(中文提问)与 92.7%(英文提问),7 个头部模型 + 5 个长尾模型参与打分,权重来源见方法论页。归一化健康度为 ok。需要提醒的是,本站的评估模型面板本身也包含大语言模型,而这类模型的训练语料可能包含其他 AI 榜单或测评的历史结果,存在「自反污染」的可能,即模型对某个品牌的印象部分来自它曾经被别的榜单提及,而不完全是独立判断。这是当前方法论的已知局限,不是这次测量特有的问题。
- 模型名与工具名混在一张榜上:Claude、ChatGPT、Gemini 是模型或聊天产品的名字,我们没有事后改写,读者引用时请自行说明。
- 品牌归一化:Windsurf 与它更早使用的名字 Codeium 在这次的表上是同一个实体、同一行分数;这类新旧名的对应关系由实体表统一维护,不是逐篇处理的,实体表更新后同一次 run 的表也会跟着变。
- 指数分不是可信度:它只反映模型提到一个名字的频率和位置,不反映工具好坏。