跳到主内容
算盘
评测2026-08-05 发布 · 约 3 分钟读完

同一个模型,三个榜三个名次,该信谁

选型时翻榜单,经常遇到这种事:同一个模型,这个榜第 4,那个榜第 7,再换一个直接掉出前十。

不是谁在造假。是这三个榜压根没在测同一件事。

测的任务不一样

arena.ai 走的是人类投票:让人盲选两个模型的输出,按胜负算分,还按 Frontend、Fullstack、HTML、React 这类场景分开排。它回答的是「人更爱看哪个的输出」。

llm-stats 和 artificialanalysis 走的是跑分:标准题库,看答对多少。它回答的是「谁答得更对」。

这两件事本来就不是一件事。一个模型可能答得准但话啰嗦,投票榜上吃亏、跑分榜上占优。名次对不上是必然,不是bug。

调的端点不一样,而且快慢方向会翻转

同一个模型,从官方直连和从中转商调,是两条不同的链路。本站双节点探针实测(2026-08-05,单小时聚合、样本量不大,数字看趋势别抠精度):

GLM-5.2 从美国芝加哥节点测:官方直连首 Token 延迟 2676ms,经 OpenRouter 中转 362ms,中转快七倍多。同一时刻从香港节点测:官方 1675ms,中转 4953ms,反过来官方快三倍。

同一个模型、同一个时刻,「官方快还是中转快」在两个测点得出的是相反答案。所以一份不标注测点和端点的延迟排名,不管排得多好看,都没法直接拿来用。

DeepSeek V4 Pro 是另一种情况:两个节点都是官方更快(美国 342ms vs 中转 2024ms,香港 182ms vs 1342ms)。方向一致,但差距倍数完全不同。

国产模型在海外榜上,测的不是你会调的那个端点

2026-08-05 实地核查:artificialanalysis 和 llm-stats 都大量收录国产模型(Qwen、DeepSeek、GLM、Kimi 都在),但两站全文没有出现 api.deepseek.com、开放平台、dashscope 这类国内官方端点,也没有任何人民币计价。

也就是说,它们测的是这些模型的海外托管版本。对国内团队而言,那条链路的延迟、限速、计费币种、能不能开票,和你真正会调的官方端点都不是一回事。

我们自己也有一处要交代

本站性价比散点图的纵轴用的就是 Artificial Analysis 的 Intelligence Index,而且它只覆盖站内 55 个模型里的 21 个,其余模型不在图上。

只挑别人的毛病、不说自己的依赖,那叫双标。我们没有能力做能力评测,所以这一轴是借的,借了就得说。

看榜之前先问三件事

测的是什么任务?人类投票和标准题库不能互相印证。

调的是哪个端点?不标端点的延迟数字没有可比性,方向都可能是反的。

数字是厂商自报还是第三方实测?这两者混在一张表里的时候最危险。

我们只做自己能实测的部分:价格、延迟、跑同一个任务的实际花费。做不了的部分就不做,也不猜。

常见问题

那到底该信哪个榜?

看你要解决什么问题。挑写作和交互体验,参考投票类榜单;挑做题和推理能力,参考跑分类榜单;算钱和延迟,用标注了测点与端点的实测数据。没有一个榜能同时回答这三件事。

为什么同一个模型走中转反而更快?

中转商在多地有节点并做路由,你的请求可能落在离你更近的承载方上;而官方端点的机房位置是固定的。所以快慢取决于你从哪儿调,不是模型本身的属性。

海外榜单的国产模型数据能用吗?

能用来横向比模型能力,不能用来估你的实际延迟和费用。它们测的是海外托管版、按美元计价,与国内官方端点是两套东西。

文中价格与价格表同源、每日核对。选型前去看一眼最新价。

打开价格表 →