LLM API 实测延迟数据集
这一页把探针的小时级测量按近 7 天与近 30 天两个窗口再聚合一次,给出每个端点的首 Token 延迟(TTFT)中位数与 p95、输出速度、失败率和样本量。想看「此刻快不快」去 实时延迟榜;这一页回答的是「这一周、这一个月它稳不稳」。数据可自由引用,注明来源即可。
2026-09-02T13:56:38.084Z → 2026-09-09T13:56:38.084Z
| 模型 / 端点 | 端点类型 | TTFT p50 ↑ | TTFT p95 典型小时 / 最差小时 | 输出速度 | 失败率 | 样本 |
|---|---|---|---|---|---|---|
DeepSeek V4 Pro deepseek-v4-pro@official-deepseek | 官方直连 | 145毫秒 | 163 / 1001 | 34.3token/秒 | 31.3% | 1144 (786 成功) 115/168 小时 覆盖 |
DeepSeek V4 Flash deepseek-v4-flash@official-deepseek | 官方直连 | 146毫秒 | 159 / 5212 | 75.2token/秒 | 31.4% | 1164 (799 成功) 117/168 小时 覆盖 |
Qwen3.5 Flash qwen3-5-flash@official-aliyun | 官方直连 | 373毫秒 | 462 / 3351 | 56.7token/秒 | 0.1% | 1136 (1135 成功) 166/168 小时 覆盖 |
Qwen3 Max qwen3-max@official-aliyun | 官方直连 | 511毫秒 | 804 / 3449 | 35.3token/秒 | 0.0% | 1142 (1142 成功) 167/168 小时 覆盖 |
GLM-5.2 glm-5-2@openrouter | 中转 | 630毫秒 | 1273 / 12126 | 48.1token/秒 | 0.0% | 1009 (1009 成功) 165/168 小时 覆盖 |
GLM-5.2 glm-5-2@official-zhipu | 官方直连 | 634毫秒 | 1162 / 46299 | 41.7token/秒 | 0.0% | 1010 (1010 成功) 165/168 小时 覆盖 |
Kimi K2.6 kimi-k2-6@official-moonshot | 官方直连 | 688毫秒 | 753 / 6029 | 37.0token/秒 | 0.1% | 1021 (1020 成功) 167/168 小时 覆盖 |
Qwen3.7 Max qwen3-7-max@official-aliyun | 官方直连 | 720毫秒 | 934 / 2126 | 38.1token/秒 | 0.0% | 1013 (1013 成功) 166/168 小时 覆盖 |
Qwen3.7 Max qwen3-7-max@openrouter | 中转 | 863毫秒 | 1073 / 2786 | 34.4token/秒 | 0.2% | 1021 (1019 成功) 167/168 小时 覆盖 |
GLM-4.7 glm-4-7@official-zhipu | 官方直连 | 1148毫秒 | 1812 / 45540 | 34.1token/秒 | 1.0% | 1137 (1126 成功) 166/168 小时 覆盖 |
DeepSeek V4 Pro deepseek-v4-pro@openrouter | 中转 | 1226毫秒 | 1511 / 9236 | 30.1token/秒 | 0.0% | 1150 (1150 成功) 168/168 小时 覆盖 |
Kimi K3 kimi-k3@openrouter | 中转 | 1278毫秒 | 1278 / 11297 | 25.6token/秒 | 0.5% | 191 (190 成功) 162/168 小时 覆盖 |
Kimi K3 kimi-k3@official-moonshot | 官方直连 | 2086毫秒 | 2086 / 12451 | 22.1token/秒 | 0.5% | 193 (192 成功) 163/168 小时 覆盖 |
Claude Sonnet 5无有效样本 claude-sonnet-5@openrouter | 中转 | — | — | — | 100.0% | 376 (0 成功) 0/168 小时 覆盖 |
Gemini 2.5 Flash无有效样本 gemini-2-5-flash@openrouter | 中转 | — | — | — | 100.0% | 369 (0 成功) 0/168 小时 覆盖 |
这些数字是怎么来的
探针在哪
🇭🇰 HK(中国香港)、🇺🇸 US-Central(美国芝加哥)。两个节点分开列,不做平均。 同一个端点在两地差出几倍是常事,平均出来的那个数谁都用不上。香港节点测的是国际/跨境链路,不等同于中国内地直连;美国节点调国产模型含跨太平洋链路。内地节点还没有,有了会单独标注。
多久测一次
TTFT 探测默认每 10 分钟一轮,输出速度探测默认每小时一轮。个别端点为省供应商配额放宽到 30 或 60 分钟一轮(Kimi K3、Claude Sonnet 5、Gemini 2.5 Flash 目前属此列),所以各行每小时的样本数 差得很远——别默认所有行都测得一样密,判断一个数字可不可信先看它那行的样本量。 结果每小时聚合成一行(每端点×每节点),这一页读的就是这些小时行。本站另有一条 跑标准任务、且刻意不关思考的成本探测线,口径不同,不进这份数据集。
思考模式一律关闭
所有请求都显式关掉了思考模式。思考型模型的思维链 token 会计进 completion_tokens 且不受 max_tokens 约束(实测某模型请求 256 实际生成 896),不关掉就等于拿「思考速度」 和「出答案速度」放在一起比。代价是这份数据覆盖不了强制思考的模型:Gemini 3.x 全系拒绝关闭思考,所以这里用的是 Gemini 2.5 Flash。越新的旗舰越倾向强制思考, 这个可比范围只会收窄。
窗口 p50 / p95 是二次聚合的近似值
逐次请求的原始记录只留 14 天,且不对外开放读取,所以窗口级分位数不是对窗口内每一次请求 重算出来的。口径如下,写清楚是为了让你知道该怎么用它:
ttft_p50_ms= 窗口内各小时 p50 的成功样本加权中位数。ttft_p95_typical_ms= 各小时 p95 的成功样本加权中位数,读作「一个典型小时的尾延迟」。ttft_p95_worst_ms= 窗口内最差那一小时的 p95,尾延迟的上界。- 真正的窗口 p95 落在这两个数之间。要精确值,得读原始逐次记录,那份数据不公开。
- 每小时只测到一两次的端点,它的「典型小时 p95」会退化成那一次测量本身,看起来会和 p50 一样甚至相等——这不代表它尾延迟平稳,只代表那一小时没有第二个样本 可比。用「样本」列的成功数除以覆盖小时数就能看出每小时有几次。
tps_avg= 各小时平均输出速度的成功样本加权平均。error_rate是精确值:窗口内失败请求数除以总请求数,不受上面的近似影响。
为什么要看 p95 而不是只看 p50
p50 是一半请求比它快、一半比它慢的那条线,它告诉你「顺手的时候什么感觉」。p95 是每 20 次请求里最慢的那一次,它决定用户什么时候开始觉得卡、你的超时该设多少、 重试逻辑会不会被触发。打个比方:两个端点 p50 都是 500 毫秒、一个 p95 是 800 毫秒另一个是 6 秒,对做实时对话的人来说是两个完全不同的东西。这一页把典型小时和最差小时的 p95 都列出来,就是因为「平时还行、偶尔抽风」是最常见的那种坏。
样本少的行怎么标
有效小时数不足窗口的 50%,或成功样本少于 100 次的,标「样本偏少」——数字照给,但它的波动会比别的行大。 窗口内每一小时都请求失败的,标「无有效样本」,延迟列留空不填 0。失败的小时不会从失败率的分母里摘掉:把调不通的时段扣掉,一个半数时间打不通的端点看起来会和一个稳定端点一样快。
这份数据的局限
两个节点的测量代表不了全球体验,也代表不了你自己机房到端点的链路。探针用的是固定的短提示词, 不等同于长上下文、高并发或带工具调用的真实负载。延迟只是选型的一个维度, 这一页不排「哪家最好」。要判断某个数字可不可信,先看它那行的样本量和覆盖小时数。
引用与下载
数据采用 CC BY 4.0 许可,可自由用于文章、报告与研究,请注明来源并保留指向本页的链接。 两个端点的内容一致,随页面一起每小时更新。
curl https://www.llmabacus.com/api/latency
curl https://www.llmabacus.com/api/latency/csv建议的引用格式: