中转站Zhongzhuanzhan
载入中…
Status

测出来什么样,就贴什么样

下面每个数字都是我们真实调用测出来的,不是手填的。断了就标红,不拿旧数据糊弄。 测一次得花钱,这笔账也摆这儿——我们自己掏。

在线模型
平均可用率
采样窗口
24 小时探测花费
Live Board

逐模型明细

条形图是最近 60 次测试,左旧右新。绿=通,红=挂,灰=还没测。

模型 状态 最近 60 次 P50 P95 可用率 标识回显 指纹一致 单次探测
载入中…
Method

怎么测的

可用率与延迟

每天对每个在售模型发一次最小请求,走的是和你一样的公网入口 https://zhongzhuanzhan.net,不走内网捷径——所以这条链路上的任何一环出问题, 这里都会红。延迟是端到端总耗时,不是上游单独耗时。

响应标识

比对响应体里的 model 字段和请求的模型名。 这是最容易伪造的一项,只当最低门槛,通不过一定有问题,通过了不代表没问题。

指纹一致

固定提问 + temperature=0,对回复取 sha1,和历史比对, 展示的是近若干次里最常见指纹的占比。这是弱信号,不是判决—— 多数模型在 temp=0 下仍非完全确定性,所以我们给的是一致率而不是通过/失败。 某个模型的一致率突然塌下来,才值得怀疑上游换了东西。

单次测试成本

从本站计费日志的真实扣费拿的,不是估算。号池来源的模型会被上游塞几千 token 的隐藏系统提示,这一列会明显偏高——这不是我们多收,是那条线本来的成本结构。