Status
测出来什么样,就贴什么样
下面每个数字都是我们真实调用测出来的,不是手填的。断了就标红,不拿旧数据糊弄。 测一次得花钱,这笔账也摆这儿——我们自己掏。
在线模型
—
平均可用率
—
采样窗口
—
24 小时探测花费
—
Live Board
逐模型明细
条形图是最近 60 次测试,左旧右新。绿=通,红=挂,灰=还没测。
| 模型 | 状态 | 最近 60 次 | P50 | P95 | 可用率 | 标识回显 | 指纹一致 | 单次探测 |
|---|---|---|---|---|---|---|---|---|
| 载入中… | ||||||||
Method
怎么测的
可用率与延迟
每天对每个在售模型发一次最小请求,走的是和你一样的公网入口
https://zhongzhuanzhan.net,不走内网捷径——所以这条链路上的任何一环出问题,
这里都会红。延迟是端到端总耗时,不是上游单独耗时。
响应标识
比对响应体里的 model 字段和请求的模型名。
这是最容易伪造的一项,只当最低门槛,通不过一定有问题,通过了不代表没问题。
指纹一致
固定提问 + temperature=0,对回复取 sha1,和历史比对,
展示的是近若干次里最常见指纹的占比。这是弱信号,不是判决——
多数模型在 temp=0 下仍非完全确定性,所以我们给的是一致率而不是通过/失败。
某个模型的一致率突然塌下来,才值得怀疑上游换了东西。
单次测试成本
从本站计费日志的真实扣费拿的,不是估算。号池来源的模型会被上游塞几千 token 的隐藏系统提示,这一列会明显偏高——这不是我们多收,是那条线本来的成本结构。