供应商与货源层级
最近更新:2026年9月15日
同一个模型为什么有多家报价,货源层级如何划分,以及模型详情页上各项指标的口径。
模型是能力单位,供应商是提供该能力的实体。同一个模型往往由多家供应商提供,价格、上下文长度、支持的协议与输出精度可能各不相同。模型目录按模型列出全部供应商的报价,供应商页则按供应商列出其提供的全部模型。
为什么同一个模型有多家报价
模型的权重由厂商发布,但对外提供推理服务的可以是厂商自己,也可以是云厂商、聚合平台或第三方推理服务商。它们运行的是同一个模型,但在以下方面存在差异:
- 价格,各家的成本结构与商业策略不同
- 上下文长度,部分供应商提供的上限低于模型标称值
- 输出精度,部分供应商提供量化版本以降低成本
- 支持的协议,并非每家都提供全部四种文本协议
- 可用性与性能,首字延迟、吐字速率与成功率长期存在差异
Amux 把这些差异逐条列出,并按命中的那家供应商的价格计费,不做统一加价。
货源层级
每一条「模型 × 供应商」的报价都带一个货源层级标记:
| 层级 | 含义 |
|---|---|
| 官方 | 模型厂商自己提供的服务 |
| 聚合商 | 云厂商或聚合平台提供的服务,通常与官方同等精度 |
| 低价 | 以降低成本为目标的货源,可能使用量化版本或存在其他形式的降级 |
官方与聚合商在路由中完全等价,二者仅作为来源标识展示。真正参与路由过滤的是低价层:它与前两者被划入不同的候选池,不会混在一起参与同一次排序。
在账户设置或密钥设置中可以限定货源范围:
| 范围 | 候选池 |
|---|---|
| 全部货源(默认) | 官方、聚合商、低价层均参与路由 |
| 仅官方质量层 | 排除低价层 |
| 仅低价层 | 只保留低价层 |
选择「仅低价层」后,没有低价供应商的模型会直接返回错误,而不会回落到更高价的供应商。范围的合并规则与优先级见路由与故障转移。
量化与精度
低价货源常以量化方式部署。量化会实际影响输出质量,因此模型详情页会明确标注精度:未标注即为满血精度,标注了 FP8、INT8、INT4、AWQ、GPTQ 之一则为对应的量化版本。
对输出质量有硬性要求时,应将货源范围设为「仅官方质量层」,或在密钥上指定供应商。
模型详情页上的字段
价格
价格按分项列出,具体项取决于模型类型(对话、图像、视频等),常见项包括输入、输出、缓存读取、缓存写入与推理 token。计费项的完整含义见计费概览。
标注为基准价的项表示该供应商沿用模型的基准定价,标注为供应商定价的项表示该供应商有自己的价格。部分供应商对同一项提供多个档位,此时显示为区间,具体分档在详情页展开查看。
部分模型的价格随时段变化,或处于促销期内,此类报价会带有相应标识。
表现指标
| 指标 | 口径 |
|---|---|
| 延迟 | 流式请求的平均首字延迟(TTFT),即从发出请求到收到第一个 token 的时间 |
| 吞吐量 | 流式请求的平均吐字速率,单位为每秒 token 数(TPS) |
| 可用率 | Amux 网关实际发出的请求在该供应商上的成功率 |
三项指标均为按调用量加权的平均值,不是分位数,统计窗口可在 1 天、7 天、30 天之间切换。
可用率的分母不包含客户端错误:请求本身写错导致的失败不计入供应商的成功率。没有成功样本的时间段不参与计算,而不是按 0 计入。
上下文长度
按供应商单独标注。路由时会将请求的上下文估算值与候选供应商的上限比对,装不下的候选不会进入候选池。估算偏小时放行,因此极端接近上限的请求仍可能在上游被拒绝。
模型状态
| 状态 | 含义 |
|---|---|
| 已上线 | 正常可调用 |
| 即将推出 | 已公布但尚未发布。目录中可见并带标识,不可调用,不展示价格 |
| 已弃用 | 仍可调用,但厂商已宣布下线计划 |
| 已下线 | 不再可调用 |
已弃用状态用于提前给出迁移信号,建议在该状态出现后即安排切换。
比较多个模型
模型对比可将多个「模型 × 供应商」并排列出,比较价格、上下文、表现指标、支持的端点与功能。同一个模型放入两列即可比较两家供应商的报价差异。