Amux

供应商与货源层级

最近更新:2026年9月15日

同一个模型为什么有多家报价,货源层级如何划分,以及模型详情页上各项指标的口径。

模型是能力单位,供应商是提供该能力的实体。同一个模型往往由多家供应商提供,价格、上下文长度、支持的协议与输出精度可能各不相同。模型目录按模型列出全部供应商的报价,供应商页则按供应商列出其提供的全部模型。

为什么同一个模型有多家报价

模型的权重由厂商发布,但对外提供推理服务的可以是厂商自己,也可以是云厂商、聚合平台或第三方推理服务商。它们运行的是同一个模型,但在以下方面存在差异:

  • 价格,各家的成本结构与商业策略不同
  • 上下文长度,部分供应商提供的上限低于模型标称值
  • 输出精度,部分供应商提供量化版本以降低成本
  • 支持的协议,并非每家都提供全部四种文本协议
  • 可用性与性能,首字延迟、吐字速率与成功率长期存在差异

Amux 把这些差异逐条列出,并按命中的那家供应商的价格计费,不做统一加价。

货源层级

每一条「模型 × 供应商」的报价都带一个货源层级标记:

层级含义
官方模型厂商自己提供的服务
聚合商云厂商或聚合平台提供的服务,通常与官方同等精度
低价以降低成本为目标的货源,可能使用量化版本或存在其他形式的降级

官方与聚合商在路由中完全等价,二者仅作为来源标识展示。真正参与路由过滤的是低价层:它与前两者被划入不同的候选池,不会混在一起参与同一次排序。

在账户设置或密钥设置中可以限定货源范围

范围候选池
全部货源(默认)官方、聚合商、低价层均参与路由
仅官方质量层排除低价层
仅低价层只保留低价层

选择「仅低价层」后,没有低价供应商的模型会直接返回错误,而不会回落到更高价的供应商。范围的合并规则与优先级见路由与故障转移

量化与精度

低价货源常以量化方式部署。量化会实际影响输出质量,因此模型详情页会明确标注精度:未标注即为满血精度,标注了 FP8INT8INT4AWQGPTQ 之一则为对应的量化版本。

对输出质量有硬性要求时,应将货源范围设为「仅官方质量层」,或在密钥上指定供应商。

模型详情页上的字段

价格

价格按分项列出,具体项取决于模型类型(对话、图像、视频等),常见项包括输入、输出、缓存读取、缓存写入与推理 token。计费项的完整含义见计费概览

标注为基准价的项表示该供应商沿用模型的基准定价,标注为供应商定价的项表示该供应商有自己的价格。部分供应商对同一项提供多个档位,此时显示为区间,具体分档在详情页展开查看。

部分模型的价格随时段变化,或处于促销期内,此类报价会带有相应标识。

表现指标

指标口径
延迟流式请求的平均首字延迟(TTFT),即从发出请求到收到第一个 token 的时间
吞吐量流式请求的平均吐字速率,单位为每秒 token 数(TPS)
可用率Amux 网关实际发出的请求在该供应商上的成功率

三项指标均为按调用量加权的平均值,不是分位数,统计窗口可在 1 天、7 天、30 天之间切换。

可用率的分母不包含客户端错误:请求本身写错导致的失败不计入供应商的成功率。没有成功样本的时间段不参与计算,而不是按 0 计入。

上下文长度

按供应商单独标注。路由时会将请求的上下文估算值与候选供应商的上限比对,装不下的候选不会进入候选池。估算偏小时放行,因此极端接近上限的请求仍可能在上游被拒绝。

模型状态

状态含义
已上线正常可调用
即将推出已公布但尚未发布。目录中可见并带标识,不可调用,不展示价格
已弃用仍可调用,但厂商已宣布下线计划
已下线不再可调用

已弃用状态用于提前给出迁移信号,建议在该状态出现后即安排切换。

比较多个模型

模型对比可将多个「模型 × 供应商」并排列出,比较价格、上下文、表现指标、支持的端点与功能。同一个模型放入两列即可比较两家供应商的报价差异。

相关