Z.AI: GLM 5.3 FlashX 是 GLM-5.3-Flash 的更快、更流畅版本,推理速度高达 200 tokens/s。Z.AI: GLM 5.3 FlashX 是 Z.ai 旗下的原生多模态模型,适用于高效编程和长程代理任务。其混合稀疏与线性注意力架构在降低计算开销的同时,保持了精准的长上下文表现。
- 厂商:
- Z.ai
- 输入类型:
- 输出类型:
- 上下文长度:
- 1M
- 最大输出:
- 128K
- 发布时间:
- 2026-09-18
toolsreasoningstructuredOutputstreamingvisioncaching
供应商
同一个模型,不同供应商。自动路由会在同一质量层级内挑选价格最优且健康的那个。
| 供应商 | |||||||
|---|---|---|---|---|---|---|---|
| 减 70%amux-special | 78.94% | $0.375$0.1125/百万 tokens | $1.25$0.375/百万 tokens | 读$0.075$0.0225/百万 tokens写— | 1M | 9.5s | 145.7 tps |
可用率
7 天Amux 网关实际发出的请求在各供应商上的成功率。分母不含客户端错误——请求写错了不算供应商的账。
吞吐量
7 天流式请求的平均吐字速率,单位为每秒 token 数(TPS)。
延迟
7 天流式请求的平均首字延迟(TTFT),也就是从发出请求到收到第一个 token 的时间。
活动
7 天该模型随时间变化的 token 用量与成本,按实际处理请求的供应商拆分。
相关模型
更多来自 Z.ai 的模型
Z.ai: GLM 5.3 Flash1M 上下文最低 $0.045 / 百万 tokens1 个供应商GLM-5.3-Flash 是 Z.ai 的原生多模式模型。它适合高效编码和长期代理任务。其混合稀疏和线性注意架构保持准确的长上下文行为,同时减少计算开销。