DeepSeek V4 Pro是DeepSeek推出的大规模Mixture-of-Experts模型,总参数1.6T,激活参数49B,支持1M-token上下文窗口。它专为高级推理、编码和长期代理工作流程而设计,在知识、数学和软件工程基准方面具有强大的性能。
- 厂商:
- DeepSeek
- 输入类型:
- 输出类型:
- 上下文长度:
- 1M
- 最大输出:
- 393K
- 发布时间:
- 2026-08-12
toolsreasoningstructuredOutputstreamingcaching
供应商
同一个模型,不同供应商。自动路由会在同一质量层级内挑选价格最优且健康的那个。
| 供应商 | ||||
|---|---|---|---|---|
| 最低价deepseek | Peak$1.32/百万 tokensOff-Peak$0.66/百万 tokens | Peak$3.96/百万 tokensOff-Peak$1.98/百万 tokens | 读Peak$0.044/百万 tokensOff-Peak$0.022/百万 tokens写— | 1M |
| 减 15%alibaba-cloud | Off-Peak$0.66$0.561/百万 tokensPeak$1.32$1.122/百万 tokens | Off-Peak$1.98$1.683/百万 tokensPeak$3.96$3.366/百万 tokens | 读Off-Peak$0.066$0.0561/百万 tokensPeak$0.132$0.1122/百万 tokens写— | 1M |
可用率
24 小时Amux 网关实际发出的请求在各供应商上的成功率。分母不含客户端错误——请求写错了不算供应商的账。
吞吐量
24 小时流式请求的平均吐字速率,单位为每秒 token 数(TPS)。
延迟
24 小时流式请求的平均首字延迟(TTFT),也就是从发出请求到收到第一个 token 的时间。
活动
24 小时该模型随时间变化的 token 用量与成本,按实际处理请求的供应商拆分。
相关模型
更多来自 DeepSeek 的模型
DeepSeek: DeepSeek V4 Flash Vision Exp1M 上下文最低 $0.22 / 百万 tokens1 个供应商DeepSeek V4 Flash Vision Exp 是 DeepSeek 的 DeepSeek V4 Flash 0731 的实验性视觉版本,增加了图像理解,同时在文本功能(包括代理、推理和世界知识)上匹配基本模型。它是一个稀疏专家混合模型,共有 284B 个活动参数,其中有 13B 个。
DeepSeek: DeepSeek V4 Flash 07311M 上下文最低 $0.22 / 百万 tokens2 个供应商DeepSeek V4 Flash 是 DeepSeek 的效率优化混合专家模型,总参数为 284B,激活参数为 13B,支持 1M 代币上下文窗口。它专为快速推理和高吞吐量工作负载而设计,同时保持强大的推理和编码性能。