DeepSeek V4.1 Flash 是 DeepSeek 的稀疏专家混合模型,也是第一个基于该公司因果编码器-解码器 (CED) 架构构建的模型。它激活 552B 参数主干的输入上的 8B 参数和输出上的 16B 参数,这是一种不对称的分割,可以使每个令牌的计算量相对于模型的总大小而言较低。图像理解是该架构的原生功能,视觉和文本嵌入从预训练开始就联合训练,而不是像早期实验性 V4 Flash Vision Exp(在新选项卡中打开)那样事后添加。
- 厂商:
- DeepSeek
- 输入类型:
- 输出类型:
- 上下文长度:
- 1M
- 最大输出:
- 384K
- 发布时间:
- 2026-09-10
toolsreasoningstructuredOutputstreamingvisioncaching
供应商
同一个模型,不同供应商。自动路由会在同一质量层级内挑选价格最优且健康的那个。
| 供应商 | ||||
|---|---|---|---|---|
| 减 10%最低价alibaba-cloud | Off-Peak$0.15$0.135/百万 tokensPeak$0.3$0.27/百万 tokens | Off-Peak$0.6$0.54/百万 tokensPeak$1.2$1.08/百万 tokens | 读Off-Peak$0.015$0.0135/百万 tokensPeak$0.03$0.027/百万 tokens写— | 1M |
| deepseek | Peak$0.3/百万 tokensOff-Peak$0.15/百万 tokens | Peak$1.2/百万 tokensOff-Peak$0.6/百万 tokens | 读Peak$0.006/百万 tokensOff-Peak$0.003/百万 tokens写— | 1M |
可用率
24 小时Amux 网关实际发出的请求在各供应商上的成功率。分母不含客户端错误——请求写错了不算供应商的账。
吞吐量
24 小时流式请求的平均吐字速率,单位为每秒 token 数(TPS)。
延迟
24 小时流式请求的平均首字延迟(TTFT),也就是从发出请求到收到第一个 token 的时间。
活动
24 小时该模型随时间变化的 token 用量与成本,按实际处理请求的供应商拆分。
相关模型
更多来自 DeepSeek 的模型
DeepSeek: DeepSeek V4 Flash Vision Exp1M 上下文最低 $0.066 / 百万 tokens1 个供应商DeepSeek V4 Flash Vision Exp 是 DeepSeek 的 DeepSeek V4 Flash 0731 的实验性视觉版本,增加了图像理解,同时在文本功能(包括代理、推理和世界知识)上匹配基本模型。它是一个稀疏专家混合模型,共有 284B 个活动参数,其中有 13B 个。
DeepSeek: DeepSeek V4 Pro 08131M 上下文最低 $0.198 / 百万 tokens3 个供应商DeepSeek V4 Pro是DeepSeek推出的大规模Mixture-of-Experts模型,总参数1.6T,激活参数49B,支持1M-token上下文窗口。它专为高级推理、编码和长期代理工作流程而设计,在知识、数学和软件工程基准方面具有强大的性能。
DeepSeek: DeepSeek V4 Flash 07311M 上下文最低 $0.066 / 百万 tokens2 个供应商DeepSeek V4 Flash 是 DeepSeek 的效率优化混合专家模型,总参数为 284B,激活参数为 13B,支持 1M 代币上下文窗口。它专为快速推理和高吞吐量工作负载而设计,同时保持强大的推理和编码性能。