MiniMax-M2.1-Highspeed 是 MiniMax-M2.1 的高速变体,在编码、代理工作流程和现代应用程序开发方面提供相同的最先进功能,并且推理速度显着加快,响应速度更快。它仅具有 100 亿个激活参数,将强大的现实性能与卓越的延迟、可扩展性和成本效率结合在一起,使其特别适合交互式和延迟敏感的工作负载。
- 厂商:
- MiniMax
- 输入类型:
- 输出类型:
- 上下文长度:
- 205K
- 最大输出:
- 131K
- 发布时间:
- 2025-12-23
toolsreasoningstreamingcaching
供应商
同一个模型,不同供应商。自动路由会在同一质量层级内挑选价格最优且健康的那个。
| 供应商 | ||||
|---|---|---|---|---|
| 减 20%minimax | $0.6$0.48/百万 tokens | $2.4$1.92/百万 tokens | 读$0.03$0.024/百万 tokens写$0.375$0.3/百万 tokens | 205K |
可用率
24 小时Amux 网关实际发出的请求在各供应商上的成功率。分母不含客户端错误——请求写错了不算供应商的账。
吞吐量
24 小时流式请求的平均吐字速率,单位为每秒 token 数(TPS)。
延迟
24 小时流式请求的平均首字延迟(TTFT),也就是从发出请求到收到第一个 token 的时间。
活动
24 小时该模型随时间变化的 token 用量与成本,按实际处理请求的供应商拆分。
相关模型
更多来自 MiniMax 的模型
MiniMax: MinMax M31M 上下文最低 $0.3 / 百万 tokens1 个供应商MiniMax-M3 是 MiniMax 的多模态基础模型。它支持文本、图像和视频输入以及文本输出、1M 令牌上下文窗口,适合长期代理工作、编码和工具使用。它基于 MiniMax Sparse Attention (MSA) 构建,用 KV 块选择取代完全注意力,以减少长上下文中每个令牌的计算量 — 大约是上一代 1M 令牌成本的 1/20,预填充和解码速度显着加快,同时保持大多数任务的质量。
MiniMax: MinMax M2.7205K 上下文最低 $0.21 / 百万 tokens1 个供应商MiniMax-M2.7 是下一代大型语言模型,专为自主、现实世界的生产力和持续改进而设计。 M2.7 旨在积极参与自身的发展,通过多代理协作集成了先进的代理功能,使其能够跨动态环境规划、执行和完善复杂的任务。
MinMax: MiniMax M2.7 highspeed205K 上下文最低 $0.42 / 百万 tokens1 个供应商MiniMax-M2.7-Highspeed 是 MiniMax-M2.7 的高速变体,提供相同的高级代理功能和模型性能,并且推理速度明显更快,响应能力更强。它专为自主、现实世界的生产力而设计,可以在动态环境中更灵活地规划、执行和完善复杂的任务。