MiniMax-M3 是 MiniMax 的多模态基础模型。它支持文本、图像和视频输入以及文本输出、1M 令牌上下文窗口,适合长期代理工作、编码和工具使用。它基于 MiniMax Sparse Attention (MSA) 构建,用 KV 块选择取代完全注意力,以减少长上下文中每个令牌的计算量 — 大约是上一代 1M 令牌成本的 1/20,预填充和解码速度显着加快,同时保持大多数任务的质量。
- 厂商:
- MiniMax
- 输入类型:
- 输出类型:
- 上下文长度:
- 1M
- 最大输出:
- 512K
- 发布时间:
- 2026-06-01
toolsreasoningstreamingvisioncaching
供应商
同一个模型,不同供应商。自动路由会在同一质量层级内挑选价格最优且健康的那个。
| 供应商 | ||||
|---|---|---|---|---|
| 减 50%minimax | $0.6-1.2$0.3-0.6/百万 tokens | $2.4-4.8$1.2-2.4/百万 tokens | 读$0.12-0.24$0.06-0.12/百万 tokens写— | 1M |
可用率
24 小时Amux 网关实际发出的请求在各供应商上的成功率。分母不含客户端错误——请求写错了不算供应商的账。
吞吐量
24 小时流式请求的平均吐字速率,单位为每秒 token 数(TPS)。
延迟
24 小时流式请求的平均首字延迟(TTFT),也就是从发出请求到收到第一个 token 的时间。
活动
24 小时该模型随时间变化的 token 用量与成本,按实际处理请求的供应商拆分。
相关模型
更多来自 MiniMax 的模型
MiniMax: MinMax M2.7205K 上下文最低 $0.21 / 百万 tokens1 个供应商MiniMax-M2.7 是下一代大型语言模型,专为自主、现实世界的生产力和持续改进而设计。 M2.7 旨在积极参与自身的发展,通过多代理协作集成了先进的代理功能,使其能够跨动态环境规划、执行和完善复杂的任务。
MinMax: MiniMax M2.7 highspeed205K 上下文最低 $0.42 / 百万 tokens1 个供应商MiniMax-M2.7-Highspeed 是 MiniMax-M2.7 的高速变体,提供相同的高级代理功能和模型性能,并且推理速度明显更快,响应能力更强。它专为自主、现实世界的生产力而设计,可以在动态环境中更灵活地规划、执行和完善复杂的任务。
MiniMax: MinMax M2.5205K 上下文最低 $0.24 / 百万 tokens1 个供应商MiniMax-M2.5 是一种专为现实世界生产力而设计的 SOTA 大型语言模型。 M2.5 在各种复杂的现实数字工作环境中接受过培训,以 M2.1 的编码专业知识为基础,扩展到一般办公室工作,能够流畅地生成和操作 Word、Excel 和 Powerpoint 文件、不同软件环境之间的上下文切换以及跨不同代理和人类团队工作。 M2.5 在 SWE-Bench Verified 上得分为 80.2%,在 Multi-SWE-Bench 上得分为 51.3%,在 BrowseComp 上得分为 76.3%,其代币效率也比前几代更高,经过培训可通过规划优化其操作和输出。