Amux
全部模型

Qwen: Qwen3.8-2.4T-A95B

正常

Qwen3.8-2.4T-A95B 是通义千问最新旗舰系列的开源版本,于 2026 年 8 月发布。它采用稀疏 MoE 架构,总参数量达 2.4 万亿,每步激活约 950 亿参数,并支持 100 万 token 上下文及混合注意力机制。核心基准测试包括 GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1 和 BabyVision 82.0。在 CodeArena 上全球排名第 4。

厂商:
Qwen
输入类型:
输出类型:
上下文长度:
1M
最大输出:
64K
发布时间:
2026-08-13
toolsstructuredOutputstreamingvisioncaching

供应商

同一个模型,不同供应商。自动路由会在同一质量层级内挑选价格最优且健康的那个。

供应商
减 10%alibaba-cloud$2$1.8/百万 tokens$6$5.4/百万 tokens
读 explicit$0.17$0.153/百万 tokens读 implicit$0.25$0.225/百万 tokens$2.5$2.25/百万 tokens
1M

可用率

24 小时

Amux 网关实际发出的请求在各供应商上的成功率。分母不含客户端错误——请求写错了不算供应商的账。

吞吐量

24 小时

流式请求的平均吐字速率,单位为每秒 token 数(TPS)。

延迟

24 小时

流式请求的平均首字延迟(TTFT),也就是从发出请求到收到第一个 token 的时间。

活动

24 小时

该模型随时间变化的 token 用量与成本,按实际处理请求的供应商拆分。

相关模型

更多来自 Qwen 的模型

Qwen: Qwen3.8-Max-09021M 上下文最低 $2 / 百万 tokens1 个供应商Qwen3.8-Max-0902 是 Qwen3.8-Max 的快照版本,具备更强的编码性能,适用于复杂的工程任务和长程自主开发。它同时提升了智能体工具使用能力以及针对图表推理、文档解析和多模态感知的视觉理解能力,并保留了 100 万 token 的上下文窗口、推理模式以及完整的工具生态系统。
Qwen: Qwen3.8-Flash1M 上下文最低 $0.144 / 百万 tokens1 个供应商Qwen3.8-Flash 是 Qwen 系列的最新多模态模型,兼具强大的推理、生成能力与惊人的速度。它原生支持百万级 Token 的上下文窗口,能够一次性处理长文档、完整代码库及复杂对话。该模型在代码辅助、智能体工作流和视觉理解方面表现出色,无论是自主修复代码、操作桌面应用程序,还是分析图表与长视频,皆能应对自如。Qwen3.8-Flash 完全兼容 OpenAI 和 Anthropic API 协议,可与 Claude Code 和 Codex 等流行开发工具无缝集成,助力开发者轻松构建高并发应用与智能工作流。凭借卓越的性能和极具竞争力的推理成本,Qwen3.8-Flash 是寻求 AI 应用性能与成本平衡的开发者及企业的理想之选。
Qwen: Qwen3.8-27B1M 上下文最低 $0.4 / 百万 tokens1 个供应商Qwen3.8-27B 原生视觉语言密集模型相较于 3.6-27B 版本有显著提升,在文本和视觉模态的编程与办公场景能力方面进行了重点强化。它能够更可靠地端到端完成复杂任务,并生成可信赖的输出。