Qwen3.8-2.4T-A95B 是通义千问最新旗舰系列的开源版本,于 2026 年 8 月发布。它采用稀疏 MoE 架构,总参数量达 2.4 万亿,每步激活约 950 亿参数,并支持 100 万 token 上下文及混合注意力机制。核心基准测试包括 GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1 和 BabyVision 82.0。在 CodeArena 上全球排名第 4。
- 厂商:
- Qwen
- 输入类型:
- 输出类型:
- 上下文长度:
- 1M
- 最大输出:
- 64K
- 发布时间:
- 2026-08-13
toolsstructuredOutputstreamingvisioncaching
供应商
同一个模型,不同供应商。自动路由会在同一质量层级内挑选价格最优且健康的那个。
| 供应商 | ||||
|---|---|---|---|---|
| 减 10%alibaba-cloud | $2$1.8/百万 tokens | $6$5.4/百万 tokens | 读 explicit$0.17$0.153/百万 tokens读 implicit$0.25$0.225/百万 tokens写$2.5$2.25/百万 tokens | 1M |
可用率
24 小时Amux 网关实际发出的请求在各供应商上的成功率。分母不含客户端错误——请求写错了不算供应商的账。
吞吐量
24 小时流式请求的平均吐字速率,单位为每秒 token 数(TPS)。
延迟
24 小时流式请求的平均首字延迟(TTFT),也就是从发出请求到收到第一个 token 的时间。
活动
24 小时该模型随时间变化的 token 用量与成本,按实际处理请求的供应商拆分。
相关模型
更多来自 Qwen 的模型
Qwen: Qwen3.8-Max-09021M 上下文最低 $2 / 百万 tokens1 个供应商Qwen3.8-Max-0902 是 Qwen3.8-Max 的快照版本,具备更强的编码性能,适用于复杂的工程任务和长程自主开发。它同时提升了智能体工具使用能力以及针对图表推理、文档解析和多模态感知的视觉理解能力,并保留了 100 万 token 的上下文窗口、推理模式以及完整的工具生态系统。
Qwen: Qwen3.8-Flash1M 上下文最低 $0.144 / 百万 tokens1 个供应商Qwen3.8-Flash 是 Qwen 系列的最新多模态模型,兼具强大的推理、生成能力与惊人的速度。它原生支持百万级 Token 的上下文窗口,能够一次性处理长文档、完整代码库及复杂对话。该模型在代码辅助、智能体工作流和视觉理解方面表现出色,无论是自主修复代码、操作桌面应用程序,还是分析图表与长视频,皆能应对自如。Qwen3.8-Flash 完全兼容 OpenAI 和 Anthropic API 协议,可与 Claude Code 和 Codex 等流行开发工具无缝集成,助力开发者轻松构建高并发应用与智能工作流。凭借卓越的性能和极具竞争力的推理成本,Qwen3.8-Flash 是寻求 AI 应用性能与成本平衡的开发者及企业的理想之选。
Qwen: Qwen3.8-27B1M 上下文最低 $0.4 / 百万 tokens1 个供应商Qwen3.8-27B 原生视觉语言密集模型相较于 3.6-27B 版本有显著提升,在文本和视觉模态的编程与办公场景能力方面进行了重点强化。它能够更可靠地端到端完成复杂任务,并生成可信赖的输出。