Qwen: Qwen3.8-Max 是拥有 2.4 万亿参数的 MoE 旗舰模型,在编程和专业工作领域实现了全面飞跃。它能自主编码并交付跨越 10 天以上的完整项目,处理法律、金融、设计及其他专业领域的数百项专门任务,在单次对话中端到端地生成生产级成果。原生视觉理解贯穿规划、执行和验证的全周期,支持对超长文档和扩展视频内容进行深度语义分析。在长时程任务中,它能自主规划、通过闭环反馈进行迭代并持续进化。
- 厂商:
- Qwen
- 输入类型:
- 输出类型:
- 上下文长度:
- 1M
- 最大输出:
- 64K
- 发布时间:
- 2026-08-03
toolsstructuredOutputstreamingvisioncaching
供应商
同一个模型,不同供应商。自动路由会在同一质量层级内挑选价格最优且健康的那个。
| 供应商 | ||||
|---|---|---|---|---|
| 减 10%alibaba-cloud | $2$1.8/百万 tokens | $6$5.4/百万 tokens | 读 explicit$0.17$0.153/百万 tokens读 implicit$0.25$0.225/百万 tokens写$2.5$2.25/百万 tokens | 1M |
可用率
24 小时Amux 网关实际发出的请求在各供应商上的成功率。分母不含客户端错误——请求写错了不算供应商的账。
吞吐量
24 小时流式请求的平均吐字速率,单位为每秒 token 数(TPS)。
延迟
24 小时流式请求的平均首字延迟(TTFT),也就是从发出请求到收到第一个 token 的时间。
活动
24 小时该模型随时间变化的 token 用量与成本,按实际处理请求的供应商拆分。
相关模型
更多来自 Qwen 的模型
Qwen: Qwen3.8-Max-09021M 上下文最低 $2 / 百万 tokens1 个供应商Qwen3.8-Max-0902 是 Qwen3.8-Max 的快照版本,具备更强的编码性能,适用于复杂的工程任务和长程自主开发。它同时提升了智能体工具使用能力以及针对图表推理、文档解析和多模态感知的视觉理解能力,并保留了 100 万 token 的上下文窗口、推理模式以及完整的工具生态系统。
Qwen: Qwen3.8-Flash1M 上下文最低 $0.144 / 百万 tokens1 个供应商Qwen3.8-Flash 是 Qwen 系列的最新多模态模型,兼具强大的推理、生成能力与惊人的速度。它原生支持百万级 Token 的上下文窗口,能够一次性处理长文档、完整代码库及复杂对话。该模型在代码辅助、智能体工作流和视觉理解方面表现出色,无论是自主修复代码、操作桌面应用程序,还是分析图表与长视频,皆能应对自如。Qwen3.8-Flash 完全兼容 OpenAI 和 Anthropic API 协议,可与 Claude Code 和 Codex 等流行开发工具无缝集成,助力开发者轻松构建高并发应用与智能工作流。凭借卓越的性能和极具竞争力的推理成本,Qwen3.8-Flash 是寻求 AI 应用性能与成本平衡的开发者及企业的理想之选。
Qwen: Qwen3.8-27B1M 上下文最低 $0.4 / 百万 tokens1 个供应商Qwen3.8-27B 原生视觉语言密集模型相较于 3.6-27B 版本有显著提升,在文本和视觉模态的编程与办公场景能力方面进行了重点强化。它能够更可靠地端到端完成复杂任务,并生成可信赖的输出。