Amux
全部模型

Tencent Cloud

由 Tencent Cloud 提供的模型

模型 · 8

  • MiniMax: MinMax M3
    减 50%对话

    MiniMax-M3 是 MiniMax 的多模态基础模型。它支持文本、图像和视频输入以及文本输出、1M 令牌上下文窗口,适合长期代理工作、编码和工具使用。它基于 MiniMax Sparse Attention (MSA) 构建,用 KV 块选择取代完全注意力,以减少长上下文中每个令牌的计算量 — 大约是上一代 1M 令牌成本的 1/20,预填充和解码速度显着加快,同时保持大多数任务的质量。

    输入类型:
    输出类型:
    输入:
    $0.6$0.3/百万
    输出:
    $2.4$1.2/百万
    上下文长度:
    1M
    最大输出:
    512K
    2 个供应商
    10/08 16:00 – 10/11 16:00—
  • MoonshotAI: Kimi K3
    减 70%对话

    MoonshotAI: Kimi K3 是 Kimi 迄今为止能力最强的模型,拥有 2.8 万亿参数。它基于混合线性注意力机制 Kimi Delta Attention 和注意力残差技术构建,具备原生视觉理解能力,并拥有 100 万 token 的上下文窗口,适用于软件工程、知识工作和深度推理等前沿智能场景。

    输入类型:
    输出类型:
    输入:
    $3$0.9/百万
    输出:
    $15$4.5/百万
    上下文长度:
    1.05M
    最大输出:
    1.05M
    4 个供应商
    10/08 16:00 – 10/11 16:00100.00%
  • Tencent: Hy3
    减 35%对话

    Tencent: Hy3 是腾讯推出的一款混合专家模型,拥有 7700 亿总参数,其中 490 亿为激活参数。它专为编码智能体、复杂工具使用工作流,以及需要规划、上下文连续性和持续多步执行的生产力任务而设计。

    输入类型:
    输出类型:
    输入:
    $0.132$0.0858/百万
    输出:
    $0.528$0.3432/百万
    上下文长度:
    262K
    最大输出:
    131K
    1 个供应商
    10/08 16:00 – 10/11 16:00—
  • Tencent: Hy4 Preview
    减 35%对话

    Tencent: Hy4 Preview 是腾讯推出的混合专家(MoE)模型,总参数量为 770B,激活参数量为 49B。它专为编码智能体、复杂工具使用工作流,以及需要规划、上下文连续性和持续多步执行的生产力任务而设计。

    输入类型:
    输出类型:
    输入:
    $0.834$0.5421/百万
    输出:
    $2.501$1.6257/百万
    上下文长度:
    1.05M
    最大输出:
    64K
    1 个供应商
    10/08 16:00 – 10/11 16:00—
  • Z.ai: GLM 5.2
    减 70%对话

    GLM 5.2是Z.ai的大规模推理模型。它支持使用 1M 令牌上下文窗口进行文本输入和输出,适用于长期代理工作流程、项目级软件工程和复杂的多步骤自动化。

    输入类型:
    输出类型:
    输入:
    $1.4$0.42/百万
    输出:
    $4.4$1.32/百万
    上下文长度:
    1M
    最大输出:
    128K
    3 个供应商
    10/08 16:00 – 10/11 16:00—
  • Z.ai: GLM 5.3
    减 70%对话

    GLM-5.3 是 Z.ai 的大规模推理模型,专为复杂的软件工程和长期代理任务而构建。它支持具有 1M-token 上下文窗口的文本输入和输出,并在编码以及性能和令牌效率之间的平衡方面改进了 GLM-5.2。

    输入类型:
    输出类型:
    输入:
    $1.4$0.42/百万
    输出:
    $4.4$1.32/百万
    上下文长度:
    1M
    最大输出:
    128K
    3 个供应商
    10/08 16:00 – 10/11 16:00100.00%
  • Z.ai: GLM 5.3 Flash
    减 70%对话

    GLM-5.3-Flash 是 Z.ai 的原生多模式模型。它适合高效编码和长期代理任务。其混合稀疏和线性注意架构保持准确的长上下文行为,同时减少计算开销。

    输入类型:
    输出类型:
    输入:
    $0.15$0.045/百万
    输出:
    $0.5$0.15/百万
    上下文长度:
    1M
    最大输出:
    128K
    2 个供应商
    10/08 16:00 – 10/11 16:0090.79%
  • Z.ai: GLM 5.3 FlashX
    减 70%对话

    Z.AI: GLM 5.3 FlashX 是 GLM-5.3-Flash 的更快、更流畅版本,推理速度高达 200 tokens/s。Z.AI: GLM 5.3 FlashX 是 Z.ai 旗下的原生多模态模型,适用于高效编程和长程代理任务。其混合稀疏与线性注意力架构在降低计算开销的同时,保持了精准的长上下文表现。

    输入类型:
    输出类型:
    输入:
    $0.375$0.1125/百万
    输出:
    $1.25$0.375/百万
    上下文长度:
    1M
    最大输出:
    128K
    3 个供应商
    10/08 16:00 – 10/11 16:00100.00%