GPT-6 Astra 是 OpenAI 的旗舰模型,适用于要求苛刻的端到端工作。它适用于高级分析、软件工程、深入研究、科学工作和文档创建,在涉及计算机和浏览器使用的长期代理任务中具有特殊优势。
- 输入类型:
- 输出类型:
- 输入:
- $10$0.5/百万
- 输出:
- $50$2.5/百万
- 上下文长度:
- 1.05M
- 最大输出:
- 128K
46 个模型
GPT-6 Astra 是 OpenAI 的旗舰模型,适用于要求苛刻的端到端工作。它适用于高级分析、软件工程、深入研究、科学工作和文档创建,在涉及计算机和浏览器使用的长期代理任务中具有特殊优势。
Claude Fable 5.1 在各方面都比 Claude Fable 5 有所提升,最大的进步体现在智能代理编码、长期运行的智能代理工作流程以及知识工作方面:尤其是长代码重构、前端和可视化代码生成,以及财务和分析任务。它在计划和总结方面也比 Fable 5 更加简洁。我们建议在当前使用 Fable 5 的地方直接升级测试,同时在需要大量推理的任务中与 Opus 5 一起使用。
Gemini 3.8 Flash 是 Google 最智能的 Flash 模型,在软件工程、代理任务和多步推理方面较 3.7 Flash 有了显着的进步。
MiniMax: MiniMax H3 Max 是由 MiniMax 和 fal.ai 联合发布的视频生成模型。该模型由 fal.ai 在 MiniMax H3 的基础上进行后训练,并针对高速生成进行了优化。它支持主流的 480P 和 768P 输出,生成速度比 MiniMax H3 更快。目前支持“文生视频”和“图生视频”,后续将支持“参考图生成”。
Alibaba: Wan3.0-Video 是一款多功能参考视频生成模型,支持文本转视频、图像转视频(首帧/首尾帧)以及基于参考的视频生成。它能够生成长达 30 秒、30fps 的视频。
Alibaba: Wan3.0-Video-Prime 是 Wan3.0 视频生成模型的高速版本。它具备与标准 Wan3.0-Video 模型同等的强大能力,支持四种模态的综合参考输入,可生成长达 30 秒的视频,并在提供沉浸式视听体验的同时,显著提升了端到端的生成速度。
DeepSeek V4 Flash Vision Exp 是 DeepSeek 的 DeepSeek V4 Flash 0731 的实验性视觉版本,增加了图像理解,同时在文本功能(包括代理、推理和世界知识)上匹配基本模型。它是一个稀疏专家混合模型,共有 284B 个活动参数,其中有 13B 个。
Gemini 3.7 Flash 是 Google 的多模式模型,用于快速代理工作流程、编码和复杂的多步骤推理。它专为需要响应性能和可靠的多步骤问题解决的任务而设计。
DeepSeek V4 Pro是DeepSeek推出的大规模Mixture-of-Experts模型,总参数1.6T,激活参数49B,支持1M-token上下文窗口。它专为高级推理、编码和长期代理工作流程而设计,在知识、数学和软件工程基准方面具有强大的性能。
DeepSeek V4 Flash 是 DeepSeek 的效率优化混合专家模型,总参数为 284B,激活参数为 13B,支持 1M 代币上下文窗口。它专为快速推理和高吞吐量工作负载而设计,同时保持强大的推理和编码性能。
MiniMax: MiniMax H3 是由 MiniMax 开发的一款轻量级开源权重视频生成模型。它专为精准的多模态编辑和受控内容生成而设计,包括指令驱动的编辑、文本与品牌渲染以及视频到视频的动作迁移。该模型适用于广告、电子商务、游戏和界面设计等商业创意工作流,并支持用于参考驱动生成的原生视听输出。
Claude Opus 5 是 Anthropic 的旗舰模型,适用于要求较高的推理、编码和长期代理工作。它在端到端软件任务、代码审查和错误查找、图表和文档的可视化分析、复杂的办公室可交付成果以及协调并行子代理方面尤其强大。
Gemini 3.5 Flash Lite是Google推出的一款高效模型,具有升级的代理能力。它适合在复杂的多代理工作流程中执行重点任务的子代理。
Gemini 3.6 Flash 是 Google 的一个高效模型,用于编码、代理工作流程以及 Web 和应用程序开发。它旨在产生精美的输出,减少不必要的编辑和对冲,同时减少令牌使用和完成任务所需的模型调用数量。
GPT-5.6 Luna 是 OpenAI GPT-5.6 系列中快速、经济高效的型号。它适用于大容量、延迟敏感的任务,例如聊天、分类和轻量级代理工作流程,为其价格层提供有力的推理。
GPT-5.6 Sol是OpenAI GPT-5.6系列中的旗舰型号。它适用于复杂的推理、编码和代理工作流程,并且在命令行和多步骤编码任务以及长期问题解决方面尤其强大。
GPT-5.6 Terra 是 OpenAI GPT-5.6 系列中的平衡型号,定位于旗舰 Sol 层和经济高效的 Luna 层之间。它适用于需要平衡能力和成本的日常编码、推理和代理任务,以大约 Sol 一半的成本提供强大的性能。
Google: Nano Banana 2 Lite (Gemini 3.1 Flash-Lite Image) 是 Google 最快、最具成本效益的 Gemini 图像模型,专为高频开发流水线和快速视觉探索而构建。它能在约 5 秒内完成文本转图像生成,速度比 Gemini 3.1 Flash Image 快约 2.7 倍,同时保持了 Nano Banana 系列的角色一致性、精确编辑能力和现实世界知识。单一的嵌入式 API 可处理文本转图像、图像编辑和多图像合成。作为多模态模型,它还能在返回图像的同时生成文本。输出分辨率为 1K,支持 14 种宽高比,并带有不可见的 SynthID 水印,以便识别为 AI 生成。作为 Nano Banana 2 系列中质量与速度的最佳平衡点,它能以比重量级生产模型低得多的成本生成数千张图像,非常适合原型设计、实时应用程序和大规模视觉工作流。
Claude Sonnet 5 被打造为迄今为止最具活力的 Sonnet 模型。它可以规划、使用浏览器和终端等工具,并以最近才需要更大、更昂贵的模型的水平自主运行。
Alibaba: HappyHorse 1.1是阿里巴巴的视频生成模型。它根据文本提示、单个起始图像或一组参考图像生成短视频,输出分辨率高达 1080p,持续时间为 3 到 15 秒。它适用于创意内容、社交媒体剪辑和图像驱动的动画,并在先前版本的基础上进行了改进,具有更强的提示依从性、更流畅的运动以及跨帧的更一致的角色。
Google: Nano Banana 2 (Gemini 3.1 Flash Image) 专为速度和效率而设计,可有效实现快速、交互式的响应以及高吞吐量。
Google: Nano Banana Pro (Gemini 3 Pro Image) 是一款基于 Google Gemini 3 Pro 构建的 AI 图像生成模型,是其前代产品的一次重大升级。它旨在超越简单的模式匹配,转向一个更具推理驱动的系统,并在物理理解、文本渲染和图像一致性方面进行了改进。其主要功能包括更快的处理速度、原生 2K 分辨率以及对现有图像进行更高精度编辑的能力,旨在提供更可靠、专业级的生成结果。
Claude Fable 5 是 Anthropic 的 Mythos 级模型,专为自主知识工作和编码而构建。它支持文本、图像和文件输入以及文本输出,并具有推理支持和 1M 令牌上下文窗口。它适用于以前需要频繁人工签入的长时间运行、复杂和异步任务。
MiniMax-M3 是 MiniMax 的多模态基础模型。它支持文本、图像和视频输入以及文本输出、1M 令牌上下文窗口,适合长期代理工作、编码和工具使用。它基于 MiniMax Sparse Attention (MSA) 构建,用 KV 块选择取代完全注意力,以减少长上下文中每个令牌的计算量 — 大约是上一代 1M 令牌成本的 1/20,预填充和解码速度显着加快,同时保持大多数任务的质量。
Claude Opus 4.8 是 Anthropic Opus 系列中功能最强大的通用型号。它支持文本、图像和文件输入以及文本输出,并具有推理支持和 1M 令牌上下文窗口。它适用于高度自主的代理、长期代理工作、知识工作和记忆驱动的任务,在这些任务中,长时间会话的一致性很重要。
Gemini 3.5 Flash 是谷歌的高效多模态模型,以 Flash 级的成本和速度带来接近专业级的编码和推理能力。它针对编码能力和并行代理执行循环进行了高度优化,支持文本、图像、视频、音频和 PDF 输入。
Alibaba: HappyHorse 1.0 被描述为一款开源的最先进 AI 视频生成器,具有原生音视频联合生成功能——这意味着 alibaba: HappyHorse 1.0 视频模型可以在单次前向传递中同时生成视频帧和相应的音轨(对话、环境音、拟音),而不是先生成静音视频再进行后期配音。 根据社区整理的架构说明,该模型围绕一个 150 亿参数的统一自注意力 Transformer 构建,可在单个标记序列内处理文本、图像、视频和音频标记。据报道,它在构建时没有采用专用的交叉注意力分支,也没有单独的音频模块。结合 DMD-2 蒸馏技术,据称其蒸馏版本在 NVIDIA H100 上仅需 8 个去噪步骤,且无需无分类器引导(classifier-free guidance),即可在大约 38 秒内生成 1080p 视频。
GPT-5.5是OpenAI专为复杂专业工作负载而设计的前沿模型,建立在GPT-5.4的基础上,具有更强的推理能力、更高的可靠性以及在困难任务上提高的代币效率。它具有 1M+ 令牌上下文窗口(922K 输入,128K 输出),支持文本和图像输入,可在单个系统内实现大规模推理、编码和多模式工作流程。
OpenAI最新的图像生成模型。通过专用图像 API 支持高保真图像生成和编辑。
Opus 4.7 是 Anthropic Opus 系列的下一代产品,专为长期运行的异步代理而构建。它以 Opus 4.6 的编码和代理优势为基础,在复杂的多步骤任务上提供更强大的性能,并在扩展工作流程中提供更可靠的代理执行。它对于任务随时间展开的异步代理管道特别有效 - 大型代码库、多阶段调试和端到端项目编排。
MiniMax-M2.7 是下一代大型语言模型,专为自主、现实世界的生产力和持续改进而设计。 M2.7 旨在积极参与自身的发展,通过多代理协作集成了先进的代理功能,使其能够跨动态环境规划、执行和完善复杂的任务。
MiniMax-M2.7-Highspeed 是 MiniMax-M2.7 的高速变体,提供相同的高级代理功能和模型性能,并且推理速度明显更快,响应能力更强。它专为自主、现实世界的生产力而设计,可以在动态环境中更灵活地规划、执行和完善复杂的任务。
GPT-5.4 mini 将 GPT-5.4 的核心功能引入更快、更高效的模型,并针对高吞吐量工作负载进行了优化。它支持文本和图像输入,在推理、编码和工具使用方面具有强大的性能,同时减少大规模部署的延迟和成本。
GPT-5.4 nano 是 GPT-5.4 系列中最轻量且最具成本效益的变体,针对速度关键和大批量任务进行了优化。它支持文本和图像输入,专为低延迟用例而设计,例如分类、数据提取、排名和子代理执行。
GPT-5.4 是 OpenAI 的最新前沿模型,它将 Codex 和 GPT 系列统一为一个系统。它具有 100 多万个标记上下文窗口(922K 输入,128K 输出),支持文本和图像输入,可在同一工作流程中进行高上下文推理、编码和多模态分析。
Gemini 3.1 Pro 是 Gemini 系列模型的下一代产品,是一套高性能、原生多模式推理模型。 Gemini 3 Pro 现在是 Google 针对复杂任务最先进的模型,可以理解海量数据集,解决来自不同信息源的问题,包括文本、音频、图像、视频和整个代码存储库
Sonnet 4.6 是 Anthropic 迄今为止最强大的 Sonnet 级模型,在编码、代理和专业工作方面具有前沿性能。它擅长迭代开发、复杂的代码库导航、带内存的端到端项目管理、精美的文档创建以及自信地使用计算机进行 Web QA 和工作流程自动化。
MiniMax-M2.5 是一种专为现实世界生产力而设计的 SOTA 大型语言模型。 M2.5 在各种复杂的现实数字工作环境中接受过培训,以 M2.1 的编码专业知识为基础,扩展到一般办公室工作,能够流畅地生成和操作 Word、Excel 和 Powerpoint 文件、不同软件环境之间的上下文切换以及跨不同代理和人类团队工作。 M2.5 在 SWE-Bench Verified 上得分为 80.2%,在 Multi-SWE-Bench 上得分为 51.3%,在 BrowseComp 上得分为 76.3%,其代币效率也比前几代更高,经过培训可通过规划优化其操作和输出。
MiniMax-M2.5-Highspeed 是 MiniMax-M2.5 的高速变体,提供相同的 SOTA 性能和实际生产力能力,同时推理速度显着加快,响应速度更快。经过多样化和复杂的数字工作环境的培训,它将 M2.1 的编码专业知识扩展到一般办公室工作,包括生成和操作 Word、Excel 和 PowerPoint 文件、跨软件环境无缝切换以及跨代理和人类团队协作。凭借与 M2.5 相同的强大基准性能和令牌效率规划功能,Highspeed 变体经过优化,可在延迟敏感的工作流程中实现更快、更敏捷的执行。
Opus 4.6 是 Anthropic 最强大的编码和长期运行专业任务模型。它是为跨整个工作流程而不是单个提示操作的代理而构建的,这使得它对于大型代码库、复杂的重构和随着时间的推移而展开的多步骤调试特别有效。与前几代模型相比,该模型表现出更深入的背景理解、更强的问题分解以及在艰巨的工程任务上更高的可靠性。
MiniMax-M2.1 是一种轻量级、最先进的大型语言模型,针对编码、代理工作流程和现代应用程序开发进行了优化。只需 100 亿个激活参数,它即可实现实际功能的重大飞跃,同时保持卓越的延迟、可扩展性和成本效率。
MiniMax-M2.1-Highspeed 是 MiniMax-M2.1 的高速变体,在编码、代理工作流程和现代应用程序开发方面提供相同的最先进功能,并且推理速度显着加快,响应速度更快。它仅具有 100 亿个激活参数,将强大的现实性能与卓越的延迟、可扩展性和成本效率结合在一起,使其特别适合交互式和延迟敏感的工作负载。
OpenAI的GPT-Image-1.5是其AI图像生成的最新进化版本,提供卓越的指令遵循、逼真度、文本渲染和编辑控制能力,使其成为详细创意和生产工作的理想选择,且比DALL-E 3等前代产品速度更快、成本更低。它擅长处理复杂请求,保持角色/风格一致性,在视觉中呈现清晰的文本,并通过内置推理理解细微的提示,已集成至ChatGPT并可通过API使用。
Claude Haiku 4.5 是 Anthropic 最快、最高效的模型,以较大 Claude 模型的一小部分成本和延迟提供近前沿的智能。 Haiku 4.5 与 Claude Sonnet 4 在推理、编码和计算机使用任务方面的性能相匹配,为实时和大容量应用程序带来了前沿水平的功能。
Gemini 2.5 Flash Image(又称“Nano Banana”)现已全面推出。它是一款具备上下文理解能力的尖端图像生成模型,支持图像生成、编辑以及多轮对话。
GPT-4o(“o”代表“omni”)是OpenAI的最新人工智能模型,支持文本和图像输入以及文本输出。它保持了 GPT-4 Turbo 的智能水平,同时速度提高了一倍,成本效益提高了 50%。 GPT-4o 还提高了处理非英语语言的性能并增强了视觉功能。