Create xAI video
最近更新:2026年9月13日
通过 xAI 原生形状提交 Grok Imagine 视频任务。提示词可选,按出片秒数 × 分辨率档计费。
这个端点兼容 xAI 的视频生成接口。已有 xAI 代码时,将 base_url 指向本站即可,
请求体与响应形状与客户端现有的一致。
https://gateway.amux.ai/v1/videos/generations鉴权
headerAuthorizationstring必填Bearer <你的 Amux 密钥> 控制台创建的 Amux 密钥。忘了可以回控制台的密钥页再看一次。
请求
application/jsonmodelstring必填Amux 模型 ID。该端点上目前有两个模型:
| 模型 | 分辨率 | 时长 |
|---|---|---|
x-ai/grok-imagine-video-1.5 | 480p 720p 1080p | 1–15 秒 |
x-ai/grok-imagine-video | 480p 720p | 1–15 秒;含参考素材时上限为 10 秒 |
promptstring可选——提供任一素材时可省略。两者均未提供时返回 400。
durationinteger默认 8出片秒数。默认值为 8 秒。
⚠️ 在 x-ai/grok-imagine-video 上,请求包含
reference_images 或 last_frame 时上限收窄至 10 秒;
纯文生与图生场景仍为 15 秒。超出限制在提交时同步返回 400。
aspect_ratio"1:1" | "16:9" | "9:16" | "4:3" | "3:4" | "3:2" | "2:3"默认 "16:9"⚠️ 图生视频场景下不生效:输出宽高比跟随所提供的图片。
resolution"480p" | "720p" | "1080p"默认 "480p"默认值为 480p(上游默认值),同时也是计价档位。
⚠️ 1080p 仅 x-ai/grok-imagine-video-1.5 支持。
imageobject首帧图片。提供该字段即为图生视频模式。
›imageobject
urlstring首帧图片地址,须为公开可访问的 URL。
last_frameobject尾帧图片。与 image 同时提供即为首尾帧模式。
›last_frameobject
urlstring尾帧图片地址,须为公开可访问的 URL。
reference_imagesarray<object>风格与内容参考图,最多 14 张。
›reference_imagesarray<object>
urlstring参考图片地址,须为公开可访问的 URL。
generate_audioboolean默认 true默认生成音轨。 传 false 时输出不含音轨。
moderation"low" | "auto" | "high"内容审核强度。未提供时使用上游默认值。
userstring终端用户标识,用于滥用追踪。建议传入哈希值而非明文。
响应
200response任务已创建。
400response请求不合法(参数超出取值域、素材组合不成立、或提示词与素材均未提供)。
402response余额不足以完成本次任务的费用预留。
支持的模型
| 模型 | 分辨率 | 时长 | 参考图上限 |
|---|---|---|---|
x-ai/grok-imagine-video-1.5 | 480p 720p 1080p | 1–15 秒 | 14 张 |
x-ai/grok-imagine-video | 480p 720p | 1–15 秒(见下方限制) | 14 张 |
⚠️ 1080p 仅 x-ai/grok-imagine-video-1.5 支持。 在
x-ai/grok-imagine-video 上请求该档位将返回 400,不会被静默降级——
若降级处理,调用方需在任务完成并计费后才能发现输出分辨率与预期不符。
精确的取值域也可以从 GET /v1/models 的 supported_parameters 读到,
那一份与实际放行的完全一致。
四种生成模式
模式由请求中提供的素材决定,无需额外声明:
| 模式 | 必要字段 |
|---|---|
| 文生视频 | 仅 prompt |
| 图生视频 | image(首帧) |
| 参考图生视频 | reference_images |
| 首尾帧 | image + last_frame |
prompt 为可选——提供任一素材即可省略。此处与
MiniMax 视频端点相反,
从该端点迁移时无需补一条占位提示词。提示词与素材均未提供时返回 400。
参数行为说明
duration 的默认值为 8 秒
这是上游的默认值。未显式提供时输出为 8 秒,计费亦按 8 秒计。
x-ai/grok-imagine-video 的时长上限随模式变化
该模型在纯文生、图生场景下支持至 15 秒;请求中一旦包含
reference_images 或 last_frame,上限收窄至 10 秒。
超出限制在提交时同步返回 400,不会等到任务执行后才失败。
x-ai/grok-imagine-video-1.5 无此收窄,四种模式均支持至 15 秒。
图生视频的输出尺寸由源图决定
此场景下 aspect_ratio 与 resolution 不决定输出尺寸——输出宽高比恒跟随
所提供的图片。传入 3:2 的图片将得到 3:2 的视频,显式指定
aspect_ratio: "16:9" 不会改变这一结果。
计费不受影响:费用按请求的 resolution 档位计算,与实际像素无关。
⚠️ 1080p 档位的实际输出高度为 1088 而非 1080(H.264 宏块 16 对齐所致),
这属于编码器行为,不影响档位判定与计费。
输入素材的传递方式
与本站其它视频端点不同,此端点的每种素材是独立的顶层字段, 不使用统一的素材数组:
{
"model": "x-ai/grok-imagine-video-1.5",
"prompt": "让瀑布倾泻而下,镜头缓缓拉远",
"image": { "url": "https://…/waterfall.png" },
"reference_images": [{ "url": "https://…/style.png" }]
}⚠️ 地址需包裹在对象中({"url": "…"}),不接受裸字符串。
传入字符串将返回 400 并说明正确写法。
⚠️ reference_audios 暂不支持。 上游该字段接收的是预置音色标识
(voice_id),而非一段参考音频文件,两者语义不同。传入该字段将返回 400,
不会被静默忽略。
计费
费用 = 实际出片秒数 × 该分辨率档单价 + 输入图片张数 × 单张单价
出片秒数取上游返回的实际值,而非请求中的 duration——
图生视频场景下输出时长跟随素材。
分辨率是出片费用的唯一分档维度;aspect_ratio 生效但不影响单价。
首帧、尾帧与参考图均计入输入图片张数。
提交时按请求的 duration 与 resolution 预留费用,
完成后按实际用量结算并释放差额。
任务 ID
返回的 request_id 是 Amux 的任务 ID,而非上游任务句柄。所有取回口均只接受
该 ID:GET /v1/tasks/{id} 与
xAI 形状的别名读取的是同一个任务。
curl https://gateway.amux.ai/v1/videos/generations \
-H "Authorization: Bearer $AMUX_API_KEY" \
-d '{
"model": "x-ai/grok-imagine-video-1.5",
"prompt": "A red paper boat drifting down a rain puddle, camera slowly pans out",
"duration": 8,
"aspect_ratio": "16:9",
"resolution": "480p"
}'{
"request_id": "<string>"
}