xAI Grok
最近更新:2026年9月9日
Grok 4.6 / 4.5 / 4.3 / Build 在 Amux 上的参数支持、服务端工具与用量字段。
Grok 系列走通用的兼容端点,不需要专用接口: Chat Completions、 Responses、 Messages 三条都能调。
这一页只讲经过 Amux 之后还剩什么——哪些参数原样透传、哪些被丢掉、 哪些能力只在特定端点上可达。上游的参数含义请查 xAI 官方文档,我们不复述。
模型
| 模型 | 上下文 | 输入 | 别名 |
|---|---|---|---|
x-ai/grok-4.6 | 500K | 文本 · 图像 · 文件 | grok-4.6 |
x-ai/grok-4.5 | 500K | 文本 · 图像 · 文件 | grok-4.5 |
x-ai/grok-4.3 | 1M | 文本 · 图像 · 文件 | grok-4.3 |
x-ai/grok-build-0.1 | 256K | 文本 · 图像 · 文件 | grok-code-fast-1 · grok-code-fast · grok-code-fast-1-0825 |
图像既可以传 base64,也可以传 URL——传 URL 时由上游去抓取,
抓不到会返回 invalid_image。文件用 Responses 的 input_file + file_url。
参数支持
四种状态:透传原样送到上游;丢弃在网关被摘掉,并在响应头
x-amux-dropped-params 里报出;忽略送上去了但上游不执行;
报错直接拒绝。
| 参数 | 状态 | 说明 |
|---|---|---|
temperature · top_p · top_k · min_p | 透传 | temperature 上限 2,超了上游报错 |
max_tokens · max_completion_tokens | 透传 | |
seed · n · user · metadata · store | 透传 | |
prompt_cache_key | 透传 | 建议设,它决定缓存命不命中 |
tools(type: function)· tool_choice · parallel_tool_calls | 透传 | 客户端函数工具 |
response_format | 透传 | json_object 与 json_schema 都真生效 |
reasoning_effort | 透传 | low / medium / high / xhigh,默认 high。grok-4.5 与 grok-4.3 收下 xhigh 但按 high 执行;grok-build-0.1 不支持这个参数,会被丢弃 |
stop · presence_penalty · frequency_penalty | 丢弃 | Grok 全系不支持。不丢的话上游直接 400,所以网关摘掉它们并在响应头里告诉你 |
logprobs · top_logprobs | 忽略 | 上游收下但不返回 |
service_tier | 不开放 | 详见下方「暂不支持」 |
grok-build-0.1 仍然产出推理 token,只是不给你调档。
服务端工具
⚠️ 只在 Responses 端点上可用。
在 Chat Completions 与 Messages 上传服务端工具不会报错,也不会生效—— 上游收下之后当没看见,模型用自己的知识作答。工作台的操练场同样用不了。
声明方式:
{
"model": "grok-4.6",
"input": "今天有什么 AI 新闻?",
"tools": [{ "type": "web_search" }]
}| 工具 | 说明 |
|---|---|
web_search | 联网检索 |
x_search | 检索 X(推特)内容 |
code_execution(别名 code_interpreter) | 在沙箱里跑代码 |
image_generation | 对话中途出图,base64 内联在 output[] 里 |
mcp | 转发到你自己的 MCP server,需要 server_label 与 server_url |
每个工具的可用性与资费口径以模型目录为准,
GET /v1/models 的 pricing.tiers 里也能拿到。
⚠️ **次数由模型自己决定,一次请求可能调多次。**实测一句「搜一条 X 上的帖子」 触发了 4 次
x_search。usage.server_side_tool_usage_details里能看到每种各调了几次。另外一次检索会往上下文里灌几千个 token,这部分同样计入用量。
mcp 的用法:
{
"model": "grok-4.6",
"input": "用 deepwiki 查一下 facebook/react 是什么",
"tools": [
{ "type": "mcp", "server_label": "deepwiki", "server_url": "https://mcp.deepwiki.com/mcp" }
]
}模型发起的每一次 MCP 调用会在 output[] 里留下一个 mcp_call 条目,
次数计在 usage.server_side_tool_usage_details.mcp_calls 上。
grok-build-0.1 不支持 Responses 端点,因此也用不了服务端工具。
用量字段
**推理 token 不在 completion_tokens 里。**Chat Completions 的
completion_tokens 不含 reasoning_tokens,两者相加才是本次的输出量:
输出 = completion_tokens + completion_tokens_details.reasoning_tokens
Responses 端点的 output_tokens 已经包含推理,直接用即可。
**每次调用有固定的提示词开销。**Grok 自带一段系统提示词,
grok-4.6 约 637 token、grok-4.5 约 495 token,通常大部分命中缓存。
**长上下文有分档。**单次请求的输入达到 200,000 token 时会切到高档,
四个模型的阈值都是 200K——注意 grok-build-0.1 的上下文上限只有 256K。
各档口径见模型目录。
暂不支持
service_tier、collections_search / file_search 暂不开放。
deferred 与 search_parameters 上游已废弃或不再生效,传了不会有任何效果。