Grok / xAI 开放平台
Grok 的文档里最值钱的一块是提示缓存——官方为它单独写了五页,讲原理、讲怎么最大化命中、讲多轮对话里怎么保持、讲它怎么影响计费。这些恰恰是决定你实际成本的东西,而不是定价页上那个单价。 本专题共 25 篇。 内容依据 xAI 官方文档 整理,核对日 2026-08-25。 本专题只讲计费与接入机制,不列具体价格数字——价格变动频繁,写进正文只会过期误导,请以各平台官方定价页为准。
Grok API 怎么接入?xAI 密钥申请、SDK 与国内访问前提
讲清 Grok API 的接入全流程:从 console.x.ai 注册拿密钥、区分 accounts.x.ai / console.x.ai / api.x.ai / grok.com 四个域名各自的作用、用 OpenAI 兼容 SDK 把 base_url 指向 xAI 做最小调用,再到中国大陆访问的真实前提是什么、不能抱什么幻想。
提示缓存
官方为缓存单独写了五页:原理、怎么把命中率做上去、多轮对话里怎么保持、最佳实践清单、以及它到底怎么影响计费。这是 Grok 上最能省钱的一块机制。
多轮对话里怎么让 Grok 的缓存一直保持命中
Grok 的提示缓存从 messages 数组开头逐条比对,多轮对话只要回头改一个字就整段落空。这篇按排查顺序讲清会话 ID 怎么固定、哪三类动作会打断前缀、推理模型为什么必须回传 reasoning_content,以及怎么用 cached_tokens 确认命中。
怎么把 Grok 的缓存命中率做上去
Grok 的提示缓存是自动开的,但命中率高低取决于你怎么组织请求。这篇按实际操作顺序讲清楚:cached_tokens 在三套 API 里分别读哪个字段、x-grok-conv-id 和 prompt_cache_key 怎么设、推理模型为什么最容易掉缓存,以及命中率上不去时的排查顺序。
Grok 缓存怎么影响计费:省在哪、怎么看命中
Grok 的提示缓存自动生效,但省下来的钱到底记在哪个字段、命中率怎么核、账单怎么对,很多人没搞清。本文按官方文档梳理 Grok 缓存的计费口径、cached_tokens 的三种取值、cost_in_usd_ticks 的读法,以及命中长期为零时的排查顺序。
Grok 提示缓存是怎么工作的
从 xAI 官方文档出发,讲清 Grok 提示缓存的前缀匹配机制、命中与未命中的判定、cached_tokens 字段在三套接口里怎么读、x-grok-conv-id 为什么能提高命中率,以及编辑、删除、重排历史消息为什么会把缓存整段打掉。
Grok 提示缓存最佳实践清单:六条官方建议逐条拆开讲
xAI 官方文档给 Grok 提示缓存列了六条最佳实践,这篇把每一条拆成可执行的动作:会话 ID 怎么传、消息数组为什么只能追加、推理模型多出哪一条硬要求、cached_tokens 从哪个字段读、命中不了该怎么排。附官方 FAQ 里最容易被误解的几个点。
高级调用方式
异步、延迟补全、优先处理、上下文压缩、WebSocket、mTLS——常规 chat 之外的这几种模式各自解决什么问题,什么时候值得切过去。
Grok 的 mTLS 双向认证怎么配:企业网关接入实操
讲清 Grok(xAI)API 的 mTLS 双向认证怎么开通、换哪个端点、客户端证书怎么挂、两道校验分别返回什么错误码、证书轮换要不要联系官方,以及它和 API Key、团队权限、审计日志的关系。只讲机制,不列价格数字。
Grok 上下文压缩机制怎么理解
拆解 Grok 官方文档里的 Context Compaction:它把长对话折叠成一个不透明的 compaction item,保留什么、丢掉什么、什么条件下才该调用、返回的 usage 字段怎么读、接回对话时有哪些官方点名的禁忌,以及它和提示缓存之间到底是什么关系。
Grok 异步请求和延迟补全有什么不同:两种模式怎么选
Grok 的 async 异步请求和 deferred 延迟补全经常被当成一回事,其实一个在客户端并发、一个把请求拆成提交与取回两步。本文按官方文档梳理两者的调用形态、状态码语义、限流归属与适用场景,并给出和 Batch API 的分工判断。
Grok 优先处理是什么:什么时候值得开
Grok 的优先处理(Priority Processing)就是在请求体里加一个 service_tier 字段,把请求排到标准流量前面。这篇讲清它改变的是调度顺序而不是容量保证、响应回执怎么确认是否授予、按更高单价计费的边界在哪,以及哪些调用路径开了才划算。
Grok Batch API 怎么用:适用场景与提交形态
从官方文档出发讲清 Grok Batch API 的两种提交形态(SDK 攒请求与 JSONL 文件上传)、批状态计数器怎么读、结果怎么分页取回、成本字段在哪,以及哪些活值得改走 Batch、哪些不值得。
Grok WebSocket 模式怎么用:长连接续轮与断线重连
Grok 的 Responses API 可以跑在一条长连接上,每轮只发新输入。这篇按官方文档讲清楚 WebSocket 模式的开连接、warmup、previous_response_id 续轮、连接级缓存与 store 的关系,以及两个专属错误码怎么接。
通过云平台接入
除了直连,官方还给了两条云平台路径。企业采购与合规场景下,这两条往往比直连更现实。
通过 Google Cloud Vertex AI 调用 Grok 模型:启用与接入步骤
按 xAI 官方文档梳理 Grok 在 Google Cloud Vertex AI 上的接入路径:前置权限与 ADC 配置、Model Garden 启用步骤、模型 ID 以哪里显示的为准、两种调用形态、端点怎么选,以及从直连 xAI API 迁过来要改哪几处。
通过 Microsoft Foundry 调用 Grok 模型:部署、鉴权与排错
拆解 xAI 官方文档里 Grok 模型在 Microsoft Foundry 上的接入路径:资源与项目怎么建、部署名为什么等于 model 参数、Entra ID 无密钥鉴权怎么配、报错该看哪几个请求 ID,以及从直连 xAI API 迁过来要改哪些地方。
限流、成本与账号
限流字段怎么读、成本按什么维度拆、账单常见问题、团队席位怎么管、数据处理政策怎么看。
Grok 成本追踪怎么做:从单次请求拆到团队账单
Grok(xAI API)的成本追踪分三层:响应自带的 cost_in_usd_ticks 字段、控制台 Usage Explorer 的分组与过滤、Management API 用量接口。本文讲清每层能拆出什么维度、字段在哪、agentic 与流式请求的成本怎么归集。
Grok 的数据处理与安全政策怎么读:从默认保留到 ZDR
逐条拆 xAI 官方安全 FAQ 里关于 Grok API 的数据处理条款:默认审计保留与训练政策的边界、Zero Data Retention 开启后会失效的功能清单、怎么用响应头确认 ZDR 生效、审计日志能查到什么、密钥泄漏的官方处置路径,以及企业合规资质走哪条口子问。
Grok 团队管理与成员权限怎么设
从 xAI Console 的 Personal Team 讲到 Admin 与 Member 的权限边界、成员进出与 API key 归属、邮箱域名自动入队、Management API 建 key 与 ACL 授权,以及审计日志怎么查,帮你把 Grok 团队管理和成员权限一次配对。
Grok 限流字段怎么读、怎么申请提额
Grok 的限流按 RPS 和 TPM 两个维度、逐模型逐团队分配,档位由累计消费自动升。这篇讲清限流字段到底在哪读、哪些 token 会算进 TPM、撞上 429 之后官方给的处理路径,以及官方文档里写明的三条提额途径分别适合谁。
Grok 账单常见问题逐条解答:扣费时点、额度线与发票
把 xAI 官方文档里关于 Grok 账单的问题按排查顺序串了一遍:钱在哪一刻扣、预付点数和月结开票怎么并存、请求被拒到底是额度线还是限流、发票信息填错能不能补救、token 数为什么对不上,以及用哪些接口自己把账拆开看。
Grok API 有没有免费额度?先把能核实的和不能核实的分开
围绕"Grok API 免费额度"这个问题给出诚实答案:官方模型页能核到的是一张按 token 计费的价目表,赠金类活动属于随时变动的运营策略,不该写进技术方案。文章拆解免费额度的四种常见含义、教你自己去控制台核实当前状态、按官方单价算一笔小成本试用账,并说明大陆准入这一关为什么比额度更早决定成败。
Grok API 怎么收费?xAI 各模型 token 单价与成本估算
讲清 Grok API 的计费规则:token 计费单位怎么算、grok-4.3 和 grok-4.20 系列各档单价表、旧版 grok-4 系列价格为什么这篇不引用具体数字、专用代码模型 grok-build-0.1 单价、月成本怎么估算,以及省钱要注意哪几个方向。
能力边界与迁移
结构化输出、推理强度控制、function calling 与工具体系,以及模型退役时官方给的迁移路径。
Grok 结构化输出怎么写:json_schema 与工具调用两条路
Grok 结构化输出有两条路:response_format 传 json_schema,或走工具调用的入参 schema。本文按官方文档梳理支持的 JSON Schema 子集、会被拒掉的写法、pattern 正则的语义差异,以及 parse 与 stream 两种取法怎么选。
Grok 模型退役了怎么迁移:官方给的重定向路径怎么读
xAI 在 2026 年 5 月 15 日退役了一批 Grok 模型,但退役后旧 slug 不会报错而是自动重定向。这篇讲清楚重定向落到哪个模型、推理档位被谁替你选了、账单口径怎么核,以及主动迁移该改哪几个字段。
Grok 推理强度怎么控制:reasoning_effort 四档与推理 token 计费
讲清 Grok 的推理强度控制机制:reasoning.effort 与顶层 reasoning_effort 的优先级、四个档位官方各自的定位、推理无法关闭的说法差异、推理 token 在 usage 里怎么看,以及哪些参数和推理模型不兼容。
Grok function calling 与工具体系怎么用
Grok 的工具体系分成 xAI 服务端自动执行的内置工具和要你自己跑的 function calling 两类,两者混用时的暂停点、max_turns 重置、类型判定字段最容易搞错。本文按 xAI 官方文档梳理工具定义、调用循环、tool_choice、并行调用与用量口径。
想把模型平台的差异挡在业务代码之外?
站内有成体系的 AI 编程与 Agent 工程教程,从接入到成本治理都覆盖。