平台指南
计费与用量
按量计费的口径,以及账单里最常见的几个疑问。
计费口径
- 按实际用量计费:输入与输出 token 按模型分别计价,各模型价格见官网 模型与定价页。
- 每一次真实的模型调用都会生成一条请求记录,账单以请求记录为准。
- 价格随上游成本浮动,最终以工作台账单为准。
常见疑问
只发了一条消息,为什么账单里有多条请求?
Agent 类工具的一次操作背后往往是多次真实的模型调用:理解任务、读取文件、规划修改、 工具执行后再次调用……部分客户端还会自动重试或把长任务拆成多个请求。 你看到的是一次操作,计费系统记录的是它背后实际发生的每一次调用。
请求 Fast 档为什么有时按 Standard 计费?
Fast(service_tier: "fast" / "priority")是处理与计费档位,不是独立模型。
Standard 与 Fast 各自有独立的单价,按同一次成功响应中上游实际返回的档位结算:
请求了 Fast 但上游按 default 服务时,该请求按 Standard 价格计费。
响应中的 service_tier 字段反映实际档位。
失败或重试的请求会计费吗?
费用取决于上游是否实际消耗了 token:
- 在进入模型调用前被拒绝的请求(如 401、402、404、429、参数 400)不产生消耗;
- 流式中断等场景按已实际发生的用量结算,最终以账单的用量明细为准。
为什么用量比预期高?
常见原因:使用的模型单价较高;客户端在可见操作之外发起了隐藏调用; 输出(含推理)token 高于预期;会话越长、附带的上下文越多。
降低用量的建议:
- 旧上下文不再需要时开启新会话;
- 简单任务换用小模型(如
gpt-5.6-luna、claude-haiku-4.5); - 避免让 Agent 无必要地读取整个项目。
余额相关的错误码
| 状态码 | 含义 | 处理 |
|---|---|---|
| 402 | 账面余额耗尽或消费上限已达 | 前往工作台充值 |
429(带 Retry-After: 1) | 余额为正,但可用额度被在途请求临时冻结 | 稍后重试即可 |
何时联系支持
出现以下情况时,请携带请求时间、模型 ID 与响应头 X-Request-ID 联系
[email protected]:
- 出现你没有发起的请求;
- 账单中的模型与你配置的明显不符;
- 实际扣费与用量明细差距异常。