UnioAPI 文档
平台指南

计费与用量

按量计费的口径,以及账单里最常见的几个疑问。

计费口径

  • 按实际用量计费:输入与输出 token 按模型分别计价,各模型价格见官网 模型与定价页。
  • 每一次真实的模型调用都会生成一条请求记录,账单以请求记录为准。
  • 价格随上游成本浮动,最终以工作台账单为准。

常见疑问

只发了一条消息,为什么账单里有多条请求?

Agent 类工具的一次操作背后往往是多次真实的模型调用:理解任务、读取文件、规划修改、 工具执行后再次调用……部分客户端还会自动重试或把长任务拆成多个请求。 你看到的是一次操作,计费系统记录的是它背后实际发生的每一次调用。

请求 Fast 档为什么有时按 Standard 计费?

Fast(service_tier: "fast" / "priority")是处理与计费档位,不是独立模型。 Standard 与 Fast 各自有独立的单价,按同一次成功响应中上游实际返回的档位结算: 请求了 Fast 但上游按 default 服务时,该请求按 Standard 价格计费。 响应中的 service_tier 字段反映实际档位。

失败或重试的请求会计费吗?

费用取决于上游是否实际消耗了 token:

  • 在进入模型调用前被拒绝的请求(如 401、402、404、429、参数 400)不产生消耗;
  • 流式中断等场景按已实际发生的用量结算,最终以账单的用量明细为准。

为什么用量比预期高?

常见原因:使用的模型单价较高;客户端在可见操作之外发起了隐藏调用; 输出(含推理)token 高于预期;会话越长、附带的上下文越多。

降低用量的建议:

  • 旧上下文不再需要时开启新会话;
  • 简单任务换用小模型(如 gpt-5.6-luna、claude-haiku-4.5);
  • 避免让 Agent 无必要地读取整个项目。

余额相关的错误码

状态码含义处理
402账面余额耗尽或消费上限已达前往工作台充值
429(带 Retry-After: 1)余额为正,但可用额度被在途请求临时冻结稍后重试即可

何时联系支持

出现以下情况时,请携带请求时间、模型 ID 与响应头 X-Request-ID 联系 [email protected]:

  • 出现你没有发起的请求;
  • 账单中的模型与你配置的明显不符;
  • 实际扣费与用量明细差距异常。

本页目录