文档目录

计费规则

更新于 2026-08-27

本页是计费口径的完整说明。原则只有一条:价格全公示、按量实耗扣费、每一笔可查

基本模型

  • 充值 1 元 = 余额 1 元,余额永不过期
  • 调用按实际用量从余额扣减,无月费、无最低消费;
  • 每一笔扣费都在 控制台 → 用量 逐条可查,支持导出 CSV 对账。

计费公式

单笔费用按模型公示单价与实际用量计算:

token 计费:费用 = 输入单价 × 输入 tokens / 1M
              + 输出单价 × 输出 tokens / 1M
              + 缓存读取单价 × 缓存命中 tokens / 1M(如该模型有缓存价)

媒体计费:费用 = 单价 × 张数(生图)或 秒数(视频)或 次数
  • 各模型单价见价格页与各模型文档页,页面展示价即实际结算价,无隐藏加价;
  • 企业与大客户可申请专属折扣价(详见价格页 B 端说明);
  • 单笔金额向上取整到 0.000001 元(百万分之一元)精度。

缓存计费

支持提示词缓存的模型(如 Claude 系列),命中缓存的输入 tokens 按缓存读取价计费,通常显著低于普通输入价;具体是否支持与单价以该模型文档页为准。usage 中的 cache_read_input_tokens / prompt_tokens_details.cached_tokens 即缓存命中量。

失败不扣费

  • HTTP 状态为 4xx / 5xx 的请求(参数错误、鉴权失败、余额不足、限速、上游故障等)一律不扣费
  • 上游临时故障时网关会自动切换线路重试,重试过程不额外计费;全部线路耗尽才返回 502,同样不扣费;
  • /v1/messages/count_tokens 免费,不扣余额、不产生用量记录。

流式请求的计费口径

  • 流式请求在流结束后按上游回传的真实 usage 结算,与非流式同价;
  • OpenAI 协议下传 stream_options: {"include_usage": true} 可在流末拿到与账单一致的 usage;Anthropic 协议的 message_delta.usage 为累计值;
  • 流式过程中因异常提前终止时,按实际已产生的 usage 结算;
  • 个别上游未回传 usage 时由网关按 tokenizer 估算,并在用量明细中标注「估算」。

余额与 402

  • 余额 ≤ 0 时新请求返回 402(insufficient_quota / billing_error),充值后立即恢复;
  • 正在进行的最后一笔调用允许把余额扣成小幅负数(单次透支),属正常现象,下次充值时补平;
  • 可以为单个 Key 设置额度上限:Key 累计消耗达到上限后返回 429(key_quota_exceeded),不影响账户其他 Key。

充值与兑换

  • 在线充值:控制台 → 充值,支持支付宝 / 微信(聚合支付),最低 1 元;
  • 兑换码:充值页右侧输入兑换码即时到账;
  • 企业对公 / 开票:邮件联系 [email protected],按月度消耗对账后统一处理。

价格调整说明

模型价格可能随上游调价而调整,调整只影响调整之后的调用;已充值余额的价值不受影响。重要调价会提前在站内公告。