计费规则
本页是计费口径的完整说明。原则只有一条:价格全公示、按量实耗扣费、每一笔可查。
基本模型
- 充值 1 元 = 余额 1 元,余额永不过期;
- 调用按实际用量从余额扣减,无月费、无最低消费;
- 每一笔扣费都在 控制台 → 用量 逐条可查,支持导出 CSV 对账。
计费公式
单笔费用按模型公示单价与实际用量计算:
token 计费:费用 = 输入单价 × 输入 tokens / 1M
+ 输出单价 × 输出 tokens / 1M
+ 缓存读取单价 × 缓存命中 tokens / 1M(如该模型有缓存价)
媒体计费:费用 = 单价 × 张数(生图)或 秒数(视频)或 次数
缓存计费
支持提示词缓存的模型(如 Claude 系列),命中缓存的输入 tokens 按缓存读取价计费,通常显著低于普通输入价;具体是否支持与单价以该模型文档页为准。usage 中的 cache_read_input_tokens / prompt_tokens_details.cached_tokens 即缓存命中量。
失败不扣费
- HTTP 状态为 4xx / 5xx 的请求(参数错误、鉴权失败、余额不足、限速、上游故障等)一律不扣费;
- 上游临时故障时网关会自动切换线路重试,重试过程不额外计费;全部线路耗尽才返回 502,同样不扣费;
/v1/messages/count_tokens免费,不扣余额、不产生用量记录。
流式请求的计费口径
- 流式请求在流结束后按上游回传的真实 usage 结算,与非流式同价;
- OpenAI 协议下传
stream_options: {"include_usage": true}可在流末拿到与账单一致的 usage;Anthropic 协议的message_delta.usage为累计值; - 流式过程中因异常提前终止时,按实际已产生的 usage 结算;
- 个别上游未回传 usage 时由网关按 tokenizer 估算,并在用量明细中标注「估算」。
余额与 402
- 余额 ≤ 0 时新请求返回 402(
insufficient_quota/billing_error),充值后立即恢复; - 正在进行的最后一笔调用允许把余额扣成小幅负数(单次透支),属正常现象,下次充值时补平;
- 可以为单个 Key 设置额度上限:Key 累计消耗达到上限后返回 429(
key_quota_exceeded),不影响账户其他 Key。
充值与兑换
- 在线充值:控制台 → 充值,支持支付宝 / 微信(聚合支付),最低 1 元;
- 兑换码:充值页右侧输入兑换码即时到账;
- 企业对公 / 开票:邮件联系 [email protected],按月度消耗对账后统一处理。
价格调整说明
模型价格可能随上游调价而调整,调整只影响调整之后的调用;已充值余额的价值不受影响。重要调价会提前在站内公告。