中转站的账单是怎么算出来的:额度、倍率与分组一次讲清
不背话术,只讲五个数。看完你能自己把任意一个模型的价格算到分,并且能对上控制台的扣费。
数据采集 2026-08-20 · 来源 https://api.tutujin.com/api/pricing 与 /api/status
一次调用扣多少额度,只由五个数决定:额度换算(1 美元额度 = 500000 quota)、输入倍率 model_ratio(×2 就是每百万输入 token 的美元价)、输出倍率 completion_ratio(输出价 = 输入价 × 它)、缓存折扣 cache_ratio,以及分组系数 group_ratio。
这五个数在 https://api.tutujin.com/api/pricing 上全部公开、无需登录即可读取。很多人被「悄悄改倍率」坑过,不是因为倍率藏起来了,而是没人告诉过他去哪看、怎么算。这一页就是教你自己算,一直算到能对上账单为止。
一、先记住这个换算:1 美元额度 = 500000 quota
控制台里的余额、日志里的扣费,底层单位都是 quota(一个无量纲的整数),不是美元也不是人民币。换算关系写在 /api/status 里:
| 字段 | 值 | 含义 |
|---|---|---|
quota_per_unit | 500000 | 500000 quota = 1 美元额度 |
price | 4 | 1 美元额度的人民币售价(元) |
quota_display_type | USD | 控制台默认按美元显示余额 |
所以三个单位之间是这样串起来的:
1 美元额度 = 500000 quota = 4 元人民币(用量大时可低至 2.5 元)
1 quota = 0.000002 美元额度 = 0.000008 元
不同充值渠道单价不同:微信 / 支付宝为 ¥4,Stripe 渠道为 ¥8(站点运行时配置 stripe_unit_price=8);参考真实汇率约 7.3,故「低于官方」只在人民币渠道成立。下单前请以充值页当时显示的单价为准,本页不替任何渠道下结论。
二、按 token 计费:model_ratio × 2 就是每百万输入 token 的美元价
当一个模型的 quota_type = 0 时,它按 token 计费。这时你要看两个倍率:
| 字段 | 含义 | 换算公式 |
|---|---|---|
model_ratio | 输入倍率 | 输入价(美元/百万 token)= model_ratio × 2 |
completion_ratio | 输出倍率 | 输出价 = 输入价 × completion_ratio |
cache_ratio | 缓存折扣 | 命中缓存的输入价 = 输入价 × cache_ratio |
quota_type | 计费方式 | 0 = 按 token;1 = 按次 |
model_price | 每次调用价 | 仅当 quota_type = 1 时有效,单位美元 |
为什么是「×2」?因为 model_ratio 的基准是每 1000 token 0.002 美元,也就是每百万 token 2 美元。倍率 1 就是 2 美元/百万,倍率 1.25 就是 2.5 美元/百万,以此类推。
拿 gpt-4o 走一遍:接口里它是 model_ratio = 1.25、completion_ratio = 4、cache_ratio = 0.5。
输入价 = 1.25 × 2 = $2.50 / 1M tokens → ¥10.00 / 1M
输出价 = 2.50 × 4 = $10.00 / 1M tokens → ¥40.00 / 1M
缓存输入 = 2.50 × 0.5 = $1.25 / 1M tokens → ¥5.00 / 1M
这里要说清楚的是机制:model_ratio 是公开的,所以「有没有在 token 单价上二次加价」这件事你可以自己两分钟验完——把算出来的 $2.50 / $10.00 拿去和 OpenAI 官网当期定价页比一比,对得上就是没加价,对不上就是加了。本页不复制厂商价格(厂商随时会调,复制过来就会过期)。真正产生价差的是「1 美元额度卖多少人民币」这一层,而不是「一个 token 算你几美元」这一层。
三、按次计费(quota_type = 1):一次调用一个固定价
生图、视频、以及一部分聚合通道走的是按次计费。这时 model_ratio 与 completion_ratio 都是 0,真正生效的是 model_price,单位是美元/次:
| 模型 | model_price($/次) | 折合人民币 |
|---|---|---|
gpt-image-2 | 0.04 | ¥0.16 / 张 |
dall-e-3 | 0.03 | ¥0.12 / 张 |
nano-banana-2 | 0.15 | ¥0.60 / 张 |
grok-4 | 0.02 | ¥0.08 / 次 |
按次计费的意义是:账单与上下文长度无关。一次调用塞 500 token 还是 50000 token,扣的都是同一个数。反过来说,短请求用按次计费的通道就是亏的。选型前先看清 quota_type,别拿两种计费方式直接比大小。
四、cache_ratio:重复的前缀便宜多少
提示缓存命中时,命中那部分输入按 cache_ratio 打折。常见值:
| 模型 | cache_ratio | 命中后的输入价 |
|---|---|---|
gpt-4o / gpt-4o-mini | 0.5 | 五折 |
gpt-4.1 | 0.25 | 两五折 |
gpt-5 | 0.1 | 一折 |
claude-3-7-sonnet-20250219 等 Claude 系 | 0.1 | 一折 |
deepseek-chat | 0.25 | 两五折 |
做长 system prompt、RAG 固定前缀、多轮对话的场景,这一栏对总账的影响常常比模型单价本身还大。是否命中由上游模型的缓存机制决定,不是中转层能替你保证的事。
五、group_ratio:分组会给整份账单乘一个系数
每个令牌属于一个分组,分组带一个整体系数。/api/pricing 返回的 group_ratio 当前是:
| 分组 | group_ratio | 说明 |
|---|---|---|
default | 1 | 默认分组,新注册即在此 |
vip / svip | 1 | 模型可用范围不同,系数相同 |
image | 1 | 生图分组 |
cc | 1.2 | Claude 分组,整体贵 20%,但独占最新一代 Claude 模型 |
最终账单可以写成一个式子:
按 token:扣费 = (输入 token × 输入价 + 输出 token × 输出价) × group_ratio
按 次 :扣费 = model_price × 次数 × group_ratio
关于分组还有一条必须照直说:cc 分组怎么获得,公开数据里查不到。本页不做任何推断,需要的话请联系客服确认。至于哪些模型只在 cc 分组,见Claude Code 那一页的分组可用性表。
六、三个可以自己验算的例子
下面三行都是 default 分组(group_ratio = 1)的真实数据,人民币按 1 美元额度 = ¥4 折算:
| 模型 | model_ratio | completion_ratio | 输入 $/1M | 输出 $/1M | 输入 ¥/1M | 输出 ¥/1M |
|---|---|---|---|---|---|---|
gpt-4o-mini | 0.075 | 4 | 0.15 | 0.60 | ¥0.60 | ¥2.40 |
gpt-4o | 1.25 | 4 | 2.50 | 10.00 | ¥10.00 | ¥40.00 |
claude-sonnet-4-5-20250929 | 1.5 | 5 | 3.00 | 15.00 | ¥12.00 | ¥60.00 |
举个能算到分的例子。用 claude-sonnet-4-5-20250929 跑一次「2 万 token 输入 + 2 千 token 输出」的代码任务:
输入:20000 / 1000000 × $3.00 = $0.06 → ¥0.24
输出: 2000 / 1000000 × $15.00 = $0.03 → ¥0.12
合计:$0.09 = 45000 quota → ¥0.36
把 quota 数拿去和控制台日志里的扣费对一下,对得上,说明你已经完全读懂这套账了。
七、「1 美元 = 4 元」到底算不算五折
把这句话拆开看:站内 1 美元额度卖 4 元,而同期接口里给出的参考汇率是 1 美元 ≈ 7.3 元。
4 ÷ 7.3 ≈ 0.548 → 约相当于按官方美元价的 55% 付费
所以「约五折」这个说法,成立的前提是:这个模型的 token 单价与厂商官方标价一致。这个前提成不成立,请拿上面第六节算出的数字去厂商官网当期定价页自己比一遍(gpt-4o、gpt-4o-mini、claude-sonnet-4-5 这几档最值得比)。别听我们说,两分钟的事。而且——
八、诚实提醒:不是所有模型都比官方便宜
这是本页最想让你记住的一段。定价表共 297 条,default 分组占 284 条,其中有 112 条的 model_ratio 就是 30(折合输入 60 美元/百万 token)。这个 30 是网关的默认占位值,代表这条模型没有被认真配过价,不是真实报价。真实的反例还有:
| 模型 | 本站价($/1M 输入 · 输出) | 说明 |
|---|---|---|
deepseek-v3 / deepseek-chat | 1.60 / 1.60 | 国产模型务必对照厂商官网当期价格再决定——直连常更划算,且模型名与版本的对应关系变化很快 |
glm-4 | 60.00 / 60.00 | ratio = 30 的未配置占位,不要用 |
gemini-3.1-pro-preview | 75.00 / 300.00 | 是同代 gemini-3-pro($2 / $12)的 37.5 倍,价格异常,下单前务必核对 |
net-* 系列、大量 -all 后缀条目 | 多为 60 / 300 或 60 / 1800 | 占位价或聚合通道,选型前务必自己核 |
结论要说得明白:「约五折」只适用于 OpenAI、Anthropic、Google 的主力型号。任何「全线便宜 N 倍」的说法都不要信——包括从我们自己这里听到的。用上面的公式,花两分钟自己核一遍你要用的那个模型。
九、怎么自己核对:三步
- 浏览器直接打开 https://api.tutujin.com/api/pricing(公开 JSON,不用登录、不用 key)。
- 在
data数组里搜你的model_name,读出quota_type、model_ratio、completion_ratio、cache_ratio、enable_groups。 - 按本页公式算出单价,再与控制台「日志」里那次调用的实际扣费 quota 对账。
想更省事,可以写个几行的脚本定时抓这个接口存快照,任何倍率变化都能 diff 出来:
curl -s https://api.tutujin.com/api/pricing \
| python3 -c "import sys,json;d=json.load(sys.stdin)['data'];\
print([m for m in d if m['model_name']=='gpt-4o'])"
常见问题
都说中转并不便宜,往往是 1 元 = 1 美元,你们是多少?
额度换算是 1 美元额度 = 4 元人民币(用量大时可低至 2.5 元),对应接口字段 price=4、quota_per_unit=500000。模型自身的单价在 /api/pricing 公开,可按本页公式核算。不同充值渠道单价不同:微信 / 支付宝为 ¥4,Stripe 渠道为 ¥8(站点运行时配置 stripe_unit_price=8);参考真实汇率约 7.3,故「低于官方」只在人民币渠道成立,下单前以充值页显示为准。
中转站会不会悄悄改倍率不通知?我怎么第一时间发现?
能给你的确定答案只有一条:所有倍率都在公开接口上,你可以随时抓取、可以 diff、可以在下单前核。至于「变更是否会主动通知」,本页不做承诺,请联系客服确认——这是运营政策问题,不是技术问题,我们不替它打包票。
按次计费和按 token 计费,哪个划算?
看你的上下文长度。长上下文任务(贴大段代码、长文档)按次计费更划算;短请求高频调用按 token 更划算。判断依据只有一个:先看 quota_type,再按本页公式算你自己的典型请求。
缓存折扣什么时候会生效?
由上游模型的提示缓存机制决定,通常需要足够长且完全相同的前缀被重复发送。中转层不能替你保证命中,但一旦命中,账单里的输入部分就按该模型的 cache_ratio 打折。
是不是所有模型都比官方便宜?
不是。见上面第八节的反例表:占位价条目、部分国产模型、部分未更新倍率的预览版模型,都可能比找厂商直连更贵。请按公式自己核一遍再决定。