土土金 Tutujin API › 计费拆解

中转站的账单是怎么算出来的:额度、倍率与分组一次讲清

不背话术,只讲五个数。看完你能自己把任意一个模型的价格算到分,并且能对上控制台的扣费。

数据采集 2026-08-20 · 来源 https://api.tutujin.com/api/pricing 与 /api/status

先给结论

一次调用扣多少额度,只由五个数决定:额度换算(1 美元额度 = 500000 quota)、输入倍率 model_ratio(×2 就是每百万输入 token 的美元价)、输出倍率 completion_ratio(输出价 = 输入价 × 它)、缓存折扣 cache_ratio,以及分组系数 group_ratio

这五个数在 https://api.tutujin.com/api/pricing全部公开、无需登录即可读取。很多人被「悄悄改倍率」坑过,不是因为倍率藏起来了,而是没人告诉过他去哪看、怎么算。这一页就是教你自己算,一直算到能对上账单为止。

一、先记住这个换算:1 美元额度 = 500000 quota

控制台里的余额、日志里的扣费,底层单位都是 quota(一个无量纲的整数),不是美元也不是人民币。换算关系写在 /api/status 里:

字段含义
quota_per_unit500000500000 quota = 1 美元额度
price41 美元额度的人民币售价(元)
quota_display_typeUSD控制台默认按美元显示余额

所以三个单位之间是这样串起来的:

1 美元额度 = 500000 quota = 4 元人民币(用量大时可低至 2.5 元)
1 quota    = 0.000002 美元额度 = 0.000008 元

不同充值渠道单价不同:微信 / 支付宝为 ¥4,Stripe 渠道为 ¥8(站点运行时配置 stripe_unit_price=8);参考真实汇率约 7.3,故「低于官方」只在人民币渠道成立。下单前请以充值页当时显示的单价为准,本页不替任何渠道下结论。

二、按 token 计费:model_ratio × 2 就是每百万输入 token 的美元价

当一个模型的 quota_type = 0 时,它按 token 计费。这时你要看两个倍率:

字段含义换算公式
model_ratio输入倍率输入价(美元/百万 token)= model_ratio × 2
completion_ratio输出倍率输出价 = 输入价 × completion_ratio
cache_ratio缓存折扣命中缓存的输入价 = 输入价 × cache_ratio
quota_type计费方式0 = 按 token;1 = 按次
model_price每次调用价仅当 quota_type = 1 时有效,单位美元

为什么是「×2」?因为 model_ratio 的基准是每 1000 token 0.002 美元,也就是每百万 token 2 美元。倍率 1 就是 2 美元/百万,倍率 1.25 就是 2.5 美元/百万,以此类推。

gpt-4o 走一遍:接口里它是 model_ratio = 1.25completion_ratio = 4cache_ratio = 0.5

输入价 = 1.25 × 2            = $2.50 / 1M tokens  →  ¥10.00 / 1M
输出价 = 2.50 × 4            = $10.00 / 1M tokens →  ¥40.00 / 1M
缓存输入 = 2.50 × 0.5        = $1.25 / 1M tokens  →  ¥5.00  / 1M

这里要说清楚的是机制model_ratio 是公开的,所以「有没有在 token 单价上二次加价」这件事你可以自己两分钟验完——把算出来的 $2.50 / $10.00 拿去和 OpenAI 官网当期定价页比一比,对得上就是没加价,对不上就是加了。本页不复制厂商价格(厂商随时会调,复制过来就会过期)。真正产生价差的是「1 美元额度卖多少人民币」这一层,而不是「一个 token 算你几美元」这一层。

三、按次计费(quota_type = 1):一次调用一个固定价

生图、视频、以及一部分聚合通道走的是按次计费。这时 model_ratiocompletion_ratio 都是 0,真正生效的是 model_price,单位是美元/次:

模型model_price($/次)折合人民币
gpt-image-20.04¥0.16 / 张
dall-e-30.03¥0.12 / 张
nano-banana-20.15¥0.60 / 张
grok-40.02¥0.08 / 次

按次计费的意义是:账单与上下文长度无关。一次调用塞 500 token 还是 50000 token,扣的都是同一个数。反过来说,短请求用按次计费的通道就是亏的。选型前先看清 quota_type,别拿两种计费方式直接比大小。

四、cache_ratio:重复的前缀便宜多少

提示缓存命中时,命中那部分输入按 cache_ratio 打折。常见值:

模型cache_ratio命中后的输入价
gpt-4o / gpt-4o-mini0.5五折
gpt-4.10.25两五折
gpt-50.1一折
claude-3-7-sonnet-20250219 等 Claude 系0.1一折
deepseek-chat0.25两五折

做长 system prompt、RAG 固定前缀、多轮对话的场景,这一栏对总账的影响常常比模型单价本身还大。是否命中由上游模型的缓存机制决定,不是中转层能替你保证的事。

五、group_ratio:分组会给整份账单乘一个系数

每个令牌属于一个分组,分组带一个整体系数。/api/pricing 返回的 group_ratio 当前是:

分组group_ratio说明
default1默认分组,新注册即在此
vip / svip1模型可用范围不同,系数相同
image1生图分组
cc1.2Claude 分组,整体贵 20%,但独占最新一代 Claude 模型

最终账单可以写成一个式子:

按 token:扣费 = (输入 token × 输入价 + 输出 token × 输出价) × group_ratio
按 次  :扣费 = model_price × 次数 × group_ratio

关于分组还有一条必须照直说:cc 分组怎么获得,公开数据里查不到。本页不做任何推断,需要的话请联系客服确认。至于哪些模型只在 cc 分组,见Claude Code 那一页的分组可用性表

六、三个可以自己验算的例子

下面三行都是 default 分组(group_ratio = 1)的真实数据,人民币按 1 美元额度 = ¥4 折算:

模型model_ratiocompletion_ratio输入 $/1M输出 $/1M输入 ¥/1M输出 ¥/1M
gpt-4o-mini0.07540.150.60¥0.60¥2.40
gpt-4o1.2542.5010.00¥10.00¥40.00
claude-sonnet-4-5-202509291.553.0015.00¥12.00¥60.00

举个能算到分的例子。用 claude-sonnet-4-5-20250929 跑一次「2 万 token 输入 + 2 千 token 输出」的代码任务:

输入:20000 / 1000000 × $3.00  = $0.06   →  ¥0.24
输出: 2000 / 1000000 × $15.00 = $0.03   →  ¥0.12
合计:$0.09 = 45000 quota      →  ¥0.36

把 quota 数拿去和控制台日志里的扣费对一下,对得上,说明你已经完全读懂这套账了。

七、「1 美元 = 4 元」到底算不算五折

把这句话拆开看:站内 1 美元额度卖 4 元,而同期接口里给出的参考汇率是 1 美元 ≈ 7.3 元。

4 ÷ 7.3 ≈ 0.548  →  约相当于按官方美元价的 55% 付费

所以「约五折」这个说法,成立的前提是:这个模型的 token 单价与厂商官方标价一致。这个前提成不成立,请拿上面第六节算出的数字去厂商官网当期定价页自己比一遍(gpt-4o、gpt-4o-mini、claude-sonnet-4-5 这几档最值得比)。别听我们说,两分钟的事。而且——

八、诚实提醒:不是所有模型都比官方便宜

这是本页最想让你记住的一段。定价表共 297 条,default 分组占 284 条,其中有 112 条的 model_ratio 就是 30(折合输入 60 美元/百万 token)。这个 30 是网关的默认占位值,代表这条模型没有被认真配过价,不是真实报价。真实的反例还有:

模型本站价($/1M 输入 · 输出)说明
deepseek-v3 / deepseek-chat1.60 / 1.60国产模型务必对照厂商官网当期价格再决定——直连常更划算,且模型名与版本的对应关系变化很快
glm-460.00 / 60.00ratio = 30 的未配置占位,不要用
gemini-3.1-pro-preview75.00 / 300.00是同代 gemini-3-pro($2 / $12)的 37.5 倍,价格异常,下单前务必核对
net-* 系列、大量 -all 后缀条目多为 60 / 300 或 60 / 1800占位价或聚合通道,选型前务必自己核

结论要说得明白:「约五折」只适用于 OpenAI、Anthropic、Google 的主力型号。任何「全线便宜 N 倍」的说法都不要信——包括从我们自己这里听到的。用上面的公式,花两分钟自己核一遍你要用的那个模型。

九、怎么自己核对:三步

  1. 浏览器直接打开 https://api.tutujin.com/api/pricing(公开 JSON,不用登录、不用 key)。
  2. data 数组里搜你的 model_name,读出 quota_typemodel_ratiocompletion_ratiocache_ratioenable_groups
  3. 按本页公式算出单价,再与控制台「日志」里那次调用的实际扣费 quota 对账。

想更省事,可以写个几行的脚本定时抓这个接口存快照,任何倍率变化都能 diff 出来:

curl -s https://api.tutujin.com/api/pricing \
  | python3 -c "import sys,json;d=json.load(sys.stdin)['data'];\
print([m for m in d if m['model_name']=='gpt-4o'])"

常见问题

都说中转并不便宜,往往是 1 元 = 1 美元,你们是多少?

额度换算是 1 美元额度 = 4 元人民币(用量大时可低至 2.5 元),对应接口字段 price=4quota_per_unit=500000。模型自身的单价在 /api/pricing 公开,可按本页公式核算。不同充值渠道单价不同:微信 / 支付宝为 ¥4,Stripe 渠道为 ¥8(站点运行时配置 stripe_unit_price=8);参考真实汇率约 7.3,故「低于官方」只在人民币渠道成立,下单前以充值页显示为准。

中转站会不会悄悄改倍率不通知?我怎么第一时间发现?

能给你的确定答案只有一条:所有倍率都在公开接口上,你可以随时抓取、可以 diff、可以在下单前核。至于「变更是否会主动通知」,本页不做承诺,请联系客服确认——这是运营政策问题,不是技术问题,我们不替它打包票。

按次计费和按 token 计费,哪个划算?

看你的上下文长度。长上下文任务(贴大段代码、长文档)按次计费更划算;短请求高频调用按 token 更划算。判断依据只有一个:先看 quota_type,再按本页公式算你自己的典型请求。

缓存折扣什么时候会生效?

由上游模型的提示缓存机制决定,通常需要足够长且完全相同的前缀被重复发送。中转层不能替你保证命中,但一旦命中,账单里的输入部分就按该模型的 cache_ratio 打折。

是不是所有模型都比官方便宜?

不是。见上面第八节的反例表:占位价条目、部分国产模型、部分未更新倍率的预览版模型,都可能比找厂商直连更贵。请按公式自己核一遍再决定。