token这么贵它是怎么计算的
对于我这种AI的重度使用者来说,token的usage就是我的命哈哈哈哈。这么说可能有点儿夸张哈,不过确实每天我都时不时的看一下我的usage。不过claude code网页上只有总额度的limit usage,如果想看详细一点的usage,可以使用claude code的命令usage->stats->两种模式选择一种是基于overview对于整体情况的一些总结,另外一种是基于model的细节,主要是token input、output以及多少token命中了缓存。

目前上班的话我会使用公司配置的anthropic下面的模型,下了班之后我会使用DeepSeek【深度求索】下的模型。
我将会用这两个模型来计算我的token使用额度的,但是无论使用哪个厂商的模型都需要遵循下列的token计算公式单次请求费用 = (基础输入Token数 × 输入单价) + (缓存写入Token数 × 缓存写入单价) + (缓存读取Token数 × 缓存读取单价) + (输出Token数 × 输出单价)。
计费项
主要分为输入、输出以及缓存存储,做过深度学习的朋友应该很清楚,第一步是prefill、第二步才是训练【或预测】、在LLM时代为了节约token加入了输入的缓存。下图简要说明了一个词条从输入到输出的整个过程,也能解释为什么输入比输出便宜,输入部分都是词条的各种处理,并且还可以并行计算,但是输出部分只能单个单个预测词条,而且词条的前后输出也是有联系的。
除此之外中英文的输入输出也会占不同步的token数量,这个在模型的选择的时候也要注意。比如中文输入的时候可能选择中文模型,然后英文为核心数据的模型可以选择国外的模型。
Anthropic
计费规则
以当前主流模型为例,不同模型的单价差异和缓存带来的价格变化如下:
| 模型 | 基础输入 (每百万Token) | 缓存写入 (5分钟) | 缓存读取 | 输出 (每百万Token) |
|---|---|---|---|---|
| Claude Opus 5 | $5 | $6.25 | $0.50 | $25 |
| Claude Sonnet 5 | $2 | $2.50 | $0.20 | $10 |
| Claude Haiku 4.5 | $1 | $1.25 | $0.10 | $5 |
从表中可以看出两个关键点:
- 模型决定基础单价:Opus、Sonnet、Haiku 的输入/输出单价依次递减,差距可达数倍。
- 缓存决定输入Token的实际成本:
- 缓存写入:首次创建缓存时,价格是基础输入价的 1.25倍
- 缓存读取:后续命中缓存时,价格仅为基础输入价的 **10%**(即0.1倍)
DeepSeek
📊 DeepSeek 最新价格(2026年9月10日12:00起生效)
| 模型 | 时段 | 输入 (缓存命中) | 输入 (缓存未命中) | 输出 |
|---|---|---|---|---|
| deepseek-flash | 空闲时段 | 0.02 元 | 1 元 | 4 元 |
| 高峰时段 | 0.04 元 | 2 元 | 8 元 | |
| deepseek-v4-pro | 空闲时段 | 0.15 元 | 4.5 元 | 13.5 元 |
| 高峰时段 | 0.30 元 | 9 元 | 27 元 |
🧮 举例说明
假设使用 Claude Sonnet 5 发送一个请求,包含 50,000 个输入Token,其中 40,000 个命中了缓存,输出 5,000 个Token。费用计算如下:
- 基础输入:10,000 Token × $2/百万 = $0.02
- 缓存读取:40,000 Token × $0.20/百万 = $0.008
- 输出:5,000 Token × $10/百万 = $0.05
- 单次请求总计:$0.02 + $0.008 + $0.05 = $0.078
如果同样的请求没有命中缓存,那么全部50,000个输入Token都按基础价计算,费用会变成:
- 输入:50,000 × $2/百万 = $0.10
- 输出:**$0.05**
- 总计:**$0.15**
可以看到,仅仅因为缓存命中,这次请求的成本就降低了约**48%**。但是也不能只看命中缓存的时候给我们带来的优惠,写入缓存的时候会比我们单单只使用输入和输出要有一笔额外的支出。这笔投资不一定都会给我们带来收益,这一点是需要我们提前考虑的,日常的使用场景是否会很多的重复场景。
如何节约token
随随便几块钱就花出去了,100万token1块钱就出去。按照我现在的使用我来总结一些不会浪费token的方向。
- 不要盲目的使用词条压缩工具,词条虽然被压缩了但是缓存的命中降低了之后,每次操作如果都未命中缓存成本也是大批量上升的
- 提前写好plan,将loop工作放到晚上,低谷时段运行任务
- 根据模型语言特性,使用对应模型,比如中文便宜的可以使用一些中文模型,如果是英文场景偏多,就使用英文为核心的模型
- 注意上下文窗口不要太大,一次输入的token太多成本也会增加较多,对于模型的推理能力也会有一定的影响
- 合理使用不同的类型的模型
后续
对于上面的建议 我后续会用真实的数据做出实验来看看token在上面这些情况下消耗情况的对比。
- Title: token这么贵它是怎么计算的
- Author: Xiao Qiang
- Created at : 2026-09-11 12:36:33
- Updated at : 2026-09-11 13:19:26
- Link: http://fdslk.github.io/LLM/2026/09/11/how-token-is-priced/
- License: This work is licensed under CC BY-NC-SA 4.0.