主题
Token 与计费单位
一句话
Token 是模型读字、写字的"最小计量单位",本站所有费用都按 token 算。 看懂这一页,你就明白账单上的数字是怎么来的。
🧩 Token 到底是什么
你给模型发的每一句话、模型回你的每一段字,进到模型里都会先被切成一小块一小块,每一块就叫一个 token。
"token" 中文怎么叫
国内现在多把 token 译作 「词元」(也有叫「标记」「词块」的),各大厂商的中文文档里基本都用"词元"这个词。所以你看到"词元数""按词元计费""词元上限",说的都是 token,是同一个东西。
打个比方:token(词元)之于模型,就像"字"之于我们——但它切得比"字"更碎一点,有时一个词是一个 token,有时一个长单词会被拆成两三个 token。
你不需要自己去数 token,只要知道:字越多 = token 越多 = 花得越多。
大概多少字算一个 token
只是直觉级参考,别当精确公式:
| 内容 | 大概的 token 量 |
|---|---|
| 1000 个英文单词 | ≈ 1300–1500 token |
| 1000 个汉字 | ≈ 1500–2000 token |
| 一条普通的微信消息(二三十字) | 几十个 token |
| 一篇千字短文 | 一两千 token |
中文通常比英文"更费 token"一点,因为中文字符切得更碎。
↔️ Input 和 Output 是两笔账
一次调用其实分两段,分开计价:
| 名称 | 是什么 | 谁产生的 |
|---|---|---|
| Input token(输入) | 你发过去的内容——问题、对话历史、贴进去的文件、系统提示词全算 | 你 |
| Output token(输出) | 模型生成回给你的内容 | 模型 |
Output 通常比 Input 贵 3–5 倍
绝大多数模型,生成一个字的成本远高于读一个字,所以 output 单价往往是 input 的好几倍。
这带来一个很实用的省钱直觉:"长问题 + 短回答" 比 "短问题 + 长回答" 便宜得多。让模型啰嗦输出,比让它读一大段资料更烧钱。
🗄️ 还有一类:缓存 token(重复内容更便宜)
有些模型支持提示缓存(prompt caching):如果你多次调用里有一大段完全相同的开头(比如固定的系统提示词、反复带上的长文档),模型可以把这段"记住",后续命中时这部分按折扣价计,省钱又省时间。
它把 token 又细分出两笔:
| 名称 | 是什么 | 计价 |
|---|---|---|
| 缓存写入(cache write) | 第一次把这段内容存进缓存 | 比普通输入略贵一点(要额外存一份) |
| 缓存读取(cache read / 命中) | 后续调用命中了缓存的这段 | 比普通输入便宜很多(常见只要一到两成) |
所以完整地看,一次调用的 token 可能落在四类里:输入、输出、缓存写入、缓存读取。普通用户不用刻意管缓存——命中时账单自然更便宜;想理解每类差多少钱,见 倍率与计费公式 § 四种计量的单价。
缓存不用你手动开(多数情况)
OpenAI 兼容路径下缓存多为上游自动生效,不需要你配置;Anthropic 原生路径部分场景要在请求里标记要缓存的部分。命中与否、省了多少,以控制台日志 / 上游返回的 usage 为准(详见 进阶技巧)。
🧮 费用怎么算出来的
每次调用的扣费,完整地写是四类各算各的:
这次花的钱 = 输入 token × 输入单价 + 输出 token × 输出单价
+ 缓存写入 token × 写入单价 + 缓存读取 token × 读取单价(命中时更便宜)没用到缓存时,后两项就是 0,简化成最常见的一句:输入 token × 输入单价 + 输出 token × 输出单价。
几个关键点:
- 按实际用量扣——没有月费、没有"包月不用也扣",调一次扣一次
- 跟时间、次数无关——慢慢调和飞快调,只要 token 一样,钱就一样
- 预付费、不透支——余额扣完为止,不够了直接报错(402),不会让你欠账
至于单价怎么定、为什么同一个模型有几个价格,那是 倍率 和 渠道 决定的,这页先不展开。
🔍 怎么知道自己用了多少
不用猜,控制台都给你记着:
- 登录控制台 →「日志」(使用记录页)
- 每一条调用都列了 模型、input token、output token、这次扣了多少
- 想看整体趋势就看余额变化曲线
拿不准花销,先小额跑两天
新手最容易在"我一个月得充多少"上要么严重高估、要么严重低估。最靠谱的办法不是算,是充一点点先跑两三天,回头看日志里真实的消耗速度,再决定要不要加充。
💡 顺手记住的省钱直觉
- 探索、测试阶段用便宜档模型(mini / haiku / flash 这类),跑通了再考虑要不要换贵的
- 让模型别输出太长——很多客户端能设 "max tokens" 限制单次回答长度
- 长对话定期清掉历史(很多工具有
/clear),否则每轮都把越堆越长的历史当 input 重新计费
更系统的省钱招见 价格说明 § 怎么省钱。
🚀 下一步
- 模型档位与上下文窗口——token 装不下会怎样
- 倍率与计费公式——单价是怎么定出来的
- 价格说明——完整的价格机制