Skip to content

Token 与计费单位

一句话

Token 是模型读字、写字的"最小计量单位",本站所有费用都按 token 算。 看懂这一页,你就明白账单上的数字是怎么来的。

🧩 Token 到底是什么

你给模型发的每一句话、模型回你的每一段字,进到模型里都会先被切成一小块一小块,每一块就叫一个 token

"token" 中文怎么叫

国内现在多把 token 译作 「词元」(也有叫「标记」「词块」的),各大厂商的中文文档里基本都用"词元"这个词。所以你看到"词元数""按词元计费""词元上限",说的都是 token,是同一个东西。

打个比方:token(词元)之于模型,就像"字"之于我们——但它切得比"字"更碎一点,有时一个词是一个 token,有时一个长单词会被拆成两三个 token。

不需要自己去数 token,只要知道:字越多 = token 越多 = 花得越多

大概多少字算一个 token

只是直觉级参考,别当精确公式:

内容大概的 token 量
1000 个英文单词≈ 1300–1500 token
1000 个汉字≈ 1500–2000 token
一条普通的微信消息(二三十字)几十个 token
一篇千字短文一两千 token

中文通常比英文"更费 token"一点,因为中文字符切得更碎。

↔️ Input 和 Output 是两笔账

一次调用其实分两段,分开计价

名称是什么谁产生的
Input token(输入)你发过去的内容——问题、对话历史、贴进去的文件、系统提示词全算
Output token(输出)模型生成回给你的内容模型

Output 通常比 Input 贵 3–5 倍

绝大多数模型,生成一个字的成本远高于读一个字,所以 output 单价往往是 input 的好几倍。

这带来一个很实用的省钱直觉:"长问题 + 短回答" 比 "短问题 + 长回答" 便宜得多。让模型啰嗦输出,比让它读一大段资料更烧钱。

🗄️ 还有一类:缓存 token(重复内容更便宜)

有些模型支持提示缓存(prompt caching):如果你多次调用里有一大段完全相同的开头(比如固定的系统提示词、反复带上的长文档),模型可以把这段"记住",后续命中时这部分按折扣价计,省钱又省时间。

它把 token 又细分出两笔:

名称是什么计价
缓存写入(cache write)第一次把这段内容存进缓存比普通输入略贵一点(要额外存一份)
缓存读取(cache read / 命中)后续调用命中了缓存的这段比普通输入便宜很多(常见只要一到两成)

所以完整地看,一次调用的 token 可能落在四类里:输入、输出、缓存写入、缓存读取。普通用户不用刻意管缓存——命中时账单自然更便宜;想理解每类差多少钱,见 倍率与计费公式 § 四种计量的单价

缓存不用你手动开(多数情况)

OpenAI 兼容路径下缓存多为上游自动生效,不需要你配置;Anthropic 原生路径部分场景要在请求里标记要缓存的部分。命中与否、省了多少,以控制台日志 / 上游返回的 usage 为准(详见 进阶技巧)。

🧮 费用怎么算出来的

每次调用的扣费,完整地写是四类各算各的:

这次花的钱 = 输入 token × 输入单价 + 输出 token × 输出单价
           + 缓存写入 token × 写入单价 + 缓存读取 token × 读取单价(命中时更便宜)

没用到缓存时,后两项就是 0,简化成最常见的一句:输入 token × 输入单价 + 输出 token × 输出单价

几个关键点:

  • 按实际用量扣——没有月费、没有"包月不用也扣",调一次扣一次
  • 跟时间、次数无关——慢慢调和飞快调,只要 token 一样,钱就一样
  • 预付费、不透支——余额扣完为止,不够了直接报错(402),不会让你欠账

至于单价怎么定、为什么同一个模型有几个价格,那是 倍率渠道 决定的,这页先不展开。

🔍 怎么知道自己用了多少

不用猜,控制台都给你记着:

  1. 登录控制台 →「日志」(使用记录页
  2. 每一条调用都列了 模型、input token、output token、这次扣了多少
  3. 想看整体趋势就看余额变化曲线

拿不准花销,先小额跑两天

新手最容易在"我一个月得充多少"上要么严重高估、要么严重低估。最靠谱的办法不是算,是充一点点先跑两三天,回头看日志里真实的消耗速度,再决定要不要加充。

💡 顺手记住的省钱直觉

  • 探索、测试阶段用便宜档模型(mini / haiku / flash 这类),跑通了再考虑要不要换贵的
  • 让模型别输出太长——很多客户端能设 "max tokens" 限制单次回答长度
  • 长对话定期清掉历史(很多工具有 /clear),否则每轮都把越堆越长的历史当 input 重新计费

更系统的省钱招见 价格说明 § 怎么省钱

🚀 下一步