¥Tokens 官方价格查看器

新手指南

大模型 API 计费入门:Token、缓存、批处理与成本估算

厂商报价页上的 “$/1M tokens”“缓存命中”“批处理” 到底是什么意思?这一页把计费口径讲清楚,最后给一个能直接套用的月成本公式。

目录
  1. Token 和字数怎么换算
  2. 输入价、输出价、缓存价
  3. 缓存命中能省多少
  4. 批处理价与低谷价
  5. 月成本公式与示例
  6. 按场景挑模型
  7. 常见问题

1. Token 和字数怎么换算

Token 是模型读写文本的最小单位,也是唯一的计费单位。它不等于“字”,也不等于“词”。经验值:英文 1 个单词约 1.3 个 token;中文 1 个汉字约 1–2 个 token(生僻字、标点和代码符号会更碎)。

token 数约等于汉字约等于英文典型场景
1K500–700 字约 750 词一条提示词或一段客服对话
32K1.6–2.1 万字约 2.4 万词一篇长报告、一份需求文档
128K6.4–8.5 万字约 9.6 万词一本书、一个中型代码库片段
200K10–13 万字约 15 万词多份合同、跨文件代码审查
1M50–70 万字约 75 万词整套文档库、超长会议记录

上下文窗口(context window)指一次请求里输入加输出能容纳的上限。超过上限要么被截断,要么报错,要么触发更贵的长上下文档位,所以选模型前先确认你的文档有多长。

2. 输入价、输出价、缓存价分别是什么

项目含义什么时候产生
输入价模型读进去的内容,包括系统提示词、历史对话、上传的文档每次请求都会产生
输出价模型写出来的内容每次请求都会产生,单价通常是输入的 3–5 倍
缓存写入第一次把这段内容存进缓存的钱只在首次写入时收一次
缓存命中重复使用已缓存内容的钱,通常是输入价的 10%–25%同一段提示词被再次使用时
批处理价不要求实时返回的折扣价,通常为标准价的 50% 左右任务提交到批处理队列时
低谷价厂商在流量空闲时段给的折扣请求落在指定时间窗口时

看到 “US$3 / 1M tokens” 要知道它的意思是:每处理 100 万个 token 收 3 美元。差距看起来小,量一大就会放大成数量级差异。

3. 缓存命中能省多少

缓存(prompt caching)的思路是:同一段前缀内容不必每次重新计费。命中价普遍只有标准输入价的 10%–25%,而写入价可能略高于标准输入价,所以关键变量是命中率。

举个例子:某模型输入价 ¥10 / 1M,缓存命中价 ¥1 / 1M,你每月发送 2000 万输入 token,其中 80% 命中缓存。不缓存时输入成本 ¥200;用上缓存后是 1600 万 × ¥1 + 400 万 × ¥10 = ¥16 + ¥40 = ¥56,只剩 28%。命中率越高,收益越大。

缓存友好的场景:固定系统提示词的客服机器人、反复上传同一份 SOP 的问答、代码 Agent 反复带同一份仓库上下文、多轮对话里重复的历史记录。缓存命中率和缓存写入率可以直接填进首页用量估算器

4. 批处理价与低谷价

批处理价换的是时间:把任务丢进队列,厂商在空闲算力上跑,价格通常打五折,适合翻译、打标、摘要、数据清洗这类不需要即时返回的活。

低谷价换的是时段。以 DeepSeek 为例,低谷时段的价格约为高峰时段的一半,国内不少厂商也有类似的闲时档。把定时任务挪到低谷时段,是不改代码就能省钱的少数手段之一。

5. 月成本公式与示例

基线公式(不含缓存和批处理折扣):

月成本 = 月输入 tokens ÷ 100 万 × 输入单价 + 月输出 tokens ÷ 100 万 × 输出单价

再按折扣调整:命中缓存的那部分输入按缓存命中价算,走批处理的那部分按批处理价算,落在低谷时段的按低谷价算。三种折扣通常不能叠加,取对各自任务最有利的那个。

以当前综合单价最低的官方模型 GLM-4.7-Flash 为例:假设每月 2000 万输入 + 800 万输出 token,按标准价折算约 ¥0.000。同样一份用量换成旗舰模型,账单会相差几倍到几十倍——这就是为什么选型前必须先算一遍。

6. 按场景挑模型

场景主要成本项选型方向
分类 / 抽取 / 翻译输入价低价档,优先看输入价和批量折扣
长文档问答输入价 + 缓存命中率长上下文 + 缓存命中价低的模型
代码生成 / 长文写作输出价输出价便宜的中高档模型,别只看输入价
实时客服输入价 + 延迟轻量档 + 缓存,别用旗舰模型撑流量
离线批处理批处理价支持批处理或低谷价的厂商

跨厂商排名见最便宜大模型排行,两个具体模型的取舍见模型对比,单个厂商的全线价格见厂商价格总览

7. 常见问题

Token 是什么?和字数怎么换算?
Token 是模型处理文本的最小计费单位。英文约 1 个单词 = 1.3 个 token,中文约 1 个汉字 = 1–2 个 token。常见口诀:1K tokens 约等于 500–700 个汉字,1M tokens 约等于 50 万–70 万汉字。
输入价和输出价为什么要分开算?
输入是模型读进去的内容(提示词、文档、历史对话),输出是它写出来的内容。输出通常贵 3–5 倍,因为逐字生成更耗算力。长文生成和代码生成场景的账单主要由输出价决定。
缓存命中价能省多少钱?
缓存命中价一般是标准输入价的 10%–25%。固定系统提示词、重复上传同一份长文档、多轮对话里反复带上下文,都是高命中率的典型场景,命中率 70% 以上时输入成本能砍掉一大半。
批处理和低谷价是什么?
批处理价是“不要求实时返回”的折扣价,通常为标准价的 50% 左右;低谷价是厂商在流量空闲时段给的折扣。两者都要求任务能接受延迟,适合离线跑数据、批量翻译、定期摘要。
免费额度能一直用吗?
不能。免费额度、试用赠金和促销券都有期限或数量限制,也不适合作为生产环境的成本基线。本站排名只用官方公开标准价,把免费额度排除在外。
怎么估算每个月的 API 花销?
月成本 =(每月输入 tokens ÷ 100 万 × 输入单价)+(每月输出 tokens ÷ 100 万 × 输出单价),再按缓存命中率和批量任务占比打折。首页的用量估算器已经把这几步做成表单,填完直接出人民币月成本排名。

本站只收录官方第一方公开标价,每条价格都带官方来源 URL 和核对日期。企业协议价、促销券、免费额度和中转站价格不参与排名,实际账单以厂商为准。