新手指南
大模型 API 计费入门:Token、缓存、批处理与成本估算
厂商报价页上的 “$/1M tokens”“缓存命中”“批处理” 到底是什么意思?这一页把计费口径讲清楚,最后给一个能直接套用的月成本公式。
1. Token 和字数怎么换算
Token 是模型读写文本的最小单位,也是唯一的计费单位。它不等于“字”,也不等于“词”。经验值:英文 1 个单词约 1.3 个 token;中文 1 个汉字约 1–2 个 token(生僻字、标点和代码符号会更碎)。
| token 数 | 约等于汉字 | 约等于英文 | 典型场景 |
|---|---|---|---|
| 1K | 500–700 字 | 约 750 词 | 一条提示词或一段客服对话 |
| 32K | 1.6–2.1 万字 | 约 2.4 万词 | 一篇长报告、一份需求文档 |
| 128K | 6.4–8.5 万字 | 约 9.6 万词 | 一本书、一个中型代码库片段 |
| 200K | 10–13 万字 | 约 15 万词 | 多份合同、跨文件代码审查 |
| 1M | 50–70 万字 | 约 75 万词 | 整套文档库、超长会议记录 |
上下文窗口(context window)指一次请求里输入加输出能容纳的上限。超过上限要么被截断,要么报错,要么触发更贵的长上下文档位,所以选模型前先确认你的文档有多长。
2. 输入价、输出价、缓存价分别是什么
| 项目 | 含义 | 什么时候产生 |
|---|---|---|
| 输入价 | 模型读进去的内容,包括系统提示词、历史对话、上传的文档 | 每次请求都会产生 |
| 输出价 | 模型写出来的内容 | 每次请求都会产生,单价通常是输入的 3–5 倍 |
| 缓存写入 | 第一次把这段内容存进缓存的钱 | 只在首次写入时收一次 |
| 缓存命中 | 重复使用已缓存内容的钱,通常是输入价的 10%–25% | 同一段提示词被再次使用时 |
| 批处理价 | 不要求实时返回的折扣价,通常为标准价的 50% 左右 | 任务提交到批处理队列时 |
| 低谷价 | 厂商在流量空闲时段给的折扣 | 请求落在指定时间窗口时 |
看到 “US$3 / 1M tokens” 要知道它的意思是:每处理 100 万个 token 收 3 美元。差距看起来小,量一大就会放大成数量级差异。
3. 缓存命中能省多少
缓存(prompt caching)的思路是:同一段前缀内容不必每次重新计费。命中价普遍只有标准输入价的 10%–25%,而写入价可能略高于标准输入价,所以关键变量是命中率。
举个例子:某模型输入价 ¥10 / 1M,缓存命中价 ¥1 / 1M,你每月发送 2000 万输入 token,其中 80% 命中缓存。不缓存时输入成本 ¥200;用上缓存后是 1600 万 × ¥1 + 400 万 × ¥10 = ¥16 + ¥40 = ¥56,只剩 28%。命中率越高,收益越大。
缓存友好的场景:固定系统提示词的客服机器人、反复上传同一份 SOP 的问答、代码 Agent 反复带同一份仓库上下文、多轮对话里重复的历史记录。缓存命中率和缓存写入率可以直接填进首页用量估算器。
4. 批处理价与低谷价
批处理价换的是时间:把任务丢进队列,厂商在空闲算力上跑,价格通常打五折,适合翻译、打标、摘要、数据清洗这类不需要即时返回的活。
低谷价换的是时段。以 DeepSeek 为例,低谷时段的价格约为高峰时段的一半,国内不少厂商也有类似的闲时档。把定时任务挪到低谷时段,是不改代码就能省钱的少数手段之一。
5. 月成本公式与示例
基线公式(不含缓存和批处理折扣):
月成本 = 月输入 tokens ÷ 100 万 × 输入单价 + 月输出 tokens ÷ 100 万 × 输出单价
再按折扣调整:命中缓存的那部分输入按缓存命中价算,走批处理的那部分按批处理价算,落在低谷时段的按低谷价算。三种折扣通常不能叠加,取对各自任务最有利的那个。
以当前综合单价最低的官方模型 GLM-4.7-Flash 为例:假设每月 2000 万输入 + 800 万输出 token,按标准价折算约 ¥0.000。同样一份用量换成旗舰模型,账单会相差几倍到几十倍——这就是为什么选型前必须先算一遍。
6. 按场景挑模型
| 场景 | 主要成本项 | 选型方向 |
|---|---|---|
| 分类 / 抽取 / 翻译 | 输入价 | 低价档,优先看输入价和批量折扣 |
| 长文档问答 | 输入价 + 缓存命中率 | 长上下文 + 缓存命中价低的模型 |
| 代码生成 / 长文写作 | 输出价 | 输出价便宜的中高档模型,别只看输入价 |
| 实时客服 | 输入价 + 延迟 | 轻量档 + 缓存,别用旗舰模型撑流量 |
| 离线批处理 | 批处理价 | 支持批处理或低谷价的厂商 |
跨厂商排名见最便宜大模型排行,两个具体模型的取舍见模型对比,单个厂商的全线价格见厂商价格总览。
7. 常见问题
- Token 是什么?和字数怎么换算?
- Token 是模型处理文本的最小计费单位。英文约 1 个单词 = 1.3 个 token,中文约 1 个汉字 = 1–2 个 token。常见口诀:1K tokens 约等于 500–700 个汉字,1M tokens 约等于 50 万–70 万汉字。
- 输入价和输出价为什么要分开算?
- 输入是模型读进去的内容(提示词、文档、历史对话),输出是它写出来的内容。输出通常贵 3–5 倍,因为逐字生成更耗算力。长文生成和代码生成场景的账单主要由输出价决定。
- 缓存命中价能省多少钱?
- 缓存命中价一般是标准输入价的 10%–25%。固定系统提示词、重复上传同一份长文档、多轮对话里反复带上下文,都是高命中率的典型场景,命中率 70% 以上时输入成本能砍掉一大半。
- 批处理和低谷价是什么?
- 批处理价是“不要求实时返回”的折扣价,通常为标准价的 50% 左右;低谷价是厂商在流量空闲时段给的折扣。两者都要求任务能接受延迟,适合离线跑数据、批量翻译、定期摘要。
- 免费额度能一直用吗?
- 不能。免费额度、试用赠金和促销券都有期限或数量限制,也不适合作为生产环境的成本基线。本站排名只用官方公开标准价,把免费额度排除在外。
- 怎么估算每个月的 API 花销?
- 月成本 =(每月输入 tokens ÷ 100 万 × 输入单价)+(每月输出 tokens ÷ 100 万 × 输出单价),再按缓存命中率和批量任务占比打折。首页的用量估算器已经把这几步做成表单,填完直接出人民币月成本排名。
本站只收录官方第一方公开标价,每条价格都带官方来源 URL 和核对日期。企业协议价、促销券、免费额度和中转站价格不参与排名,实际账单以厂商为准。