LLM API 定价怎么比较:输入、输出与缓存 token 成本怎么看
LLM API 的账单不是按"每次调用"算的,而是按 token 分项计价:输入 token、输出 token、缓存输入 token 各有单价,同一模型这三项可能相差几十倍。要判断一个模型贵不贵,先看你的调用里输入和输出各占多少,再拿对应单价去乘。下面按"计费项 → 横向对比 → 估算月费 → 避坑"的顺序讲清楚。
三类计费项,先分清再比价
| 计费项 | 含义 | 典型特征 |
|---|---|---|
| 输入 token | 你发给模型的提示词、上下文、文档 | 单价通常最低 |
| 输出 token | 模型生成的内容 | 单价通常是输入的数倍 |
| 缓存输入 token | 重复使用的上下文被缓存后命中 | 单价常低于普通输入 |
以价格页上的数据为例,DeepSeek 的 deepseek-v4.1-flash 输入 $0.003、输出 $0.180、缓存输入 $0.0028(每百万 token)——输出单价是输入的 60 倍。而 deepseek-chat 输入 $0.014、输出 $0.028,输出只有输入的 2 倍。这说明"哪个模型便宜"没有统一答案,取决于你的输入输出比例。
判断方法:如果你的场景是长文档问答(输入巨大、输出很短),输入单价权重高;如果是内容生成(输入短、输出长),输出单价才是主要成本。
按每百万 token 单价横向对比
价格页把主流提供商的模型放在同一张表里,按输入单价从低到高排列。以下是页面中出现的部分模型(单位:美元/百万 token):
| 模型 | 上下文 | 输入 | 输出 | 缓存输入 |
|---|---|---|---|---|
| minimax-m2.7 | 205K | $0.000 | $0.000 | $0.036 |
| deepseek-v4-flash | 1.0M | $0.000 | $0.000 | $0.0056 |
| glm-5.3-flash | 1.0M | $0.000 | $0.000 | $0.0135 |
| deepseek-v4.1-flash | 1.0M | $0.003 | $0.180 | $0.0028 |
| deepseek-chat | 164K | $0.014 | $0.028 | — |
| gpt-oss-20b | 131K | $0.018 | $0.090 | $0.003 |
| mistral-nemo | 131K | $0.018 | $0.030 | $0.0028 |
| gpt-oss-120b | 131K | $0.030 | $0.100 | $0.0045 |
| nova-micro-v1 | 128K | $0.035 | $0.140 | — |
几个值得注意的点:
- 输入为 $0.000 不等于完全免费。这类模型往往靠缓存输入或其他方式计费,且能力指标(如 GPQA)差异很大,不能只看价格。
- 上下文窗口和价格不成正比。
deepseek-v4-flash有 1.0M 上下文且输入标价 $0.000,而nova-micro-v1只有 128K 却要 $0.035。窗口大不代表贵,但大窗口模型处理长输入时总 token 数会更高。 - 缓存输入单价普遍低于普通输入,适合有固定系统提示词或重复上下文的场景。
估算你自己的月度费用
公式很简单:
月费 ≈ (月输入 token 数 × 输入单价) + (月输出 token 数 × 输出单价) + (缓存命中 token 数 × 缓存单价)
具体步骤:
- 统计一次典型调用的平均输入 token 和输出 token(可用 tokenizer 或 API 返回的 usage 字段)。
- 乘以日均调用次数,得到日 token 量,再乘 30 得月量。
- 换算成"每百万 token"单位,套用上表单价。
举例:假设某客服机器人每天 5000 次调用,每次输入 2000 token、输出 300 token。
- 月输入 = 5000 × 2000 × 30 = 3 亿 token = 300 百万
- 月输出 = 5000 × 300 × 30 = 4500 万 token = 45 百万
用 deepseek-chat(输入 $0.014、输出 $0.028):300 × 0.014 + 45 × 0.028 = $4.2 + $1.26 = $5.46/月
用 deepseek-v4.1-flash(输入 $0.003、输出 $0.180):300 × 0.003 + 45 × 0.180 = $0.9 + $8.1 = $9.0/月
输入输出比例一变,便宜的模型就换了。这就是为什么必须按自己的场景算,而不是看排行榜。
用能力筛选缩小候选范围
价格页支持按能力过滤,包括:工具调用(391 个模型)、视觉(212)、推理(126)、网页搜索(107)、PDF 输入(99)、缓存(210)、音频输入(26)、开源(294)。
用法:先确定你的硬性需求(比如必须支持工具调用 + 缓存),筛掉不满足的模型,再在剩下的里比价格。否则容易选到单价极低但缺少关键能力的模型,返工成本远高于省下的 token 费。
常见卡点
- 只看单价忽略能力:$0.000 的模型可能在 MMLU、GPQA 等指标上明显偏低,任务复杂时错误率上升,实际成本反而更高。
- 用过期报价做决策:价格页标注"Last updated: October 4, 2026",并注明价格来自 OpenAI、Anthropic 等官方渠道、每日更新。模型价格变动频繁,决策前应回到来源页确认当前数字。
- 忽略缓存收益:有重复上下文的场景,启用缓存后输入成本可显著下降,选型时应把"是否支持缓存"纳入考量。
- 混淆上下文窗口与计费:窗口大意味着单次能塞更多 token,但每个 token 都要付费,长上下文场景要单独估算。
一句话选择逻辑
输入为主、追求低单价 → 看输入列最低且支持缓存的模型;输出为主 → 重点比输出单价;需要工具调用/视觉/推理 → 先用能力筛选,再在候选里比价。任何情况下,都用自己的输入输出比例套公式算一遍,而不是直接抄排行榜。