LLM API 定价怎么比较:输入、输出与缓存 token 成本怎么看

LLM API 的账单不是按"每次调用"算的,而是按 token 分项计价:输入 token、输出 token、缓存输入 token 各有单价,同一模型这三项可能相差几十倍。要判断一个模型贵不贵,先看你的调用里输入和输出各占多少,再拿对应单价去乘。下面按"计费项 → 横向对比 → 估算月费 → 避坑"的顺序讲清楚。

三类计费项,先分清再比价

计费项 含义 典型特征
输入 token 你发给模型的提示词、上下文、文档 单价通常最低
输出 token 模型生成的内容 单价通常是输入的数倍
缓存输入 token 重复使用的上下文被缓存后命中 单价常低于普通输入

以价格页上的数据为例,DeepSeek 的 deepseek-v4.1-flash 输入 $0.003、输出 $0.180、缓存输入 $0.0028(每百万 token)——输出单价是输入的 60 倍。而 deepseek-chat 输入 $0.014、输出 $0.028,输出只有输入的 2 倍。这说明"哪个模型便宜"没有统一答案,取决于你的输入输出比例。

判断方法:如果你的场景是长文档问答(输入巨大、输出很短),输入单价权重高;如果是内容生成(输入短、输出长),输出单价才是主要成本。

按每百万 token 单价横向对比

价格页把主流提供商的模型放在同一张表里,按输入单价从低到高排列。以下是页面中出现的部分模型(单位:美元/百万 token):

模型 上下文 输入 输出 缓存输入
minimax-m2.7 205K $0.000 $0.000 $0.036
deepseek-v4-flash 1.0M $0.000 $0.000 $0.0056
glm-5.3-flash 1.0M $0.000 $0.000 $0.0135
deepseek-v4.1-flash 1.0M $0.003 $0.180 $0.0028
deepseek-chat 164K $0.014 $0.028 —
gpt-oss-20b 131K $0.018 $0.090 $0.003
mistral-nemo 131K $0.018 $0.030 $0.0028
gpt-oss-120b 131K $0.030 $0.100 $0.0045
nova-micro-v1 128K $0.035 $0.140 —

几个值得注意的点:

  • 输入为 $0.000 不等于完全免费。这类模型往往靠缓存输入或其他方式计费,且能力指标(如 GPQA)差异很大,不能只看价格。
  • 上下文窗口和价格不成正比。deepseek-v4-flash 有 1.0M 上下文且输入标价 $0.000,而 nova-micro-v1 只有 128K 却要 $0.035。窗口大不代表贵,但大窗口模型处理长输入时总 token 数会更高。
  • 缓存输入单价普遍低于普通输入,适合有固定系统提示词或重复上下文的场景。

估算你自己的月度费用

公式很简单:

月费 ≈ (月输入 token 数 × 输入单价) + (月输出 token 数 × 输出单价) + (缓存命中 token 数 × 缓存单价)

具体步骤:

  1. 统计一次典型调用的平均输入 token 和输出 token(可用 tokenizer 或 API 返回的 usage 字段)。
  2. 乘以日均调用次数,得到日 token 量,再乘 30 得月量。
  3. 换算成"每百万 token"单位,套用上表单价。

举例:假设某客服机器人每天 5000 次调用,每次输入 2000 token、输出 300 token。

  • 月输入 = 5000 × 2000 × 30 = 3 亿 token = 300 百万
  • 月输出 = 5000 × 300 × 30 = 4500 万 token = 45 百万

用 deepseek-chat(输入 $0.014、输出 $0.028):300 × 0.014 + 45 × 0.028 = $4.2 + $1.26 = $5.46/月

用 deepseek-v4.1-flash(输入 $0.003、输出 $0.180):300 × 0.003 + 45 × 0.180 = $0.9 + $8.1 = $9.0/月

输入输出比例一变,便宜的模型就换了。这就是为什么必须按自己的场景算,而不是看排行榜。

用能力筛选缩小候选范围

价格页支持按能力过滤,包括:工具调用(391 个模型)、视觉(212)、推理(126)、网页搜索(107)、PDF 输入(99)、缓存(210)、音频输入(26)、开源(294)。

用法:先确定你的硬性需求(比如必须支持工具调用 + 缓存),筛掉不满足的模型,再在剩下的里比价格。否则容易选到单价极低但缺少关键能力的模型,返工成本远高于省下的 token 费。

常见卡点

  • 只看单价忽略能力:$0.000 的模型可能在 MMLU、GPQA 等指标上明显偏低,任务复杂时错误率上升,实际成本反而更高。
  • 用过期报价做决策:价格页标注"Last updated: October 4, 2026",并注明价格来自 OpenAI、Anthropic 等官方渠道、每日更新。模型价格变动频繁,决策前应回到来源页确认当前数字。
  • 忽略缓存收益:有重复上下文的场景,启用缓存后输入成本可显著下降,选型时应把"是否支持缓存"纳入考量。
  • 混淆上下文窗口与计费:窗口大意味着单次能塞更多 token,但每个 token 都要付费,长上下文场景要单独估算。

一句话选择逻辑

输入为主、追求低单价 → 看输入列最低且支持缓存的模型;输出为主 → 重点比输出单价;需要工具调用/视觉/推理 → 先用能力筛选,再在候选里比价。任何情况下,都用自己的输入输出比例套公式算一遍,而不是直接抄排行榜。

pricepertoken.com
Free LLM API pricing comparison. Compare GPT-5, Claude, Gemini & DeepSeek costs instantly. Updated daily with official prices from OpenAI, Anthropi...